python Pandas去重复数据drop_duplicates详解

原創

2020-06-08 20:58

pandas.DataFrame.drop_duplicates

DataFrame.drop_duplicates(subset=None, keep='first', inplace=False)

参数

subset： 列标签，可选
keep： {‘first’, ‘last’, False}, 默认值 ‘first’
- first： 删除第一次出现的重复项。
- last： 删除重复项，除了最后一次出现。
- False： 删除所有重复项。
inplace：布尔值，默认为False，是否删除重复项或返回副本

返回：重复数据删除： DataFrame

示例：

data = pd.DataFrame({'A':['a','b','c','c'],'B':[1,1,2,2]})

	A	B
0	a	1
1	b	1
2	c	2
3	c	2

data.drop_duplicates(subset=None,keep='first',inplace=True)

	A	B
0	a	1
1	b	1
2	c	2

data.drop_duplicates(subset=['B'],keep='first',inplace=True)

	A	B
0	a	1
2	c	2

subset=None表示考虑所有列，将这所以列对应值相同的行进行去重。默认值None。subset=[‘B’]表示只考虑’B’这列，将B列对应值相同的行进行去重。

keep='first’表示保留第一次出现的重复行，是默认值。keep另外两个取值为"last"和False，分别表示保留最后一次出现的重复行和去除所有重复行。

inplace=True表示直接在原来的DataFrame上删除重复项，而默认值False表示生成一个副本。

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Python函数与模块的精髓与高级特性

本文分享自華爲雲社區《Python函數與模塊的精髓與高級特性》，作者：檸檬味擁抱。 Python 是一種功能強大的編程語言，擁有豐富的函數和模塊，使得開發者能夠輕鬆地構建複雜的應用程序。本文將介紹 Python 中函數和模塊的基本使用方法，

2024-05-14 11:00:07

利用pyinstaller打包Python程序为一个可执行文件

有時，Python發佈的程序需要被打包爲一個文件夾、甚至一個文件發佈。目前（2020）最佳的策略是使用pyinstaller。 pyinstaller不僅支持打包整個運行環境到一個可執行文件，而且還支持加密。但唯一的問題是，必須依賴

2024-05-14 02:04:34

做开发我是认真的！要么不做，要么全力以赴 | 每日趣闻

戳一戳小程序查看更多！往期趣聞 ☞你拖後腿了嗎？11 月份程序員工資出爐~ | 每日趣聞 ☞計算機專業會修電腦實錘！| 每日趣聞 ☞IT 行業這麼廣，你的職業規劃是什麼？| 每日趣聞 ☞奔潰啦~希望 Python 可

2024-05-14 01:47:34

anaconda和pycharm区别是什么?Python学习!

　　學習Python的人，肯定聽說過anaconda和pycharm，但是很多人傻傻分不清楚它們之間有什麼區別，今天小編帶大家好好了解一下。　　Anaconda：　　是一個Python發行版，包含了conda、Python等180多個

2024-05-14 01:47:30

Python爬虫进阶必备 | MD5 hash 案例解析汇总（一）

上次鹹魚對關於 MD5 hash 的JS加密方法做了總結，這次把鹹魚遇到的 MD5 hash 的案例做了彙總，這個彙總系列會持續更新，攢到一定數量的網站就發一次。關於 MD5 HASH 的處理可以參考下面這篇文章： Python爬蟲進

2024-05-14 01:40:15

为程序员和新手准备的 8 大 Python 工具

Python 是一種開源編程語言，用於 Web 編程、數據科學、人工智能和許多科學應用。學習 Python 使程序員能夠專注於解決問題，而不是專注於語法，其豐富的庫賦予它完成偉大任務所需的力量。 1) IDLE 安裝 Python 時

2024-05-14 01:06:43

【编测编学】自动化测试面试必背（上）

1、你會封裝自動化測試框架嗎？這個問得最多，甚至有很多公司直接寫在招聘要求中。自動化框架主要的核心框架就是分層+PO模式：分別爲：基礎封裝層BasePage，PO頁面對象層，TestCase測試用例層。然後再加上日誌處理模塊，ini配置文

2024-05-14 00:41:23

树莓派真是个让人欲罢不能的“小妖精”

大晚上不睡覺、枸杞泡起來@我一個月之前、自從入了樹莓派4b 8g板之後、就無法自拔，上班除了開發業務代碼和搭建內部UI組件庫之外，就是不亦樂乎的學習docker、mysql、mongodb、php、python、frp等，採購了阿里雲E

2024-05-14 00:37:28

用python画出全球疫情趋势变化图

前言文的文字及圖片來源於網絡,僅供學習、交流使用,不具有任何商業用途,版權歸原作者所有,如有問題請及時聯繫我們以作處理。作者：謙睿科技 PS：如有需要Python學習資料的小夥伴可以加點擊下方鏈接自行獲取http://t.cn/A6Z

2024-05-14 00:03:10

复杂嵌套字典数据结构处理库-glom

經常遇到複雜嵌套字典數據，我們都是這麼寫的 data = {'a': {'b': {'c': 'd'}}} print(data['a']['b']['c']) 'd' 然後經常遇到這個bug data2 = {'a': {'b':

2024-05-13 22:58:14

我宣布，这是我找到的史上AI最全论文体系！

在碎片化閱讀充斥眼球的時代，越來越少的人會去關注每篇論文背後的探索和思考。搞AI，不少人都進入一個誤區，那就是隻鑽研自己的代碼是否精進，而沒有注意提升自己的閱讀能力。實際上，一個專業的學術研究員或者AI研究員可能需要花費幾百個小

2024-05-13 21:33:50

OpenCV入门基础操作（一）----图像的读取、显示与保存

OPENCV入門基礎操作（一）圖像的處理讀入圖像顯示圖像保存圖像直接上整體代碼示例圖像的處理剛開始學習opencv 圖像處理，希望能夠多多提出寶貴意見，我也在一步一步地學習下去。堅持！這一講主要就是一

2024-05-13 21:17:21

探索未知：风靡硅谷开发者的 Unstructured Data Meetup 即将登陆中国l

“最硅谷”的 Unstructured Data Meetup 即將來襲！衆所周知，AI 三要素包括：算力、算法和數據。數據的價值愈發凸顯，而其中非結構化數據更是備受關注。IDC 預測，到 2025 年，全球數據總量中將有超過 80% 的

2024-05-13 21:25:35

从 Oracle 到 TiDB，国有大行打造本地生活 APP 新体验

導讀本文介紹了某國有大行推出的本地生活服務類 APP 在數字時代的創新應用實踐。該 APP 利用金融科技和互聯網平臺模式，打造“金融+非金融”的線上生態服務平臺，滿足了用戶多樣化的生活需求。爲應對用戶增長和數據量增加帶來的挑戰，該 APP

2024-05-13 11:16:38

PingCAP 戴涛：构建面向未来的金融核心系统

作者：戴濤導讀近日，平凱星辰解決方案技術部總經理戴濤在 2024 數據技術嘉年華活動中，做了主題爲“構建面向未來的金融核心系統”的分享，本文爲戴濤演講實錄的全文。文章分析了中國金融行業的發展趨勢，並且基於這些趨勢對數據庫選擇從架構、運

2024-05-13 11:16:37

24小時熱門文章

最新文章

最新評論文章