首页 > 资讯 > 后端开发 > Python >怎么使用Python pandas找出删除重复的数据

759

分享到

怎么使用Python pandas找出删除重复的数据

2023-07-02 17:07:02 759人浏览泡泡鱼

Python 官方文档：入门教程 => 点击学习

摘要

这篇文章主要介绍了怎么使用python pandas找出删除重复的数据的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇怎么使用Python pandas找出删除重复的数据文章都会有所收获，下面

这篇文章主要介绍了怎么使用python pandas找出删除重复的数据的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇怎么使用Python pandas找出删除重复的数据文章都会有所收获，下面我们一起来看看吧。

前言

当我们使用pandas处理数据的时候，经常会遇到数据重复的问题，如何找出重复数据进而分析重复原因，或者如何直接删除重复的数据是一个关键的步骤，pandas提供了很方便的方法：duplicated()和drop_duplicates()。

一、duplicated()

duplicated()可以被用在DataFrame的三种情况下，分别是pandas.DataFrame.duplicated、pandas.Series.duplicated和pandas.Index.duplicated。他们的用法都类似，前两个会返回一个布尔值的Series，最后一个会返回一个布尔值的numpy.ndarray。

DataFrame.duplicated(subset=None, keep=‘first’)

subset：默认为None，需要标记重复的标签或标签序列

keep：默认为‘first’，如何标记重复标签

first：将除第一次出现以外的重复数据标记为True
last：将除最后一次出现以外的重复数据标记为True
False：将所有重复的项都标记为True（不管是不是第一次出现）

Series.duplicated(keep=‘first’)

keep：与DataFrame.duplicated的keep相同

Index.duplicated(keep=‘first’)

keep：与DataFrame.duplicated的keep相同

例子：

import pandas as pddf = pd.DataFrame({    'brand': ['Yum Yum', 'Yum Yum', 'Indomie', 'Indomie', 'Indomie'],    'style': ['cup', 'cup', 'cup', 'pack', 'pack'],    'rating': [4, 4, 3.5, 15, 5]})df

brand style rating
0 Yum Yum cup 4.0
1 Yum Yum cup 4.0
2 Indomie cup 3.5
3 Indomie pack 15.0
4 Indomie pack 5.0

df.duplicated()

0 False
1 True
2 False
3 False
4 False
dtype: bool

df.duplicated(keep='last')

0 True
1 False
2 False
3 False
4 False
dtype: bool

df.duplicated(keep=False)

0 True
1 True
2 False
3 False
4 False
dtype: bool

df.duplicated(subset=['brand'])

0 False
1 True
2 False
3 True
4 True
dtype: bool

关于Index的重复标记：

df = df.set_index('brand')df

style rating
brand
Yum Yum cup 4.0
Yum Yum cup 4.0
Indomie cup 3.5
Indomie pack 15.0
Indomie pack 5.0

df.index.duplicated()

array([False,  True, False,  True,  True])

二、drop_duplicates()

与duplicated()类似，drop_duplicates()是直接把重复值给删掉。下面只会介绍一些含义不同的参数。

DataFrame.drop_duplicates(subset=None, keep=‘first’, inplace=False)

subset：与duplicated()中相同
keep：与duplicated()中相同
inplace：与pandas其他函数的inplace相同，选择是修改现有数据还是返回新的数据

Series.drop_duplicates()相比Series.duplicated()也是多了一个inplace参数，和上诉介绍一样，Index.drop_duplicates()与Index.duplicated()参数相同就不做赘述。下面是例子：

df = pd.DataFrame({    'brand': ['Yum Yum', 'Yum Yum', 'Indomie', 'Indomie', 'Indomie'],    'style': ['cup', 'cup', 'cup', 'pack', 'pack'],    'rating': [4, 4, 3.5, 15, 5]})df

brand style rating
0 Yum Yum cup 4.0
1 Yum Yum cup 4.0
2 Indomie cup 3.5
3 Indomie pack 15.0
4 Indomie pack 5.0

df.drop_duplicates()

brand style rating
0 Yum Yum cup 4.0
2 Indomie cup 3.5
3 Indomie pack 15.0
4 Indomie pack 5.0

df.drop_duplicates(inplace = True)df

brand style rating
0 Yum Yum cup 4.0
2 Indomie cup 3.5
3 Indomie pack 15.0
4 Indomie pack 5.0

关于“怎么使用Python pandas找出删除重复的数据”这篇文章的内容就介绍到这里，感谢各位的阅读！相信大家对“怎么使用Python pandas找出删除重复的数据”知识都有一定的了解，大家如果还想学习更多知识，欢迎关注编程网Python频道。

您可能感兴趣的文档:

--结束END--

本文标题: 怎么使用Python pandas找出删除重复的数据

本文链接: https://lsjlt.com/news/343250.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

怎么使用Python pandas找出删除重复的数据

前言

一、duplicated()

二、drop_duplicates()

怎么使用Python pandas找出删除重复的数据

Python pandas找出、删除重复的数据实例

pandas删除重复数据

Python Pandas中DataFrame.drop_duplicates()怎么删除重复值

php怎么查找和删除数组中的重复数据

MySQL数据库中怎么查找删除重复行

sql怎么找出重复的数据

mysql怎么删除重复数据

SQL怎么删除重复数据

mongodb怎么删除重复数据

pgsql怎么删除重复数据

oracle怎么删除重复数据

怎么用Python的Pandas删除列

SQLServer中怎么删除重复数据

mysql中怎么删除重复数据

怎么删除mysql重复数据库

mysql数据库怎么删除重复

Python pandas怎么删除指定行/列数据

使用shell脚本怎么删除mysql中的重复数据

怎么在mongodb中删除重复的数据

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python ffmpeg模块怎么安装和使用

python进程池创建队列的方法是什么

python无法运行文件的原因有哪些

python can't open file报错怎么解决

python keyerror错误怎么解决

python字符串处理与应用的方法有哪些

python全局变量如何定义