pandas的drop_duplicates方法
时间: 2023-10-09 14:07:46 浏览: 201
pandas.DataFrame.drop_duplicates 用法介绍
Pandas 的 `drop_duplicates()` 方法用于从 DataFrame 中删除重复的行。该方法返回一个新的 DataFrame,其中不包含重复的行。
以下是使用 `drop_duplicates()` 方法的示例代码:
```python
import pandas as pd
# 创建一个包含重复行的 DataFrame
df = pd.DataFrame({'col1': [1, 2, 2, 3, 4, 4, 5],
'col2': ['a', 'b', 'b', 'c', 'd', 'd', 'e']})
# 使用 drop_duplicates() 方法删除重复行
df_no_duplicates = df.drop_duplicates()
print(df_no_duplicates)
```
输出结果将会是:
```
col1 col2
0 1 a
1 2 b
3 3 c
4 4 d
6 5 e
```
在这个例子中,原始的 DataFrame 包含重复的行 `(2, 'b')` 和 `(4, 'd')`。使用 `drop_duplicates()` 方法后,这些重复行被删除,得到一个没有重复行的新 DataFrame。
`drop_duplicates()` 方法还有一些可选参数,例如 `subset` 和 `keep`。你可以使用 `subset` 参数指定要检查重复的列,而不是整个行。`keep` 参数用于指定保留哪个重复行,默认值是保留第一个出现的行,你也可以设置为保留最后一个出现的行或者删除所有重复行。
希望能帮到你!如果还有其他问题,请随时提问。
阅读全文