2

我正在尝试使用 python dedupe 库对我的模拟数据执行模糊重复检查,但我不断收到此错误:

{'Vendor': {0: 'ABC', 1: 'ABC', 2: 'TIM'},
 'Doc Date': {0: '5/12/2019', 1: '5/13/2019', 2: '4/15/2019'},
 'Invoice Date': {0: '5/10/2019', 1: '5/10/2019', 2: '4/10/2019'},
 'Invoice Ref Num': {0: 'ABCDE56.', 1: 'ABCDE56', 2: 'RTET5SDF'},
 'Invoice Amount': {0: '56', 1: '56', 2: '100'}}

IndexError:无法从空序列中选择

这是我正在使用的代码:

import pandas as pd 
import pandas_dedupe

df = pd.read_csv("duptest.csv") df.columns

df = pandas_dedupe.dedupe_dataframe(df,['Vendor','Invoice Ref Num','Invoice Amount'])

知道我做错了什么吗?谢谢。

4

1 回答 1

2

pandas-dedupe 创建您需要标记的观察样本。默认观察量等于数据框的 30%。在您的情况下,您的数据框中的示例太少,无法开始主动学习。

如果你sample_size=1如下:

df = pandas_dedupe.dedupe_dataframe(df,['Vendor','Invoice Ref Num','Invoice Amount'], sample_size=1)

您将能够对您的数据进行重复数据删除:)

于 2020-07-05T19:04:29.417 回答