1

我有 PDF 文件,其第一页数据格式不同,但其余页面具有相同的表格格式。我想使用 Python Tabula 将这个具有多个页面的 PDF 文件转换为 CSV 文件。

如果 PDF 只有 2 页,并且如果它有超过两页,则当前代码能够将 PDF 转换为 CSV,它会给出超出范围的错误。

我想计算 PDF 文件的 PDF 页面总数,并且取决于相同的我希望 python 脚本将 PDF 转换为 CSV 以用于不同的数据帧。

我正在使用 Linux 机器来运行这个 python 脚本。

代码如下:

#!/usr/bin/env python3

import tabula
import pandas as pd
import csv

pdf_file='/root/scripts/pdf2xls/Test/21KJAZP011.pdf'
column_names=['Product','Batch No','Machin No','Time','Date','Drum/Bag No','Tare Wt.kg','Gross Wt.kg',
              'Net Wt.kg','Blender','Remarks','Operator']
df_results=[] # store results in a list

# Page 1 processing
try:
    df1 = tabula.read_pdf('/root/scripts/pdf2xls/Test/21KJAZP011.pdf', pages=1,area=(95,20, 800, 840),columns=[93,180,220,252,310,315,333,367,
                                                                          410,450,480,520]
                         ,pandas_options={'header': None}) #(top,left,bottom,right)
    df1[0]=df1[0].drop(columns=5)
    df1[0].columns=column_names
    df_results.append(df1[0])
    df1[0].head(2)

except Exception as e:
    print(f"Exception page not found {e}")


# Page 2 processing
try:
    df2 = tabula.read_pdf('/root/scripts/pdf2xls/Test/21KJAZP011.pdf', pages=2,area=(10,20, 800, 840),columns=[93,180,220,252,310,315,330,370,
                                                                          410,450,480,520]
                         ,pandas_options={'header': None}) #(top,left,bottom,right)

    row_with_Sta = df2[0][df2[0][0] == 'Sta'].index.tolist()[0]
    df2[0] = df2[0].iloc[:row_with_Sta]
    df2[0]=df2[0].drop(columns=5)
    df2[0].columns=column_names
    df_results.append(df2[0])
    df2[0].head(2)

except Exception as e:
    print(f"Exception page not found {e}")

#res:wult = pd.concat([df1[0],df2[0],df3[0]]) # concate both the pages and then write to CSV
result = pd.concat(df_results) # concate list of pages and then write to CSV
result.to_csv("result.csv")

with open('/root/scripts/pdf2xls/Test/result.csv', 'r') as f_input, open('/root/scripts/pdf2xls/Test/FinalOutput_21KJAZP011.csv', 'w') as f_output:
    csv_input = csv.reader(f_input)
    csv_output = csv.writer(f_output)
    csv_output.writerow(next(csv_input))    # write header

    for cols in csv_input:
        for i in range(7, 9):
            cols[i] = '{:.2f}'.format(float(cols[i]))
        csv_output.writerow(cols)

请建议如何实现相同的目标。我对 Python 很陌生,因此无法把东西放在一起。

4

2 回答 2

0

试试 pdfpumber https://github.com/jsvine/pdfplumber,对我来说就像一个魅力

pdffile = 'your file'
with pdfplumber.open(pdffile) as pdf:
    for i in range(len(pdf.pages)):
        first_page = pdf.pages[i]
        rawdata = first_page.extract_table()
于 2021-11-18T15:32:37.380 回答
0

使用 tabula 的 multiple_tables 选项从 PDF 中提取多个表格

多个表=真

from tabula import convert_into
table_file = r"PDF_path"
output_csv = r"out_csv"
df = convert_into(table_file, output_csv, output_format='csv', lattice=False, stream=True, multiple_tables=True, pages="all")
于 2021-11-27T12:25:32.387 回答