0

如何使用表单解析 Pdf 文件以在我的 Web 服务器上获取字段位置和页面编号?例如,有些 pdf 的结构如下:

<</AcroForm 23 0 R/Metadata 2 0 R/Outlines 6 0 R/Pages 9 0 R/Type/Catalog>>
endobj
19 0 obj
<</DA(/ZaDb 0 Tf 0 g)/FT/Btn/Ff 49152/Kids[18 0 R 20 0 R]/T(Language)>>
endobj
23 0 obj
<</DA(/Helv 0 Tf 0 g )/DR<</Encoding<</PDFDocEncoding 26 0 R>>/Font<</Helv 22 0 R/ZaDb 35 0 R>>/XObject<</DSz 51 0 R>>>>/Fields[19 0 R 21 0 R 39 0 R 16 0 R 17 0 R 46 0 R 47 0 R 48 0 R]/SigFlags 1>>
endobj
25 0 obj
<</BBox[0.0 0.0 72.0 20.0]/FormType 1/Length 102/Matrix[1.0 0.0 0.0 1.0 0.0 0.0]/Resources<</Font<</Helv 22 0 R>>/ProcSet[/PDF/Text]>>/Subtype/Form/Type/XObject>>stream
1 g
0 0 72 20 re
f
/Tx BMC
q
2 1 68 18 re

如何使用 PHP 或 JavaScript 从此代码中获取字段位置?或者我可以尝试哪些库/实用程序?Pdftk 无法解决我的问题 :( 谢谢。

4

1 回答 1

0

不幸的是,如果尝试像扫描文本一样扫描 PDF,我们将无法获得更多信息,因为它比我们想象的要复杂得多。

我使用适用于 Java 的 Itext PDF 库解决了这个问题。看这里:

Itext 从现有的 pdf 中获取字段坐标

于 2013-09-28T20:03:17.010 回答