python - 如何从 PDF 文件中提取文本和文本坐标？

coder 2023-05-25 原文

我想用 PDFMiner 从 PDF 文件中提取所有文本框和文本框坐标。

许多其他 Stack Overflow 帖子解决了如何以有序方式提取所有文本，但我如何执行获取文本和文本位置的中间步骤？

给定一个 PDF 文件，输出应该类似于:

489, 41,  "Signature"
500, 52,  "b"
630, 202, "a_g_i_r"

最佳答案

这是一个可以复制粘贴的示例，它列出了 PDF 中每个文本 block 的左上角，我认为它适用于任何不包含具有文本的“Form XObjects”的 PDF其中:

from pdfminer.layout import LAParams, LTTextBox
from pdfminer.pdfpage import PDFPage
from pdfminer.pdfinterp import PDFResourceManager
from pdfminer.pdfinterp import PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator

fp = open('yourpdf.pdf', 'rb')
rsrcmgr = PDFResourceManager()
laparams = LAParams()
device = PDFPageAggregator(rsrcmgr, laparams=laparams)
interpreter = PDFPageInterpreter(rsrcmgr, device)
pages = PDFPage.get_pages(fp)

for page in pages:
    print('Processing next page...')
    interpreter.process_page(page)
    layout = device.get_result()
    for lobj in layout:
        if isinstance(lobj, LTTextBox):
            x, y, text = lobj.bbox[0], lobj.bbox[3], lobj.get_text()
            print('At %r is text: %s' % ((x, y), text))

以上代码基于 Performing Layout Analysis PDFMiner 文档中的示例，以及 pnj ( https://stackoverflow.com/a/22898159/1709587 ) 和 Matt Swain ( https://stackoverflow.com/a/25262470/1709587 ) 的示例。我对这些之前的示例进行了一些更改:

我使用 PDFPage.get_pages()，它是创建文档的简写，检查它 is_extractable，并将其传递给 PDFPage.create_pages()
我不会费心处理 LTFigure，因为 PDFMiner 目前无论如何都无法干净地处理其中的文本。

LAParams 让您可以设置一些参数来控制 PDF 中的单个字符如何被 PDFMiner 神奇地分组到行和文本框中。如果您对这样的分组是一件完全需要发生的事情感到惊讶，那么 pdf2txt docs 是合理的。 :

In an actual PDF file, text portions might be split into several chunks in the middle of its running, depending on the authoring software. Therefore, text extraction needs to splice text chunks.

LAParams 的参数与大多数 PDFMiner 一样，没有文档记录，但您可以看到它们 in the source code或通过在 Python shell 中调用 help(LAParams)。 https://pdfminer-docs.readthedocs.io/pdfminer_index.html#pdf2txt-py给出了一些参数的含义因为它们也可以在命令行中作为参数传递给 pdf2text。

上面的layout 对象是一个LTPage，它是一个“布局对象”的可迭代对象。这些布局对象中的每一个都可以是以下类型之一...

LTTextBox
LTFigure
LTImage
LTLine
LTRect

... 或其子类。 (特别是，您的文本框可能都是 LTTextBoxHorizontals。)

文档中的这张图片显示了 LTPage 结构的更多细节:

上述每种类型都有一个 .bbox 属性，其中包含一个 (x0, y0, x1 , y1) 元组，分别包含对象的左、下、右和上坐标。 y 坐标表示为到页面底部的距离。如果您更方便地使用从上到下的 y 轴，您可以从页面的 .mediabox 的高度中减去它们:

x0, y0_orig, x1, y1_orig = some_lobj.bbox
y0 = page.mediabox[3] - y1_orig
y1 = page.mediabox[3] - y0_orig

除了 bbox 之外，LTTextBoxes 还有一个 .get_text() 方法，如上所示，该方法将其文本内容返回为一个字符串。请注意，每个 LTTextBox 都是 LTChar(由 PDF 显式绘制的字符，带有 bbox)和 LTAnno 的集合code>s(PDFMiner 根据被绘制的字符相距很远，添加到文本框内容的字符串表示形式的额外空格；这些没有 bbox)。

这个答案开头的代码示例结合了这两个属性来显示每个文本 block 的坐标。

最后，值得注意的是，与上面引用的其他 Stack Overflow 答案不同，我不费心递归到 LTFigure 中。尽管 LTFigures 可以包含文本，但 PDFMiner 似乎无法将该文本分组到 LTTextBoxes 中(您可以尝试使用 https://stackoverflow.com/a/27104504/1709587 中的示例 PDF)，而是生成一个直接包含 LTChar 对象的 LTFigure。原则上，您可以弄清楚如何将这些拼凑成一个字符串，但 PDFMiner(截至 20181108 版)无法为您完成。

但希望您需要解析的 PDF 不使用其中包含文本的 Form XObject，因此此警告不适用于您。

关于python - 如何从 PDF 文件中提取文本和文本坐标？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/22898145/

和文 python code pdfminer https pdf

有关python - 如何从 PDF 文件中提取文本和文本坐标？的更多相关文章

ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2
我正在学习如何使用Nokogiri，根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div
ruby - 如何从 ruby 中的字符串运行任意对象方法？ - 2
总的来说，我对ruby还比较陌生，我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础，我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
ruby - 使用 RubyZip 生成 ZIP 文件时设置压缩级别 - 2
我有一个Ruby程序，它使用rubyzip压缩XML文件的目录树。gem。我的问题是文件开始变得很重，我想提高压缩级别，因为压缩时间不是问题。我在rubyzipdocumentation中找不到一种为创建的ZIP文件指定压缩级别的方法。有人知道如何更改此设置吗？是否有另一个允许指定压缩级别的Ruby库？最佳答案这是我通过查看rubyzip内部创建的代码。level=Zlib::BEST_COMPRESSIONZip::ZipOutputStream.open(zip_file)do|zip|Dir.glob("**/*")d
ruby - 其他文件中的 Rake 任务 - 2
我试图在一个项目中使用rake，如果我把所有东西都放到Rakefile中，它会很大并且很难读取/找到东西，所以我试着将每个命名空间放在lib/rake中它自己的文件中，我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题，但没有任务。我现在只有一个.rake文件作为测试，名为“servers.rake”，它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
ruby-on-rails - 在 Rails 中将文件大小字符串转换为等效千字节 - 2
我的目标是转换表单输入，例如“100兆字节”或“1GB”，并将其转换为我可以存储在数据库中的文件大小(以千字节为单位)。目前，我有这个:defquota_convert@regex=/([0-9]+)(.*)s/@sizes=%w{kilobytemegabytegigabyte}m=self.quota.match(@regex)if@sizes.include?m[2]eval("self.quota=#{m[1]}.#{m[2]}")endend这有效，但前提是输入是倍数(“gigabytes”，而不是“gigabyte”)并且由于使用了eval看起来疯狂不安全。所以，功能正常，
python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - Rails 3 中的多个路由文件 - 2
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情？最佳答案在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中，使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件，我们在StackOverflow上找到一个类似的问题
ruby-on-rails - 如何验证 update_all 是否实际在 Rails 中更新 - 2
给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息？最佳答案在Rails3中，update_all不返回任何有意义的信息，除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru
ruby-on-rails - 'compass watch' 是如何工作的/它是如何与 rails 一起使用的 - 2
我在我的项目目录中完成了compasscreate.和compassinitrails。几个问题:我已将我的.sass文件放在public/stylesheets中。这是放置它们的正确位置吗？当我运行compasswatch时，它不会自动编译这些.sass文件。我必须手动指定文件:compasswatchpublic/stylesheets/myfile.sass等。如何让它自动运行？文件ie.css、print.css和screen.css已放在stylesheets/compiled。如何在编译后不让它们重新出现的情况下删除它们？我自己编译的.sass文件编译成compiled/t
ruby - 将差异补丁应用于字符串/文件 - 2
对于具有离线功能的智能手机应用程序，我正在为Xml文件创建单向文本同步。我希望我的服务器将增量/差异(例如GNU差异补丁)发送到目标设备。这是计划:Time=0Server:hasversion_1ofXmlfile(~800kiB)Client:hasversion_1ofXmlfile(~800kiB)Time=1Server:hasversion_1andversion_2ofXmlfile(each~800kiB)computesdeltaoftheseversions(=patch)(~10kiB)sendspatchtoClient(~10kiBtransferred)Cl

python - 如何从 PDF 文件中提取文本和文本坐标？

有关python - 如何从 PDF 文件中提取文本和文本坐标？的更多相关文章

随机推荐