如何从PDF文件中提取文本? - Code

我试图使用Python提取包含在这个PDF文件中的文本。

我正在使用PyPDF2包(版本1.27.2)，并有以下脚本:

import PyPDF2

with open("sample.pdf", "rb") as pdf_file:
    read_pdf = PyPDF2.PdfFileReader(pdf_file)
    number_of_pages = read_pdf.getNumPages()
    page = read_pdf.pages[0]
    page_content = page.extractText()
print(page_content)

当我运行代码时，我得到以下输出，这与PDF文档中包含的输出不同:

 ! " # $ % # $ % &% $ &' ( ) * % + , - % . / 0 1 ' * 2 3% 4
5
 ' % 1 $ # 2 6 % 3/ % 7 / ) ) / 8 % &) / 2 6 % 8 # 3" % 3" * % 31 3/ 9 # &)
%

如何提取PDF文档中的文本?

当前回答

我在这里找到了一个解决方案PDFLayoutTextStripper

这很好，因为它可以保持原始PDF的布局。

它是用Java编写的，但我已经添加了一个网关来支持Python。

示例代码:

from py4j.java_gateway import JavaGateway

gw = JavaGateway()
result = gw.entry_point.strip('samples/bus.pdf')

# result is a dict of {
#   'success': 'true' or 'false',
#   'payload': pdf file content if 'success' is 'true'
#   'error': error message if 'success' is 'false'
# }

print result['payload']

示例输出PDFLayoutTextStripper:

你可以在这里看到更多细节Stripper with Python

2019-05-07 01:54:26

其他回答

如何从PDF文件中提取文本?

首先要了解的是PDF格式。它有一个用英文编写的公共规范，请参阅ISO 32000-2:2017，并阅读超过700页的PDF 1.7规范。当然，你至少需要阅读维基百科关于PDF的页面

一旦你理解了PDF格式的细节，提取文本或多或少是容易的(但是出现在图形或图像中的文本呢?它的数字1)?不要指望在几周内单独编写一个完美的软件文本提取器....

在Linux上，你也可以使用pdf2text，你可以从你的Python代码中弹出。

一般来说，从PDF文件中提取文本是一个定义不清的问题。对于人类读者来说，一些文本可以由不同的点制成(图形)，或者一张照片等等。

谷歌搜索引擎能够从PDF中提取文本，但据传需要超过5亿行的源代码。你有必要的资源(人力和预算)来发展一个竞争对手吗?

一种可能是将PDF打印到一些虚拟打印机(例如使用GhostScript或Firefox)，然后使用OCR技术提取文本。

相反，我建议处理生成PDF文件的数据表示，例如原始的LaTeX代码(或Lout代码)或OOXML代码。

在所有情况下，您都需要为至少几个人年的软件开发预算。

2020-08-21 07:08:40

我尝试过许多Python PDF转换器，我想更新这篇评论。蒂卡是最棒的之一。但是PyMuPDF是@ehsaneha用户的好消息。

我做了一个代码来比较一下:https://github.com/erfelipe/PDFtextExtraction希望对大家有所帮助。

Tika-Python是Apache Tika™REST服务的Python绑定允许在Python社区中本地调用Tika。

from tika import parser

raw = parser.from_file("///Users/Documents/Textos/Texto1.pdf")
raw = str(raw)

safe_text = raw.encode('utf-8', errors='ignore')

safe_text = str(safe_text).replace("\n", "").replace("\\", "")
print('--- safe text ---' )
print( safe_text )

2019-03-01 01:12:25

Pdftotext是最好和最简单的一个! Pdftotext也保留了结构。

我尝试了PyPDF2, PDFMiner和其他一些程序，但没有一个能给出令人满意的结果。

2019-04-03 12:16:08

你可以使用PDFtoText https://github.com/jalan/pdftotext

PDF到文本保持文本格式缩进，不管你是否有表格。

2017-12-06 23:20:46

从2021年开始，我想推荐pdfreader，因为pypddf2 /3现在看起来很麻烦，tika实际上是用java写的，需要在后台安装jre。Pdfreader是python的，目前维护得很好，这里有大量的文档。

正常安装:pip install pdfreader

用法的简短例子:

from pdfreader import PDFDocument, SimplePDFViewer

# get raw document
fd = open(file_name, "rb")
doc = PDFDocument(fd)

# there is an iterator for pages
page_one = next(doc.pages())
all_pages = [p for p in doc.pages()]

# and even a viewer
fd = open(file_name, "rb")
viewer = SimplePDFViewer(fd)

2021-08-12 07:23:40

aliyun