全国旗舰校区

不同学习城市 同样授课品质

北京

深圳

上海

广州

郑州

大连

武汉

成都

西安

杭州

青岛

重庆

长沙

哈尔滨

南京

太原

沈阳

合肥

贵阳

济南

下一个校区
就在你家门口
+
当前位置:首页  >  技术干货

pdf如何用python读取?

发布时间:2023-11-08 11:49:38
发布人:xqq

python中可以使用pdfminer库来读取PDF文件中的内容。

安装命令:

pipinstallpdfminer

pipinstallpdfminer3k

python中读取PDF文件代码:

fromurllib.requestimporturlopen

frompdfminer.pdfinterpimportPDFResourceManager,process_pdf

frompdfminer.converterimportTextConverter

frompdfminer.layoutimportLAParams

fromioimportStringIO

fromioimportopen

defreadPDF(pdfFile):

rsrcmgr=PDFResourceManager()

retstr=StringIO()

laparams=LAParams()

device=TextConverter(rsrcmgr,retstr,laparams=laparams)

process_pdf(rsrcmgr,device,pdfFile)

device.close()

content=retstr.getvalue()

retstr.close()

returncontent

pdfFile=urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")

outputString=readPDF(pdfFile)

print(outputString)

pdfFile.close()

解析pdf文件用到的类:

PDFParser:从一个文件中获取数据

PDFDocument:保存获取的数据,和PDFParser是相互关联的

PDFPageInterpreter处理页面内容

PDFDevice将其翻译成你需要的格式

PDFResourceManager用于存储共享资源,如字体或图像。

以上内容为大家介绍了pdf如何用python读取?希望对大家有所帮助,如果想要了解更多Python相关知识,请关注IT培训机构:千锋教育。

python培训

相关文章

实数是不是python的数据类型?

实数是不是python的数据类型?

2023-11-08
python转义符怎么打?

python转义符怎么打?

2023-11-08
python如何取余和取商?

python如何取余和取商?

2023-11-08
python怎么画pr曲线?

python怎么画pr曲线?

2023-11-08

最新文章

武汉新媒体行业公司排名

武汉新媒体行业公司排名

2023-11-01
武汉新媒体就业现状好吗

武汉新媒体就业现状好吗

2023-11-01
武汉全媒体行业发展现状及趋势

武汉全媒体行业发展现状及趋势

2023-10-31
武汉全媒体现状

武汉全媒体现状

2023-10-31
在线咨询 免费试学 教程领取