首页 / PYTHON / python读取pdf为文本
python读取pdf为文本
内容导读
互联网集市收集整理的这篇技术教程文章主要介绍了python读取pdf为文本,小编现在分享给大家,供广大互联网技能从业者学习和参考。文章包含691字,纯文字阅读大概需要1分钟。
内容图文
![python读取pdf为文本](/upload/InfoBanner/zyjiaocheng/591/3c503223d0c14ec78b757e624d3bddc7.jpg)
from urllib.request import urlopen
from pdfminer.pdfinterp import PDFResourceManager, process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from io import StringIO
from io import open
def readPDF(pdfFile):
rsrcmgr = PDFResourceManager()#资源管理器
retstr = StringIO()#分配内存
laparams = LAParams()#段落
device = TextConverter(rsrcmgr, retstr, laparams=laparams)#转换为文本
process_pdf(rsrcmgr, device, pdfFile)#抓取文本 #关闭设备 device.close() content = retstr.getvalue()#抓取字符 retstr.close()#关闭 return content
pdfFile = urlopen(“file:///C:/Users/Administrator/Desktop/爬虫简历.pdf”)
outputString = readPDF(pdfFile)
print(outputString)
pdfFile.close()
内容总结
以上是互联网集市为您收集整理的python读取pdf为文本全部内容,希望文章能够帮你解决python读取pdf为文本所遇到的程序开发问题。 如果觉得互联网集市技术教程内容还不错,欢迎将互联网集市网站推荐给程序员好友。
内容备注
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 gblab@vip.qq.com 举报,一经查实,本站将立刻删除。
内容手机端
扫描二维码推送至手机访问。