python读取pdf格式文档的实现代码


Posted in Python onApril 01, 2021

python读取pdf文档

一、 准备工作

安装对应的库
	pip install pdfminer3k
	pip install pdfminer.six

二、部分变量的含义

PDFDocument(pdf文档对象)
PDFPageInterpreter(解释器)
PDFParser(pdf文档分析器)
PDFResourceManager(资源管理器)
PDFPageAggregator(聚合器)
LAParams(参数分析器)

三、PDFMiner类之间的关系

python读取pdf格式文档的实现代码

PDFMiner的相关文档(点击跳转)

四、代码实现

#!/usr/bin/env python
# -*- coding:utf-8 -*-
# datetime:2021/3/17 12:12
# software: PyCharm
# version: python 3.9.2

def changePdfToText(filePath):
 """
 解析pdf 文本,保存到同名txt文件中

 param:
 filePath: 需要读取的pdf文档的目录
 introduced module:
 from pdfminer.pdfpage import PDFPage
 from pdfminer.pdfparser import PDFParser
 from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
 from pdfminer.converter import PDFPageAggregator
 from pdfminer.layout import LAParams
 from pdfminer.pdfdocument import PDFDocument, PDFTextExtractionNotAllowed
 import os.path
 """
 file = open(filePath, 'rb') # 以二进制读模式打开
 # 用文件对象来创建一个pdf文档分析器
 praser = PDFParser(file)
 # 创建一个PDF文档
 doc = PDFDocument(praser, '') # praser :上面创建的pdf文档分析器 ,第二个参数是密码,设置为空就好了
 # 连接分析器 与文档对象
 praser.set_document(doc)
 # 检测文档是否提供txt转换,不提供就忽略
 if not doc.is_extractable:
 raise PDFTextExtractionNotAllowed
 # 创建PDf 资源管理器 来管理共享资源
 rsrcmgr = PDFResourceManager()
 # 创建一个PDF设备对象
 laparams = LAParams()
 device = PDFPageAggregator(rsrcmgr, laparams=laparams)
 # 创建一个PDF解释器对象
 interpreter = PDFPageInterpreter(rsrcmgr, device)
 result = [] # 内容列表
 # 循环遍历列表,每次处理一个page的内容
 for page in PDFPage.create_pages(doc):
 interpreter.process_page(page)
 # 接受该页面的LTPage对象
 layout = device.get_result()
 for x in layout:
  if hasattr(x, "get_text"):
  result.append(x.get_text())
  fileNames = os.path.splitext(filePath) # 分割
  # 以追加的方式打开文件
  with open(fileNames[0] + '.txt', 'a', encoding="utf-8") as f:
   results = x.get_text()
   # print(results) 这个句可以取消注释就可以在控制台将所有内容输出了
   f.write(results) # 写入文件

# 调用示例 :

# path = u'E:\\1.pdf'
# changePdfToText(path)

利用PyPDF2实现了对pdf文字内容的提取

from PyPDF2 import PdfFileReader

# 定义获取pdf内容的方法
def getPdfContent(filename):
  # 获取PdfFileReader对象
  pdf = PdfFileReader(open(filename, "rb"))
  content = "" #content是输出文本
  for i in range(0,pdf.getNumPages()): #遍历每一页
    pageObj = pdf.getPage(i)
    try:
      extractedText = pageObj.extractText()#导出每一页的内容,如果当前页有图片的话就跳过
      content += extractedText + "\n"
    except BaseException:
      pass
  return content.encode("ascii", "ignore")


# 将获取的内容写入txt文件
with open("test.txt","w") as f:
  count=0 #count的作用是限制每一行的文字个数,本人设置的是十行
  #将获取的文本变成字符串并用空白隔开
  for item in str(getPdfContent("test.pdf")).split(" "):
    # 如果当前文字以句号结尾就换行
    if item[-1]==".":
      f.write(item+"\n")
      count=0
    else:
      f.write(item+" ")
      count +=1
    # 如果写了十个字就换行
    if count==10:
      f.write("\n")
      # 重置count
      count = 0

总结

到此这篇关于python读取pdf格式文档的文章就介绍到这了,更多相关python读取pdf文档内容请搜索三水点靠木以前的文章或继续浏览下面的相关文章希望大家以后多多支持三水点靠木!

Python 相关文章推荐
跟老齐学Python之编写类之一创建实例
Oct 11 Python
利用python获取某年中每个月的第一天和最后一天
Dec 15 Python
python自动查询12306余票并发送邮箱提醒脚本
May 21 Python
基于MTCNN/TensorFlow实现人脸检测
May 24 Python
python的set处理二维数组转一维数组的方法示例
May 31 Python
python创建与遍历List二维列表的方法
Aug 16 Python
python绘制彩虹图
Dec 16 Python
pandas-resample按时间聚合实例
Dec 27 Python
Python爬虫:Request Payload和Form Data的简单区别说明
Apr 30 Python
pycharm 激活码及使用方式的详细教程
May 12 Python
如何让PyQt5中QWebEngineView与JavaScript交互
Oct 21 Python
python套接字socket通信
Apr 01 Python
Python中使用Lambda函数的5种用法
Apr 01 #Python
python 实现mysql自动增删分区的方法
Apr 01 #Python
pygame面向对象的飞行小鸟实现(Flappy bird)
如何用python插入独创性声明
python OpenCV学习笔记
python基于OpenCV模板匹配识别图片中的数字
Python insert() / append() 用法 Leetcode实战演示
Mar 31 #Python
You might like
收听短波不可能有声音清晰的品质吗
2021/03/01 无线电
常用的php ADODB使用方法集锦
2008/03/25 PHP
解析thinkphp基本配置 convention.php
2013/06/18 PHP
php获取系统变量方法小结
2015/05/29 PHP
PHP实现的简单分页类及用法示例
2016/05/06 PHP
php使用SAE原生Mail类实现各种类型邮件发送的方法
2016/10/10 PHP
jQuery+CSS实现菜单滑动伸展收缩(仿淘宝)
2013/03/22 Javascript
js写的评论分页(还不错)
2013/12/23 Javascript
Blocksit插件实现瀑布流数据无限( 异步)加载
2014/06/20 Javascript
初识Node.js
2015/03/20 Javascript
黑帽seo劫持程序,js劫持搜索引擎代码
2015/09/15 Javascript
JS实现的页面自定义滚动条效果
2015/10/26 Javascript
为什么JavaScript没有块级作用域
2016/05/22 Javascript
全面解析多种Bootstrap图片轮播效果
2016/05/27 Javascript
angularjs 源码解析之scope
2016/08/22 Javascript
EasyUI 中combotree 默认不能选择父节点的实现方法
2016/11/07 Javascript
easyui combobox开启搜索自动完成功能的实例代码
2016/11/08 Javascript
Angular 输入框实现自定义验证功能
2017/02/19 Javascript
关于TypeScript中import JSON的正确姿势详解
2017/07/25 Javascript
vue 实现左右拖拽元素并且不超过他的父元素的宽度
2018/11/30 Javascript
Vue组件通信的几种实现方法
2019/04/25 Javascript
详解小程序input框失焦事件在提交事件前的处理
2019/05/05 Javascript
vue-router 2.0 跳转之router.push()用法说明
2020/08/12 Javascript
Python socket模块实现的udp通信功能示例
2019/04/10 Python
自适应线性神经网络Adaline的python实现详解
2019/09/30 Python
通过python连接Linux命令行代码实例
2020/02/18 Python
Django 如何使用日期时间选择器规范用户的时间输入示例代码详解
2020/05/22 Python
python 代码运行时间获取方式详解
2020/09/18 Python
Sentry错误日志监控使用方法解析
2020/11/12 Python
德国最大的网上鞋店之一:Schuhe24.de
2017/06/10 全球购物
京东奢侈品:全球奢侈品牌
2018/03/17 全球购物
软件工程专业推荐信
2013/10/28 职场文书
学校大课间活动方案
2014/01/30 职场文书
怎样拟定创业计划书
2014/05/01 职场文书
推普周国旗下讲话稿
2014/09/21 职场文书
乱丢垃圾袋检讨书
2014/10/08 职场文书