這篇文章主要為大家展示了PyPDF2讀取PDF文件內容如何保存到本地TXT,內容簡而易懂,希望大家可以學習一下,學習完之后肯定會有收獲的,下面讓小編帶大家一起來看看吧。

我就廢話不多說了,大家還是直接看代碼吧!
from PyPDF2.pdf import PdfFileReader
import pandas as pd
def Pdf_to_txt(pdf):
for i in range(0, pdf.getNumPages()):
title = []
lin1, lin2, lin3, lin4, lin5, lin6, lin7, lin8 = [], [], [], [], [], [], [], []
extractedText = pdf.getPage(i).extractText()
text = extractedText.split('\n')
num = 0
for lin in text:
if num == 0:
title.append(lin)
elif num == 1:
lin1.append(lin)
elif num == 2:
lin2.append(lin)
elif num == 3:
lin3.append(lin)
elif num == 4:
lin4.append(lin)
elif num == 5:
lin5.append(lin)
elif num == 6:
lin6.append(lin)
elif num == 7:
lin7.append(lin)
elif num == 8:
lin8.append(lin)
num = 0
num += 1
Lin_num = len(lin8)
data = {'Lin1': lin1[:Lin_num], 'Lin2': lin2[:Lin_num], 'Lin3': lin3[:Lin_num], 'Lin4': lin4[:Lin_num], 'Lin5': lin5[:Lin_num], 'Lin6': lin6[:Lin_num], 'Lin7': lin7[:Lin_num], 'Lin8': lin8[:Lin_num]}
df = pd.DataFrame(data, columns=['Lin1', 'Lin2', 'Lin3', 'Lin4', 'Lin5', 'Lin6', 'Lin7', 'Lin8'])
file_name = title[0] + '_page' + str((i + 1))
df.to_csv('tool/pdf解析/%s.txt' % file_name, index=False, sep='\t')
if __name__ == '__main__':
filename = 'E:/SVN/采集框架V2/analyse_code/政策/pdf/con026465.pdf'
pdf = PdfFileReader(open(filename, "rb"))
Pdf_to_txt(pdf)
網頁題目:PyPDF2讀取PDF文件內容如何保存到本地TXT-創新互聯
分享URL:http://www.yijiale78.com/article0/ddhpoo.html
成都網站建設公司_創新互聯,為您提供企業建站、商城網站、網站改版、品牌網站設計、品牌網站制作、手機網站建設
聲明:本網站發布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網站立場,如需處理請聯系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經允許不得轉載,或轉載時需注明來源: 創新互聯