Python代码优雅解析PDF文件
主要功能:利用Python扩展库pdfplumber解析中文核心期刊要目总览.pdf文件成excel文件
解析文件:中文核心期刊要目总览.pdf
官方文档:pdfplumber · PyPI
具体代码:
import pdfplumber
import pandas as pd
with pdfplumber.open("hexin.pdf") as pdf:
print(len(pdf.pages))
first = pdf.pages[0]
ftable = first.extract_table()
tables = ftable[2:]
for page in pdf.pages[1:]:
tables += page.extract_table()
data_frame = pd.DataFrame(tables, columns=ftable[1])
with pd.ExcelWriter('hexin.xlsx') as excel:
data_frame.to_excel(excel, index=False)
原文地址:https://blog.csdn.net/u013378469/article/details/143433507
免责声明:本站文章内容转载自网络资源,如本站内容侵犯了原著者的合法权益,可联系本站删除。更多内容请关注自学内容网(zxcms.com)!