最近在研究批量处理本地文本型PDF论文(扫描版PDF暂不考虑),想做一个本地运行的Python脚本,需求如下:

1. 遍历指定文件夹内所有PDF,自定义提取标题、摘要、结论、试验方法,兼容中英文论文;
​
2. 提取结果导出Excel;遇到解析失败的文件自动记录日志,程序不会直接中断;
​
3. 支持配置文件,可以自行修改定位提取的关键词;命令行运行即可,不需要GUI图形界面。

仅读取本地文件,没有网络爬虫,不会联网抓取网页文献。

我尝试用大模型直接生成了基础代码骨架,但发现AI写出来的demo只能在1-2篇测试论文上正常跑。一旦换不同期刊、排版不一样的论文,就会出现段落错位、漏提取的问题。
想请教社区大佬:
pdfplumber 和 PyMuPDF 哪个更适合期刊论文这类非规整排版的PDF?AI生成的基础代码,一般重点要调整哪些地方,才能提升通用性?
如果有现成demo,欢迎一起交流学习。
展开
评论