#每日快讯#
007的忧思:人类永远恐惧科技之恶
文 | 脑极体
提到007我们会想到什么?特工、美女、炫酷的装备、激烈的战斗、要摇匀不要搅匀的马提尼。我是007全系列的忠实观众,但确实看到的也大体就是这些。
直到最近玩了最新的007游戏《007:初露锋芒》。反派揭晓的时候我发现吃瓜吃到了自己行业。剧透警告啊各位,这部游戏的反派赫然是一家AI大模型公司。…
最近在研究批量处理本地文本型PDF论文(扫描版PDF暂不考虑),想做一个本地运行的Python脚本,需求如下:
1. 遍历指定文件夹内所有PDF,自定义提取标题、摘要、结论、试验方法,兼容中英文论文;
2. 提取结果导出Excel;遇到解析失败的文件自动记录日志,程序不会直接中断;
3. 支持配置文件,可以自行修改定位提取的关键词;命令行运行即可,不需要GUI图形界面。
仅读取本地文件,没有网络爬虫,不会联网抓取网页文献。
我尝试用大模型直接生成了基础代码骨架,但发现AI写出来的demo只能在1-2篇测试论文上正常跑。一旦换不同期刊、排版不一样的论文,就会出现段落错位、漏提取的问题。
想请教社区大佬:
pdfplumber 和 PyMuPDF 哪个更适合期刊论文这类非规整排版的PDF?AI生成的基础代码,一般重点要调整哪些地方,才能提升通用性?
如果有现成demo,欢迎一起交流学习。
1. 遍历指定文件夹内所有PDF,自定义提取标题、摘要、结论、试验方法,兼容中英文论文;
2. 提取结果导出Excel;遇到解析失败的文件自动记录日志,程序不会直接中断;
3. 支持配置文件,可以自行修改定位提取的关键词;命令行运行即可,不需要GUI图形界面。
仅读取本地文件,没有网络爬虫,不会联网抓取网页文献。
我尝试用大模型直接生成了基础代码骨架,但发现AI写出来的demo只能在1-2篇测试论文上正常跑。一旦换不同期刊、排版不一样的论文,就会出现段落错位、漏提取的问题。
想请教社区大佬:
pdfplumber 和 PyMuPDF 哪个更适合期刊论文这类非规整排版的PDF?AI生成的基础代码,一般重点要调整哪些地方,才能提升通用性?
如果有现成demo,欢迎一起交流学习。
展开
评论
5