扫描版PDF表格识别准确率高的工具推荐

0 阅读3分钟

真实场景下,文档内的元素并不是标准化和格式化的,往往会有双栏表格、无线图表等等复杂元素。传统的OCR工具无法判断复杂表格的结构和内容顺序逻辑,很容易解析失败,提取出的内容“牛头不对马嘴”,导致白白浪费时间。

TextIn文档解析是一款专注于复杂文档解析的AI工具,致力于破解复杂文档的结构化难题。它能将文档中的非结构化内容(如复杂表格、手写笔记、图片印章等)进行梳理,转换成大模型友好的内容格式(Markdown)。并且它能识别文档版面内各类的信息要素,把各种元素信息分别归类提取出来,筛选保留核心信息。根据官方数据显示,TextIn批量解析100页文档最快仅需1.5s,对于企业级500万页+的PDF文档解析,可在三天内处理完成,识别稳定率可达99.99%。 。.png TextIn技术团队在当前表格解析模型及后处理算法的基础上,结合模型预测的位置信息和逻辑信息,引入轴对齐处理思路,避免仅依赖逻辑信息预测的问题,减少单元格划分错误的情况;通过上下文信息与行列查询,解决跨行列cell填充问题;基于表格内容OCR匹配,实现物理位置修正。经测试,优化版本表格全对率有显著提升。

我们将通过几个案例,直观展示TextIn在PDF表格识别和解析上的优秀表现。

案例1: 识别错误 1.png 优化结果 2.png 如图所示,左侧图片是无线表格解析中常见的bad case:合并单元格结构识别不准确。由于合并单元格有顶部对齐、垂直居中多种形式,在实际文档中版面复杂多变,在没有框线的情况下,更增加了解析模型的识别难度。

右侧图中可以看到,TextIn文档解析能妥善处理这类难点情况,实现正确的表格还原,保障下游信息处理的准确性。

案例2: 识别错误 3.png 优化结果 4.png 缺少结构信息的表格文字识别会丢失重要价值,导致数据成为无意义的数字。

PDF文件中,拥有不同行列数的不规则无线表格在同一版面呈现的情况相当常见。以图中的金融机构报告为例,值得注意的是,TextIn会同步预测空cell,以提升整体表格解析准确率。

案例3: 识别错误 5.png 优化结果 6.png 如图所示,对于清晰度较低、噪点多的扫描图像,优化后的表格模型也能实现精准的识别。

从具体案例来看,TextIn对解决单元格中的多行问题有优异的效果,用户如有产品说明书、体检报告、技术规格书等文件及其他类型多行复杂表格的解析需求,解析引擎的准确性和使用体验都将大幅度提升,能够满足教育、金融、数据处理等多种场景的精细化使用需求。