讨论&求助,有没有大佬接触过AI解析pdf为结构化数据的项目

小于 2026-06-15 11:26 1

背景:公司有个解析pdf数据的项目,主要是将各种金融类的报告pdf,理财说明书pdf解析为结构化数据。以前是用python+pdfplumber、PyMuPDF、pdf2docx解析文件,最后用正则提取出需要的数据转为表格这种形式。但是缺点很明显,一旦文件有描述或结构变化、跨页等情况脚本就会失效,需要频繁维护,导致最后变得难以迭代。


LLM的出现解决了上述问题,将文件通过python提取成文本或者OCR后传入给模型,让模型输出json类型的数据,可以大幅减少复杂的解析代码,而且当文档内容有一定变化模型也能理解并正确提取。


缺点:面对几十页的pdf,和超长的提示词,模型还是不可避免的会出现注意力丢失,幻觉等情况,导致解析结果质量下降。


但是由于本人没有这方面的开发经验,对项目的pipeline架构设计没有很好的方向。目前能想到的是先对pdf做预处理,比如先用廉价模型剔除不需要的段落,降低上下文。

使用docling将pdf转为更适合模型理解的格式 GitHub - docling-project/docling: Get your documents ready for gen AI · GitHub

但后面校验模型结果,重试机制,提示词优化,项目结构都还没有很好的方向。所以求助下各位大佬,能否给点建议,或者有没有相关的开源项目,想学习一下。感谢!

最新回复 (11)
  • cc 06-15 11:27
    1

    当然是直接使用mineru啦。强烈推荐

  • cc 06-15 11:55
    2

    如果是公司项目就建议自己部署,如果条件允许还可以自己魔改mineru。

  • sakura 06-15 12:38
    3

    VectifyAI/PageIndex:^-^ PageIndex:无矢量、基于推理的RAG文档索引 可以参考这个

  • Kevin Li 06-15 12:42
    4

    这个可以的,如果再有问题,先看看自己的pdf文档的内容是什么结构的,做针对性的调整。还有就是分页,你不能想着几十页一次性处理。

  • 小于 楼主 06-15 13:38
    5

    感谢,我看了下,mineru和Docling 很类似,都是将pdf解析成结构化的格式。我后面再研究下用哪种。

  • cc 06-15 13:43
    6

    其实不用研究了,基本我已经试过。在不付费的前提下(当然是因为我没有使用过付费的产品),mineru已经天花板。解析pdf的表格等做的很好,当然遇到比较复杂的多层嵌套型表格还是有点问题,不过已经很强了。mineru还支持本地部署,我在wx群看有别人大佬直接魔改mineru,直接能得到直接想要的数据。

  • 小于 楼主 06-15 14:13
    7

    感谢,看了下,这个项目应该是索引构建和语义检索用的,和我的需求有点偏差。还是大佬感谢分享工具

  • 小于 楼主 06-15 17:04
    8

    对于有几十页的pdf我也在考虑怎么做预处理,直接喂给模型,一是成本高,二是可能导致注意力丢失。大佬,有没有相关经验,可以分享下

  • wjy 06-15 17:08
    9

    看你需要解析多少页


    不多的话,开个ChatGPT Pro,可以一把梭哈,几十页全部解析完(买中转额度也可以)


    说不定比用dsv4pro还便宜


    不过对于dsv4pro来说,提取信息已经足够了,这个模型注意力比较强,几十页文本不到10w上下文完全够用

  • 小于 楼主 06-15 17:12
    10

    公司用的qwen3.7-plus,准确性目前测下来是85%-92%。就是想继续优化下项目结构和解析流程,提升效率和准确性。

  • wjy 06-15 17:18
    11

    引入 mineru ocr 提高识别率


    优化提示词


    我想可以用小样本数据测试一个dsv4pro的能力,看看和qwen3.7plus有没有差距


    几十页文本对于现在的大模型来说,应该还好

* 帖子来源Linux.do
返回