有没有佬是个大神

NOMoneyError 2026-09-11 17:39 1

需求: 要从一个pdf 或者 图片上 做文字内容抽取的功能,最终转为结构化数据(JSON);

比如从 身份证、申请表、承诺书 抽取数据

结果示例如下:


{
"姓名": "张三",
"爱好": [
"足球",
"篮球",
"钓鱼"
]
}

{
"变更内容": [
{
"序号": 1,
"变更前": "xxxx公司",
"变更后": "yyyyy公司"
}
]
}

有没有佬,有思路

我知道是OCR + 大模型


需要详细思路


比如一个图片中有多个字段,模型是一起抽还是单独抽

如果我还想根据坐标 裁剪图片,怎么做


整个时间要控制在20秒内

最新回复 (16)
  • 🐟哥哥 09-11 17:40
    1

    这不是整个ocr模型就行了吗

  • unsafetrait 09-11 17:41
    2

    OCR就搞定了,还有一些模型也支持

  • 来个人给我写代码吧 09-11 17:41
    3

    现在要学会善用ai工具。你这个需求太笼统了。

  • 多喜乐 09-11 17:41
    4

    一个mineru或者docling就可以吧,可以试试

  • crawlerV 09-11 17:41
    5

    扔给大模型它会提供一堆思路让它自己干就行

  • yvesyoung 09-11 17:42
    7

    做这玩应5年了,吐了要。面对各种套打偏移的解决了一堆。

    OCR+相对位置匹配,相对位置固定的可以做模板,不固定位置的可以借助llm做语义匹配

  • denovochen 09-11 17:42
    8

    实习生是吧,问ai啊,现在不管啥需求,我也不理解了,先丢给ai,你这个很好处理的

  • VB 09-11 17:44
    9

    用支持格式化输出的ai,例如豆包。

    格式化时可以指定json的键名、键值类型,这样格式通常就稳定了

  • JoJoJotarou 09-11 17:46
    10

    这个我之前还真做过^-^


    现在写提示词扔给视觉模型 JSON 输出就好了


    以前做法,图片训练分拣模型,OCR 得坐标,然后格式拆分块,表格等处理换行等,然后就是各种正则匹配

  • 白泽 09-11 17:51
    11

    deepseek足够了,跟拉稀一样快,设计好提示词和字段约束,三秒能出结果

  • aaa明 09-11 17:51
    12

    Gemini秒出,不需要太复杂的提示词,简单的告诉就可以了, gemini的多模态是很强的

  • cooljser 09-11 18:01
    13

    可以试试这个项目,GitHub - PaddlePaddle/PaddleOCR: Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages. · GitHub

  • 谷雨 09-11 18:10
    14

    佬友你的要求不是固定模板,而是通用场景。纯OCR大概率搞不定的,不如直接多模态大模型吧,提示词写好一点就行。

  • 烧饼 09-11 18:20
    15

    我也觉得,现在塞这些视觉模型会简单很多。就是它稳定性和幻觉方面有没有问题?

  • JoJoJotarou 09-11 18:35
    16

    这个肯定要具体测(我现在也不做了),手写,模糊啥的,专门的模型啥的(嘴上说肯定是简单,实际还是需要测试的)

    传统方式也没说你能百分百正确,而且传统方式版式啥的适配都非常困难

  • 奴儿哈只 09-11 18:52
    17

    找个mineru的项目,或者vibe coding手搓就行了

* 帖子来源Linux.do
返回