佬友们的 OCR 方案是什么?

ranshen1209 2026-09-14 17:38 1

想问一下各位佬的 OCR 方案是什么,目前公司有一批文档需要 OCR,量级在 2w 份左右,传统 OCR 可能效果不是很好,用多模态大模型做 OCR 有佬试过嘛,我看 ds 4.1 的价格挺便宜的,就是不知道效果怎么样

最新回复 (19)
  • 小飞机 09-14 17:40
    1

    豆包桌面版本的 应该都能干了吧 创建任务啥的.(我没试过,只是我的想法)

  • 0xEcho 09-14 17:42
    2

    本地可以部署一下Qwen-VL试试

  • shock 09-14 17:43
    3

    如果是文档类的 minerU 本地化部署应该可以搞定。

  • apparition 09-14 17:44
    4

    我的做法是

    minerU + Gemini 3.8f

  • 09-14 17:46
    5

    百度ocr 每天20000次免费调用

  • ranshen1209 楼主 09-14 17:51
    6

    我怎么没想到这个时间上最好的多模态大模型-Gemini,我看看方案

  • Kluming 09-14 17:51
    7

    百度的OCR 识别正确率很高 还有足额的免费次数 个人觉得无敌

  • ranshen1209 楼主 09-14 17:51
    8

    百度的PaddleOCR-VL参数量太小了,只有 0.9B,公司的文档还是有点复杂的

  • ranshen1209 楼主 09-14 17:52
    9

    百度的PaddleOCR-VL参数量太小了,只有 0.9B,公司的文档还是有点复杂的,公司付钱,只要价格不太离谱就行,主要看效果

  • ranshen1209 楼主 09-14 17:52
    10

    minerU 之前有听说过,可以看看 ^-^

  • ranshen1209 楼主 09-14 17:53
    11

    然后豆包直接在你电脑上跑一个 0.x b 的小模型给你识别 ^-^

  • BearKouber 09-14 17:53
    12

    看复杂度,如果复杂度低可以用mineru去处理两个文档看看结果怎么样.

    复杂度高可用大模型去做,ds 4.1你可以试试,不过ds有专门ocr的模型DeepSeek-OCR-2

    你可以看下部署条件,如果有好显卡(50系列或者spark可以考虑本地部署),这样不走api也没隐私泄露风险

  • zoffy 09-14 17:53
    13

    mac 自带的 ocr,或许可以试一试。可行的话,写个工具道也不是什么难事

  • OnTheRoad 09-14 17:53
    14

    本地布一个 glm-ocr可以不

  • 故笙 09-14 17:54
    15

    楼上佬推荐的glm-ocr确实神中神

  • hch 09-14 17:54
    16

    textin.com 目前我司主要是扫描识别 试卷、教学资料试题,用的是他家的,识别效果很不错

  • hzb0202 09-14 17:55
    17

    怎么便宜怎么来 mimo,星辰,都可以

  • Neptune 09-14 17:57
    18

    本地部署最性价比,只需要电费。gemini也不错。

  • xiaoyu 09-14 17:57
    19

    Step 3.7 Flash 他家的plan超级便宜

* 帖子来源Linux.do
返回