pdf ocr 用什么应用或者 ai?

firefox12 2026-09-27 23:41 1

我手里有一些学习资料,就是扫描后考卷,我想把它的内容 ocr 成为文档,但是我发现我用 umi 或者在线的 lovepdf 这种 出来的结果 ,格式错字都很多。格式基本上不能看。 我就想问,ai 这么强了 有能用的 pdf ocr 吗?


可付费解决这个问题。


https://demo1.k8seasy.com/sample.pdf


这里有个简单的 pdf 内容基本就是这样的,每一课都有答案和解答。 希望能 ocr 成 可以直接使用的内容,现在的题目里面的文字都有大量缺失。根本没办法用

最新回复 (6)
  • k74qr 09-28 00:10
    1楼
    试试 paddleocr 和 mineru
  • datocp 09-28 06:23
    2楼
    估计要花钱,手机端即便 google 的 app 也会出现因为角度问题将字识别错的问题。有个叫 text fairy 稍微好上那么一点点,会扫描后对齐,依然会出错。

    只有国产的那些据说是云扫描的,确实试用的时候那些会出错的位置,它都不会出错,因为要钱,后来听书干脆下 pdf 文件。
  • firefox12 楼主 09-28 08:17
    3楼
    @k74qr paddleocr 和 mineru 都试了 的确比其他的效果要好很多,虽然还不算完美 但是 缺字 漏字的情况少了 80%是有的
  • GPLer 09-28 11:04
    4楼
    量不大的话推荐用多模态 AI 来识别,生成的格式会更好,还有一定的纠错能力。
  • leir 09-28 11:32
    5楼
    试了一下使用 paddleocr 只能搞定 95%吧,有预算还是得上 AI
  • firefox12 楼主 09-28 13:19
    6楼
    ai 怎么弄?

    用 paddleocr 转了一下 90% 基本都是对的, 因为字本来也很清晰,但是排版还是游戏和原版的差别。算了 剩下的写了一个 py 校验了一下,手动改了 2 小时,第一版算是弄出来了。
* 帖子来源V2EX
返回