邻居为了给孩子省资料费,问我几百m的pdf能不能用ai把里面的题目提取出来?

barry66688 2026-08-11 17:05 1

事情是这样的,我邻居突发奇想,说他家的小孩对电脑挺感兴趣的,也喜欢在电脑上刷题,问我能不能想个办法把几百m的pdf题目资料提取出来,利用ai转换成刷题库,这样他小孩就不用买资料了,而且也能高效率刷题,我觉得我邻居确实也是个人才,但是我说暂时也没有合适的高效率提取方法,ai估计还没那么牛逼,他说没事,希望我找到后跟他说一声就行。mjj们有啥办法吗,我那个邻居为人还是不错的,之前也帮过我,现在轮到我提供帮助的时候了,兄弟们看看能不能给解决一下


最新回复 (56)
  • 骑士斯诺70 08-11 17:05
    1

    可以啊,OCR识别+AI校对就行了

  • xiaolingbuling 08-11 17:06
    2

    丢给ai

  • barry66688 楼主 08-11 17:06
    3

    @骑士斯诺70 #1 发布于2026/8/11 17:05:56

    可以啊,OCR识别+AI校对就行了


    有没有实操视频和工具链接,分享一下兄弟

  • 1x 08-11 17:06
    4

    MinerU

  • yuyu12138 08-11 17:06
    5

    可以,作文手写稿都能识别出来

  • jsomin 08-11 17:06
    6

    付费去闲鱼就行

  • 嫌疑人 08-11 17:06
    7

    下次发帖别放鬼图 ^-^

  • agczsz 08-11 17:06
    8

    可以的,我拿手机拍照的题库,找了claude写了软件进行识别,题目分类之类做得干干净净

  • o8b 08-11 17:06
    9

    发出来 我帮你

  • IEmaster 08-11 17:07
    10

    丢给腾讯那个马维斯 开着电脑慢慢跑就行了 反正不花钱

  • sinstar 08-11 17:07
    11

    别做,ai做不到100%正确,而题库ocr一旦出错就是你的问题


    别做需要你当售后的事情

  • barry66688 楼主 08-11 17:07
    12

    @1x #4 发布于2026/8/11 17:06:35

    MinerU


    免费的吗兄弟,分享一下链接

  • Skenqs 08-11 17:07
    13

    能,要么切片pdf给模型,要么楼上说的minerU这种直接ocr出来,如果ocr效果不好,多模态模型就得

  • 我也要打十个 08-11 17:07
    14

    为什么邻居找你弄,你炫耀过你的小鸡给她?

  • barry66688 楼主 08-11 17:07
    15

    @sinstar #11 发布于2026/8/11 17:07:10

    别做,ai做不到100%正确,而题库ocr一旦出错就是你的问题


    别做需要你当售后的事情


    你看,我就说不简单吧

  • barry66688 楼主 08-11 17:08
    16

    @我也要打十个 #14 发布于2026/8/11 17:07:34

    为什么邻居找你弄,你炫耀过你的小鸡给她?


    哈哈,原来是给我送过鸡腿的大佬

  • username123 08-11 17:09
    17

    可以,收点辛苦费,50

  • barry66688 楼主 08-11 17:10
    18

    @username123 #17 发布于2026/8/11 17:09:42

    可以,收点辛苦费,50


    要钱就算了兄弟

  • 骑士斯诺70 08-11 17:11
    19

    @barry66688 #3 工具用mineru+任意agent就行,先用mineru识别,然后导出md文本,让AI校对。模型不用多强的,这种小任务ds就够用了

  • barry66688 楼主 08-11 17:11
    20

    @Skenqs #13 发布于2026/8/11 17:07:32

    能,要么切片pdf给模型,要么楼上说的minerU这种直接ocr出来,如果ocr效果不好,多模态模型就得


    具体怎么搞呢,有没有教学视频和工具链接大佬

  • dtybgg 08-11 17:12
    21

    可以弄,直接给codex就行

  • kanata 08-11 17:12
    22

    搞得定的,我曾经把乙方的接口文档pdf文件,去水印、转markdown一气呵成,跑光了我一个team席位的月额度


    但是后续就舒服了,转成md以后写一些需求、问一些业务规则,AI直接就帮我做了。

  • 早饭 08-11 17:12
    23

    是女邻居么?美女就让ai努力下

  • 睡前喝杯热美式 08-11 17:12
    24

    可以,ai搓一个

  • barry66688 楼主 08-11 17:12
    25

    @嫌疑人 #7 发布于2026/8/11 17:06:50

    下次发帖别放鬼图 ^-^


    大胆,这可是礼堂王^-^

  • barry66688 楼主 08-11 17:13
    26

    @dtybgg #21 发布于2026/8/11 17:12:15

    可以弄,直接给codex就行


    codex免费版的能搞定吗,还是要花钱呢?

  • 阳鼎天 08-11 17:18
    27

    直接丢给codex都行的 主要就是ocr识别成文字 其他都ai帮你整理了

  • funeego 08-11 17:19
    28

    试试有道翻译,可以把PDF转WORD,让他自己校对WORD内容,没有问题再把WORD喂给AI(国内DeepSeek)。总之就是你教他方法,具体自己去弄。

  • barry66688 楼主 08-11 17:19
    29

    @agczsz #8 发布于2026/8/11 17:06:56

    可以的,我拿手机拍照的题库,找了claude写了软件进行识别,题目分类之类做得干干净净


    求分享一下软件丁真

  • barry66688 楼主 08-11 17:20
    30

    @kanata #22 发布于2026/8/11 17:12:18

    搞得定的,我曾经把乙方的接口文档pdf文件,去水印、转markdown一气呵成,跑光了我一个team席位的月额度


    但是后续就舒服了,转成md以后写一些需求、问一些业务规则,AI直接就帮我做了。


    牛逼大佬,向你学习,能不能分享一下链接啥的

  • barry66688 楼主 08-11 17:22
    31

    @骑士斯诺70 #19 发布于2026/8/11 17:11:15

    @barry66688 #3 工具用mineru+任意agent就行,先用mineru识别,然后导出md文本,让AI校对。模型不用多强的,这种小任务ds就够用了


    听不懂思密达,大佬能不能分享一下工具

  • 9888 08-11 17:25
    32

    丢给AI,上个厕所的功夫就给你解决了

  • barry66688 楼主 08-11 17:26
    33

    @9888 #32 发布于2026/8/11 17:25:20

    丢给AI,上个厕所的功夫就给你解决了


    ai限制我的pdf大小啊,最大不超过100m,怎么搞

  • 三千 08-11 17:27
    34

    如果就这一次你就发出来让热心的网友帮你干,你加个鸡腿。

    如果后续还要很多次,你就按楼上说的OCR+ai校对

  • sanyuanya 08-11 17:27
    35

    我有一个思路 用 anydoc 转成 markdown, 然后再用 Ai 把 markdown 转成题库

  • kanata 08-11 17:28
    36

    @barry66688 #30


    大概逻辑可以分享你;


    先下载了一个adobe的什么pdf的工具,在windows上,可以编辑pdf文件无损去水印;

    然后另存为word版本

    再把word文件扔给gpt,gpt对word的识别会原高于pdf


    word - markdown这个过程,就需要你和gpt反复打磨了,最好以前10页先做尝试(或者第xx页-第xx页,要有代表性的内容比较复杂的页面),等效果都ok以后再让他全量解析就行了。

  • barry66688 楼主 08-11 17:30
    37

    @kanata #36 发布于2026/8/11 17:28:50

    @barry66688 #30


    大概逻辑可以分享你;


    先下载了一个adobe的什么pdf的工具,在windows上,可以编辑pdf文件无损去水印;

    然后另存为word版本

    再把word文件扔给gpt,gpt对word的识别会原高于pdf


    word - markdown这个过程,就需要你和gpt反复打磨了,最好以前10页先做尝试(或者第xx页-第xx页,要有代表性的内容比较复杂的页面),等效果都ok以后再让他全量解析就行了。


    好的大佬,还有那个工具会限制pdf大小吗?

  • ink 08-11 17:33
    38

    不是,都PDF了,为什么不直接打印出来呢

  • zxxuu 08-11 17:34
    39

    没有问题啊 ai完全能胜任这个任务 前提是纯文字 别图文并茂 图文并茂不好搞

  • barry66688 楼主 08-11 17:34
    40

    @ink #38 发布于2026/8/11 17:33:09

    不是,都PDF了,为什么不直接打印出来呢


    人家是想转换为电脑题库呐,提高刷题效率

  • barry66688 楼主 08-11 17:34
    41

    @zxxuu #39 发布于2026/8/11 17:34:04

    没有问题啊 ai完全能胜任这个任务 前提是纯文字 别图文并茂 图文并茂不好搞


    大佬有何破解良策,还望解答

  • 肥狗在线 08-11 17:35
    42

    https://github.com/PDFMathTranslate/PDFMathTranslate

    有一个这个东西,你看看能用上不

  • barry66688 楼主 08-11 17:36
    43

    @肥狗在线 #42 发布于2026/8/11 17:35:01

    https://github.com/PDFMathTranslate/PDFMathTranslate

    有一个这个东西,你看看能用上不


    OK兄弟,我去试试看

  • terrymjj 08-11 17:38
    44

    @barry66688 #26 额度不够用吧

  • zxxuu 08-11 17:42
    45

    @barry66688 #41 支持多模态的模型 逐页OCR识别出来 再让 大模型整理呗 估计得烧不少Token 这个 对能力要求不高 用antigravity应该就行

  • kanata 08-11 17:43
    46

    @barry66688 #37


    codex不限制啊,codex有额度就能干,多少都能干。

    也可以分批一点点干

  • myfriend 08-11 17:44
    47

    pdf里面是文本还是扫描件? 如果是扫描件,如 #11 说的,别搞!

  • barry66688 楼主 08-11 17:51
    48

    @myfriend #47 发布于2026/8/11 17:44:42,编辑于2026/8/11 17:44:52

    pdf里面是文本还是扫描件? 如果是扫描件,如 #11 说的,别搞!


    扫描的,真没有办法了吗

  • keery 08-11 17:57
    49

    百度最近开源了pdf扫描的

  • 9888 08-11 18:58
    50

    @barry66688 #33 把你的PDF文件存放路径告诉AI,让他自己解决

  • username123 08-12 06:37
    51

    @barry66688 #18 发布于2026/8/11 17:10:32


    @username123 #17 发布于2026/8/11 17:09:42

    可以,收点辛苦费,50


    要钱就算了兄弟


    你邻居是为了省打印费,让你给他弄电子版,你忙前忙后给他弄好了就直接给他了?

    我需要你这样的好邻居 ^-^

  • Venompool 08-12 07:02
    52

    你把这个帖子的链接丢给AI,AI就解决了

  • corenuclear 08-12 07:32
    53

    MinerU就行

  • aminis 08-12 07:43
    54

    MJJ手里的E3就能办到,不只是pdf,视频都行

  • pansir029 08-12 07:58
    55

    这不i很简单么

    先ocr识别 然后创建一个题库站 前提是有个虚拟机本地或公网都可以啊

  • 老衲推车 08-12 08:03
    56

    你炫耀过什么?

* 帖子来源NodeSeek
返回