【求助!真的是崩溃了】豆包爱学拍单题批改是怎么快速准确定位到题干信息的?他们自己训练的模型?

打不过你就跑快点 2026-06-04 19:26 1



需求是:拍摄后整页后在2s内就能自动调整边框,准确定位单个题干和图形(也就是题块)


我观测豆包基本10次中9.5次能成,而且速度奇快。


我用ocr,怎么滴也得7,8s,太慢。


再用layout切版面题块,效果不太好,经常不是丢题干就是少选项。


难道他们训练了题块识别模型来单独解决这个问题?


有懂的佬么,解个惑吧,折腾2天了 ^-^

最新回复 (19)
  • Bin 06-04 19:28
    2

    蹲一个,最近我也在解决这个问题

  • Kaijun 06-04 19:30
    3

    感觉豆包的交互真的做的很好,虽然模型有点拉

  • 白芸汐 06-04 19:30
    4

    难道他们训练了题块识别模型来单独解决这个问题?



    也不是没有可能,因为识别题块这个事情是不难的,是粗略的切割,所以训练一个这样的模型成本不高,题块数据集大把的

  • 娜娜米 06-04 19:31
    5

    应该就是单纯内置了题库或者用题库训练了吧,豆包只要找找里面有没有类似的题就行了




    然后我问了一下豆包:



    第三个是抗干扰,不容易被环境影响。

  • 打不过你就跑快点 楼主 06-04 19:34
    6

    大哥,你认真的么,我趟下来可不是粗略的切割,一粗略效果差老远。能举个例子么?

  • yu_y 06-04 19:35
    7

    DocLayout-YOLO + Ultralytics + CVAT试试?

  • 打不过你就跑快点 楼主 06-04 19:36
    8

    K12全靠题库命中,那题库也是海量了,关键命中的也太快了,2s内

  • kpthread 06-04 19:38
    9

    以前没有ai的时候,猿题库之类的软件就应该是ocr来识别,然后找题库。话说就算用ocr然后百度相关题目也不用7,8s了吧

  • 娜娜米 06-04 19:41
    10

    反正技术角度是不难,而且豆包应该是用 AI 多模态模型来识别的,AI 这方面天然有优势,很快就能匹配是哪一题,比传统 OCR 还是好用不少的

  • 打不过你就跑快点 楼主 06-04 19:41
    11

    我用的mineru的云端服务,7.8秒还是裁切后的效果,整页下来更扛不住,如果paddle本地部署应该会好一些

  • 打不过你就跑快点 楼主 06-04 19:43
    12

    Ai是肯定没有那么快的,他默认AI极速解题,2s内,又准又快,反而切到AI深度思考,还不一定能答对。

  • 云馨 06-04 19:43
    13

    他们有很多标记数据了。之前猿题库那些需要自己扣,这些扣的数据和图片可以被记录,被用于训练,都是免费的标注呀

  • 白芸汐 06-04 19:44
    14

    我说的意思是粗略的切割指的是不需要OCR识别文本的,只需要切割出来题块即可,这个yolo即可做到,而且可以做到非常快,这个技术AI没出现之前夸克就能做到了,识别题目的话一个快速的多模态小模型就可以实现,这就是豆包的强项

  • 白芸汐 06-04 19:45
    15

    解题能力不行背题能力还不行吗,全部背下来不也是LLM的强项吗

  • 娜娜米 06-04 19:46
    16

    因为深度思考调用了思考啊,自然慢一点,而快速就很快了,不信这题你去豆包本家快速模式问问,也很快就出答案的,然后深度思考出错就是 AI 模型能力不行了,快速模式是直接给你找参考答案

  • LingL 06-04 19:46
    17

    自动切割找边框,应该在作业帮时代就能做到了吧?

    (在完全不懂AI的情况下,我能想到的法子可以:按字符密度考虑,密集的那一块并且在照片中央的,大概率就是你想拍的题目)

  • 打不过你就跑快点 楼主 06-04 19:47
    18




    现在的问题就是,没有ocr,就无法准确命中题块,如上图,不是多了,就是少了。上了ocr,速度慢了。

  • chen gui 06-04 19:48
    19

    应该是用到了别的图像识别 或者切割的算法模型

  • 娜娜米 06-04 19:51
    20

    至于定位的话也不难,确实应该是专门训练过,毕竟现在很多确实考验识图能力,判断你想问哪里

* 帖子来源Linux.do
返回