让 AI 来批改或者辅导孩子学习在现阶段可能并不是 100% 可行

BOOSTMEISTER 2014 DH 2026-08-29 22:00 1

最近我发现开始出一些类似于“AI 搞批改”的软件或商家。我觉得即使抛开他们利用焦虑、命中需求这一点,单纯谈技术本身,它也不是一个特别成熟的东西。我本身有相关需求,所以来说一下为什么它并不是一个特别好的 idea。


VALS.ai 有一个测试集叫 SAGE(SAGE ),我简单介绍一下:它包含微积分、偏微分方程以及线性代数,数据都是他们和合作伙伴收集的真实学生作答。每个批改都有批改点,比如某个过程有没有拿到分。他家主要提了以下几个问题:




  1. 不同模型给分标准完全不一样。 不存在某一个模型特别能打分,很多模型要么过松,要么过严。




  2. 评分两极分化。 正常评分虽然是大头,但过松和过严的占比并不小,两边的比率还是挺大的。




  3. 做题强不代表批改强。这个倒也正常,但我没想到测出来差距很大。虽然现在模型做题很强,但批改起来并不一定强。哪怕它做题可能百分百全对,批改的正确率可能只有 40%~50%。




我自己用下来还有一个体会:模型有时候看不清楚学生的具体结果和过程,它可能根本没读对写了什么就开始判断了。


不过我的看法也有局限性,比如

提示词和 harness 和手段,比如自动裁剪区域帮助模型理解过程,个人认为能大幅提升表现,但具体会不会影响这个问题,我不确定,VALS 那边也没有测试这一点。


当然,我当时确实不清楚偏微分方程和线性代数有多难,毕竟这几个学科上限都很难,但这还是有一定参考价值的。我觉得更难的,更复杂的可能是有影响,但这更说明目前不好下判断。我觉得小学、初中甚至高中水平可能表现会明显好很多,但没有对口的测试结果之前无法下结论


还有 SAGE 有一个不一样的地方:它的需求更偏向老师那种统一的、大批量的批改,打分就行了,而我想的其实是辅导。你想,我们是辅导孩子,而不是批改孩子,批改那是老师该做的。虽然这里有个错位,但它反映出的核心问题是一样的——模型很难理解学生的思维过程。这其实很好理解,就像一个人去看另一个人的解题,也不太好想象他是怎么做到这种结果的。批改尚且如此,辅导的要求只会更高。


所以我的想法其实就是:AI 可以辅助,但最终还是得靠人来辅导孩子,靠学生自己来讲他为什么这样做。当然,每天下班也挺累的,但我觉得确实还是得靠人。


更深层的是,对于 K12 这种阶段的教育,给孩子用 AI 我是非常谨慎对待的。因为这很容易产生依赖,孩子可能还没有形成主动学习的能力,我们也不能单一地采取它的答案。


这篇文章写的其实不太好,辅导和批改两个观点撞在一起了。但是确实我觉得未来这种批改辅导是常态,但现在其实并不好直接铺开。差不多就这个意思。估计这类产品过几个月会如春笋一般冒出,比如需求是实打实存在的。


我本人非常看重 AI 在教育中的应用。当然我们尽量看那些不会让人失业的方向,我认为未来一定是 AI 辅导。收集数据和提升相关能力是大势所趋。我对教育学的理解很片面,但似乎确实各种教学方法无法得到进一步应用的一个大原因就是教育不像社会学那种,它需要大量老师,但是又不可能有那么高的老师占比。但现在的相关应用普通人得警惕,它可能远不是你想的那样好用。

最新回复 (3)
  • qwerqwer1236 08-29 22:05
    1

    就像做项目得有思路一样,用ai学也是得有一个大体的思路的,孩子得先意识到自己在学什么,觉得哪里有疑惑拿去问问ai,而非拿到个问题直接去问ai怎么做,这和拿拍题软件直接搜答案没任何区别

  • ooyy 08-29 22:40
    2

    没错,ai是能力放大器,但是自身能力不足,拿到也是小孩穿大人衣服,发挥不了ai本身能力

  • Uncle Money 08-29 22:55
    3

    先把不好听的说在前面:佬想得有点多了。


    当前阶段,整体 K12 教育的主要路径还是“应试”,这部分其实特别适合 AI 参与,因为评估标准是统一的,跟着教学大纲走即可。最终考核的题目也不会超出大纲范围。


    而佬关注的其实已经不是“应试”方面的教育,因此才会产生疑虑。这部分因为涉及到教育本质的探讨,我们就不展开了。


    说回“应试”教育领域,推荐佬可以与 AI 聊聊“教学效果验收”方面的话题。

    而佬关注的孩子的“思维”,可以了解下培训机构的“双师”策略。

* 帖子来源Linux.do
返回