Roboflow更新了GPT-6 Astra的视觉测试结果,略微领先Gemini

Jeff Dean 2026-09-06 17:33 1



横轴成本有拉伸,GPT-6 Astra平均每个任务的成本是 Gemini 3.8 Flash的10倍


https://playground.roboflow.com/evals

最新回复 (10)
  • LIFE001400 09-06 17:36
    2

    作为一个数学老师,每天我都在给 AI 发送大量的学生完成的作业。


    说实话,Astra 出了之后我也尝试了。我不知道在其他方面视觉能力是怎样的,但是我知道在识别人类手写痕迹和对应的题目这方面,gemini 还是断层领先。目前 GPT 还是有很多识别错误。Gemini 几乎接近人眼。而且感觉 Claude 的视觉能力非常的差劲,远远不如排行榜上的跑分。几乎是什么都看不清,连题目都看不清,更不用提同学的手写痕迹。


    日常去批改,更多的是使用 Gemini 和 kimi。

  • Re-bo-t 09-06 17:38
    3

    准确率很高吗?这个准确率可以支撑自动和批量化检查作业吗和评分吗

  • LIFE001400 09-06 17:39
    4

    识别正确率几乎没有问题。批量化我不太确定,因为我是逐个题目发送的。感觉 Gemini 的智能可能还不太够。我不太敢把题目一次性全部发送。然后 kimi 的智能会更高一点,但是可能识别的正确率会稍微低一点。但是也是可用。剩下的 GPT Claude 在实际工作当中基本上没有办法使用,识别错误率还是太高了。

  • GloryDuck 09-06 17:40
    5

    今天心血来潮,让AI分析下我的鞋底磨损图。
    GPT5.6-sol、严肃思考60秒,然后长篇大论,分析的头头是道,还结合我之前提到的右脚足底筋膜炎,说根据鞋底磨损情况,正好说明了为什么我右脚有足底筋膜炎,布拉布拉布拉。
    越听越不对劲,我就看历史记录,发现这小子一开始就把左右鞋认错了。
    换了个新会话也是一样。最近AI进展迅猛,没想到这种地方仍然会犯错 ^-^(有点类似洗车问题了)
    [i…


    5.6的视觉很拉,哈基米很强,qwen3.8 max也很强。


    astra现在能分清左右鞋了吗




    可以了,轻松分清楚,排行榜有效

  • Re-bo-t 09-06 17:40
    6

    哦哦,我觉得可以试试批量化一下,就是不然还是有点花时间太多,可以先让gemini ocr 全部内容之后让luna来评分


    gpt文字应该还是没有问题的 ,同时luna价格又便宜

  • XiangKu 09-06 17:41
    7

    Claude长期喂题还会让你验证是否是成年人 就很无语^-^

  • Smoaflie 09-06 18:24
    8

    可以问问佬的工作流吗,我最近也想搞个自动帮小孩批作业的小工具

    看佬的描述,用Gemini识别文字,然后输出成latex公式给别的模型去解答效果会比较好?

  • neteroster 09-06 18:32
    9

    值得一提的是,还有一些其他私有视觉bench榜单


    例如 eyebench







    Astra 在空间和位置关系的理解上目前看来远超任何其他模型(并且这个领域一向是被认为对于LLM视觉最困难的一部分,所以我觉得还是很有含金量的)

  • 内一衡径数 09-06 19:44
    10

    Gemini 应该是谷歌这么多年机器识图的积累的反馈, 但是对二维之外的理解不行(这部分依赖模型能力)

  • Joe-Lake 09-07 00:02
    11

    这成本差距有点离谱,roboflow那个 playground 里能直接跑对比,我试了下同样 prompt 输出质量差距没价格差那么大,等降价再碰

* 帖子来源Linux.do
返回