鹈鹕、LLM与benchmark

ERROZER 2026-09-10 17:30 1

从不知道什么时间开始,鹈鹕蹬自行车就成了L站新模型必测的一环,如同纽北之于赛车,安兔兔原神农活之于手机,不管什么新发的模型,都得过了鹈鹕这一关。我必须得说一下叠个甲,每个让模型画鹈鹕自行车的人心态是不一样的,有些人是想用这样一个固定任务去测试不同模型之间在某一个固定能力维度的差异他知道自己在干什么;有些人是想看看前端能力如何,也没想证明下“模型智力到底是不是真的变高了”;最后一波也是我感觉大多数鹈鹕自行车的群体,看见别人测自己也测,画得好就“卧槽新王登基辣”,画得不好就“烂完了,狗屎一坨,某公司要完蛋”。鹈鹕自行车这个东西诞生其实不是完全没道理的,就是为了测试模型的写svg代码的能力,而不是直接性的图像生成,能考核“自行车和鹈鹕的几何结构”“’骑‘的空间关系和动作”。


一言蔽之,这个svg画得再好,也只能证明


这个model在根据文字直接生成svg这个非常具体的任务上到底执行是怎么样的水准


是没法单纯从这一个任务去推出一个模型真的比另一个模型强,AGI真的又近了一步的。


一个模型的表现和塞在什么样的harness里也息息相关,不同的任务也有不同的水平,如果想真的去判断一个模型到底适不适合自己当前的需求,最好的办法就是直接拿自己需求套上去试一试,其他所有人说的意义对你来说都有限,你到底是拿来读文献还是做前端还是做逆向,只有自己尝试了,才知道到这个模型在你自己配置后的harness下到底是什么水平

最新回复 (1)
  • zc Y 09-10 18:22
    1

    天天看鹈鹕真给我看的有点应激了,gemini每一个模型,鹈鹕骑车都是顶级水平(lite就别说了),但是能力不见得和那些顶级模型差不多,把这个当成模型能力测试,对现在的模型还是有点过时了,最疯狂就是0813那天,全是鹈鹕……,实际使用情况反馈的就一两个帖子,还全被鹈鹕给盖下去了,之前类脑那边在3.1p灰测的时候,也是各种svg测试,实际也只能说明前端能力不错,实际工程能力待定

* 帖子来源Linux.do
返回