为什么每次发布新模型,大家都会用鹈鹕自行车测试呢

dayo 2026-08-14 00:10 1

不太懂个中原理,这个鹈鹕自行车可以说明什么问题吗?真心求解

最新回复 (11)
  • saiko 08-14 00:12
    1

    数据样本多,能够很轻松感受模型是否掺水,用其他案例参考样本不足,需要自己多轮测试

  • dayo 楼主 08-14 00:16
    2

    如果我只用来写代码,这个参考意义大不大呢

  • kevechang 08-14 00:17
    3

    那你这个代码也要分前端后端 前端的话有意义

  • saiko 08-14 00:19
    4

    这个主要是一个简便区分中转站模型是否掺水的方式,如果用官方的其实可以不用看重这个

  • dayo 楼主 08-14 00:19
    5

    那如果是后端呢?画得越好是不是也可以理解为逻辑思维越严谨

  • kevechang 08-14 00:21
    6

    这个硬要说也有 但是我觉得参考意义不大吧 毕竟屎一坨的 gemini 的鹈鹕单车还不错

  • dayo 楼主 08-14 00:22
    7

    那如果中转站知道大家这样测试,拦截这类题目返回一个和官方相同的效果,是不是就分辨不出来了(不是抬杠)

  • Eugene 08-14 00:24
    8

    最早是Simon Willison做的一个测试,生成一个鹈鹕骑自行车的SVG,作为他自己的LLM的基准测试;出于几个方面考虑:一是作者自己喜欢鹈鹕,二是生成SVG代码可以考验大模型对空间想象和指令遵循能力;三是他确信目前网络资源中不太可能有鹈鹕骑自行车的图片,不会被纳入训练;即使纳入训练,那一定会泛化到其他生物和交通工具上,这两种风马牛不相及的十五搭配微调,会让模型表现更糟糕;用来写代码参考意义不大,感觉一般来说中转站也不会去抓试题拦截,因为试卷太多了很难压中

  • jodyx 08-14 00:27
    9

    可以看看这个,鹈鹕骑自行车 最开始应该是来自 Simon Willison 在 AI Engineer World’s Fair 上的演讲

    https://zhuanlan.zhihu.com/p/1916192493843750970


    在Linuxdo上开始流行,我如果没记错,是来自grok4.5模型降智以后的吐槽贴,被大家围观,会心一笑,然后开始接受和跟风测试,也成了某种论坛「社交硬通货」。



    [image]
    本人为supergrok heavy用户。
    以上结果出自grok build 内的grok4.5 high模型,完全的gpt4水平。
    《震惊瘫坐,grok4.5已大幅度超越旗舰gpt模型!》
    跨时代提示词:“创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。”


    从那以后,每次有新模型,都会有佬友分享这个测试,而测试测多了,样本也多了,就容易产生非常直观的对照组。


    因为有了大量对照组,牛不牛,看一下就大概有个数了。

  • saiko 08-14 00:27
    10

    这个我不太清楚,不知道中转站的应对方式,不过这个也只是个偏娱乐化的方式,已经出来很久了,说不定有些模型官方都对提示词进行了针对训练,不能实际反应模型的能力,看这种测试就当看个热闹就行了

  • Limit 08-16 04:30
    11

    主要是用来检测“是否异常”,在你觉得正常的时候测一次作为标准,然后你时不时再测,看看有没有跟标准相差很远

* 帖子来源Linux.do
返回