豆包新模型测试效果SOTA比肩fable5和gpt5.6

zhongruichen 2026-06-23 01:41 1

豆包新模型几天前开始在火山方舟codingplan进行灰度,glm-5.2,kimi-k2.7-code,minimax-m3等第三方模型会概率路由到一个神秘模型,应该是就是arena这个新的豆包新模型,1m上下文窗口,max_tokens最大为131072,思考是思维摘要,tps在一百左右,我测的极限在163tps,至于其他的不说这么多了,我先直接放个压缩包,里面是我测的一些文件,可能有奇奇怪怪的乱命名,特别说明一下(标注m3的文件不是m3生成的,是通过m3路由的,标注m3的是思考版本,同理标注k2.7的是通过k2.7路由的,是无思考版本):

测试文件.zip (1.4 MB)




注意!下面的所有测试全都是one shot,模型单次生成的单html/svg效果,没有在agent环境测试过




这个新模型的svg质量很强,我认为可以排进svg前3,跟gpt-5.6检查点和fable5接近

同提示词,这个是豆包新模型:



这个是在Design arena的fable5(不清楚是思考开到多少的):


另外欣赏豆包新模型的svg:












































精灵宝可梦:




































然后是投石机:














天气卡:








还有一堆懒得分了:




















































































































好了,就到这里吧,综合评价给到夯

最新回复 (19)
  • wklwkl 06-23 01:44
    1

    我靠,看佬的测试结果,这豆包新模型有点强啊,第一个电脑桌面mc游戏图甚至比肥波5还强啊,细节更丰富。真让豆包做成了?先是glm5.2,又是豆包,国模王朝难道要来了?^-^

  • Coeeshu 06-23 01:44
    2

    卧槽 这个svg也太狠了 鹈鹕骑自行车这个

    这是把three.js运用的炉火纯青了啊

  • 吃豆人 06-23 01:44
    3

    好,我宣布现在只有哈基米是北美大豆包了,豆包已经成为中国gemini了^-^

  • 灰質心 06-23 01:45
    4

    “我瘫坐在谷歌deepmind实验室的椅子上,仿佛看见了原子弹爆炸”

  • 蛋炒饭 06-23 01:45
    5

    这个看起来不错啊,难道豆包后面的付费应该是配合这个来推出?

  • 吃豆人 06-23 01:49
    6

    现在gemini再不加把劲连大豆包都称不上了

  • PositronCannon 06-23 01:54
    7

    什么,豆包又又又又又又sota了?

  • HRC 06-23 01:55
    8

    这水平要是推订阅制度倒是说的通了呢 好顶呀

  • XTer 06-23 01:56
    9

    那如何知道自己被路由去新模型了呢


    我也在用coding plan,指定glm5.2

  • accouer 06-23 01:57
    10

    这个水平,为什么我觉得还不错呢,难道是我的错觉?

    感觉还可以啊?

  • 吃豆人 06-23 01:58
    11

    字节发力了,只能说如果字节发力,确实可以有这样的效果

  • PositronCannon 06-23 02:00
    12

    啊呀没有办法回复boost

    因为每次豆包开始内测新模型的时候,L站首页总是会出“大幅提升”“跃升第一梯队”“不输sota”之类的帖子,给我看乏了。

  • zhongruichen 楼主 06-23 02:02
    13

    这几天我都是稳定被灰度路由到,然后今天豆包新模型信息出现在arena后我的号就没路由灰度了,可能是要发布了,所以下掉了灰度可能,你可以试试max_tokens参数配置为131072,如果glm-5.2请求没报错就是灰度了,glm-5.2在火山的max_tokens最大是128000,如果报错就还是5.2 没报错就对了,另外可以给glm-5.2传图,模型可以看到图没报错也可以验证

  • karx 06-23 02:07
    14

    哦天,好多图,我手要划断了。

    手柄那个,我记得几个月前gemini就宣传能绘制精美手柄了,特还原的那种,不知现在还行不行了

  • zhongruichen 楼主 06-23 02:08
    15

    gemini越更越差了,目前模型审美严重退化很难画出之前那种了

  • MigitaRin 06-23 02:09
    16

    我的妈呀吓哭了,这相比2.0pro纯粹质变啊

  • haowang 06-23 02:09
    17

    这么强吗?以后再也不能吐槽豆包了,还有什么值得吐槽的呢

  • XTer 06-23 02:10
    18


    可惜?


    我一个号没被路由到;


    然后另一个号:给我干哪来了,这还是国内吗


  • MigitaRin 06-23 02:10
    19

    现在看来Gemini真的是野狗一条,t0级别的实验室,却因为公司的降本策略只能端出来一些削弱到极点的废铁

* 帖子来源Linux.do
返回