Qwen3.8max注意力持平Opus5,Flash3.7超越Sol没人提这个事吗?

苍真 2026-08-18 21:17 1


contextarena上的,都是最高思考。

绿色是3.7 Flash

紫色是5.6 sol

橙色是Opus5

蓝色是Qwen3.8Max

灰色是K3(GLM5.2和K3差不多重叠了没放,之前上下文注意力一直是国模的通病,超过100K就胡言乱语)

最新回复 (12)
  • emmalien 08-18 21:20
    1

    干活效果呢,自从买了codex就没用过国内模型了

  • qyy 08-18 21:23
    2

    感觉,没啥优惠渠道用的人就不多,讨论度就不高

  • Kamome 08-18 21:24
    3

    3.7flash这么强?得去品鉴一下了

  • emmalien 08-18 21:25
    4

    明天评鉴一下,有公司的key 哈哈哈

  • SH 08-18 21:25
    5

    GF3.7 有进步啊,但是还是不够聪明,luna 都比不过。

  • ClaudeCode 08-18 21:34
    6

    27b的注意力咋样^-^佬是自己测得吗还是有网站看呀。虽然27b原生就256k,但是没用过小模型确实不了解了

  • FaulknerWu 08-18 21:35
    7

    qwen3.8不知道什么情况,gemini 3.7 flash 拉完了

  • 苍真 楼主 08-18 21:36
    8



    就叫contextarena.ai,27b似乎也很强,刚更新的,对比sol

  • zhangqy 08-18 21:43
    9

    注意力不等于实力吧。然后国模实在太贵了。

    谷歌的话,确实一直没用,它这个降智好像很严重,不知道现在好没好,之前他们酒馆的用户测谷歌好像只有二三十K的注意力。自己用中转的 3.7,我感觉可能没有这个注意力。根据一些远古跑分的结果,3.1PRO实力好像和gpt5.5差不多,但是实际降智程度都有目共睹。

  • ba lao 08-18 21:43
    10

    不会现在的那个 qwen 的负责人就是之前给 google 写 gemini 3 pro 专注力头的人吧。

  • ikb 08-18 21:46
    11

    捞针测试好像和注意力不是一回事吧。


    codex里sol context设到272是有理由的,确实在召回率的甜点上。


    kimi捞针从k2开始一直都不行,干不了重活。

  • MineMine 08-19 00:38
    12

    要是还有 0.02x 活动就是无敌的,可惜换不得

* 帖子来源Linux.do
返回