Grok 4.6 发布:Arena 前端开发榜第 5,Agent 成本更低

steve1996 2026-08-14 10:01 1

一、模型定位

8月12日,xAI 发布 Grok 4.6,官方将其定位为面向编程、Agent 任务和知识工作的模型,重点提升长链路任务的持续工作能力。


二、榜单表现




8月13日,Grok 4.6 High 在 Arena 前端开发榜中以1630分排名第5,落后第一名 Claude Opus 5 Max 61分。需要注意,这是一项前端开发子榜,并非综合总榜。



Artificial Analysis Intelligence Index 中,Grok 4.6 High 得分61,与 GPT-5.6 Sol Max 并列。Arena 更接近用户对开发结果的偏好,Artificial Analysis 则用于观察综合能力,两者不能直接比较。


三、API 调用成本

短上下文场景下,Grok 4.6 每100万输入 Token 收费2美元,缓存输入0.5美元,输出6美元。按100万输入加100万输出计算,总成本约为8美元,低于 GPT-5.6 Sol 的35美元和 Kimi K3 的18美元。

如果请求超过20万上下文,将进入长上下文价格档,输入、缓存输入和输出价格分别为4美元、1美元和12美元。


四、任务总成本

Cost per Task 指完成一项完整任务的总成本,除了 Token 费用,还包括交互轮次、工具调用和重复尝试等消耗。

一组围绕 AA-Briefcase 的运行统计显示,Grok 4.6 平均需要约53轮交互和0.5B Tokens,Claude Opus 5 Max 约需要103轮和2.0B Tokens。该结果只代表特定评测运行,不能视为所有 Agent 任务的普遍平均值。


五、自我校验能力

在长任务中,xAI 观察到 Grok 4.6 出现更多自我测试和验证行为。DeepSWE 得分从上一代的54%提升到65.9%,APEX-Agents 得分为57.5%。


六、后续计划

此前有消息称,xAI 计划在未来数周内推出 Grok 4.7,并进一步扩大模型规模。不过,具体发布时间、参数数量和性能表现目前尚未得到官方完整确认,仍需等待后续消息。


点此查看更多大模型排名数据

Arena双盲评测大模型权威排行榜

最新回复 (2)
  • Sic 08-14 10:09
    1

    kimi和千问这么厉害吗?

  • steve1996 楼主 08-14 11:15
    2

    @Sic #1


    kimi k3 和 Qwen 3.8 max 的参数量都在2万亿以上,性能还是挺强悍的.....

* 帖子来源NodeSeek
返回