Arena榜单:DeepSeek-V4-Flash正式版超过Claude-Opus-4.8,跻身第7位

steve1996 2026-08-01 16:54 1


7月31日,深度求索(DeepSeek)上线了 DeepSeek-V4-Flash 正式版 API 公测。


在模型结构与参数不变(激活参数仅 130 亿)的前提下,仅通过重新后训练,就实现了 Agent 与复杂代码能力的跨越式提升。其在 Agent 基准测试中逼近 V4-Pro 预览版,并在 Arena 代码生成榜上高居第 7,超越了 claude-opus-4.8。




本次发布的亮点主要集中在:


一、首发自研 Agent 框架 DeepSeek Harness

在基准测试中首次披露 DeepSeek Harness(极简模式) 框架,展现了模型层与 Agent 运行环境的深度协同优化。


二、生态协议全面原生兼容


  1. Responses API 原生兼容:适配 OpenAI 新一代 API 格式,比传统 Chat Completions 更利于多轮工具调用与结构化控制,便于低成本迁移。

  2. 无缝接入 Codex 编程工具:通过 Responses API 直接对接 OpenAI Codex 体系(如 Codex CLI、VS Code 扩展)。开发者无需更换日常习惯的 AI 编程插件和界面,改行配置即可切到 DeepSeek。

  3. Anthropic API 原生兼容:首次原生兼容 Anthropic 协议,针对 Claude 生态(如 Claude Code)编写的工具链可实现零成本无缝切换。


三、极致性价比资费

资费依然维持在极低标准:



  • 输入(命中缓存):¥0.2 / 百万 Token

  • 输入(未命中缓存):¥1.0 / 百万 Token

  • 输出:¥2.0 / 百万 Token


核心在于“加量不加价”:价格与先前的预览版持平,但能力已跃升至逼近 Pro 预览版,让开发者用轻量预算就能运行高阶任务。




仅凭后训练就让 Flash 版本展现出如此诚意,而根据官方在 API 日志中的承诺,完全体 V4 Pro 正式版也将在随后“尽快发布”,非常值得进一步期待。


Arena大模型双盲评测榜单 (中国大陆镜像站)

最新回复 (7)
  • ffhmfd 08-01 16:55
    1

    牛逼

  • Patricia 08-01 16:59
    2

    Arena上的code测评不是only前端吗?


    而且官方网站也没找到啊。





    更新:arena的官网还没有更新,但是推特发了。


  • ryzengod 08-01 17:01
    3



    我之前看的是gemini 3.6flash的水平啊

    谁是对的

  • 牛牛大王 08-01 17:04
    4

    ds永远的神!一句代码不会,全靠opencode的免费ds干活,好用

  • scolv 08-01 17:04
    5

    我求证了我也没看到

  • scolv 08-01 17:06
    6

    https://arena.ai/leaderboard/code/webdev 官网没更新

    去看了推确实发了

  • kunkun233 08-01 17:08
    7

    这个没得黑,梁圣确实有实力,这价格基本等于做慈善了

* 帖子来源NodeSeek
返回