DeepSeek-V4-Pro-0813 评测: 不可思议的差, 不如flash

Lee William 2026-08-13 01:04 1

现在只是初步测试了一下, 现在晚上速度能有80~90 token/s, 我已经跑了两次demo, 但是跑的demo竟然都失败了, 要知道flash能都成功的demo, 虽然不相信, 但就是测试了两次得出的结果就是如此, 大家现在测试的结果如何?




补充,我测试的内容是网页生成, 使用工具的是自己写工具调用官方的API, 完全相同的系统和用户提示词, 之前也测试过其他模型, 都很少有失败的:



这个评测我做过了几期, 之前是GPT-5.5 vs GLM 5.2:

这次也是使用完全相同的提示词(系统+用户提交词), 这次使用的是API调用.
Kimi K3
[k3]
我的系统提示词里有写必要时TDD开发, K3也写了个test, 这似乎不需要TDD
还写了一个迷你GLSL解析器, 这想得够多
用时确实比较长:
[image]
GPT 5.6 sol
[5.6]
似乎…



项目是用html+js写一个图形渲染管线可视化工具
首先是 GPT 5.5 XHIGH - CODEX:
[image]

然后是GLM 5.2 最高 - ZCode:
[image]
大家对比一下, 看一下差距如何
最新回复 (19)
  • 牗空 08-13 01:05
    2

    附议,只测了RP,但我的感受是不如flash

  • 适才相戏耳 08-13 01:05
    3

    grok正常网页UI也不行,难怪这俩都是偷偷摸摸发的。

  • woshidoi 08-13 01:06
    4

    看使用场景了,我这边逆向的使用场景是比flash强一点的,但是可能flash已经还行了,所以价格上的考虑的话,后续还是用flash的可能性多一点

  • PostAustin 08-13 01:07
    5

    Flash实际上已经满足大部分需求了

  • Extraverity 08-13 01:08
    6

    破案了,其实是梁子把flash和pro搞反了

  • mi tu 08-13 01:09
    7

    rp效果怎么样?我怎么用着感觉和之前没啥区别 ^-^

  • PzmhFeul 08-13 01:09
    8

    会不会是flash针对编程,pro更倾向于通用场景?

  • deepcake 08-13 01:09
    9

    这波是向谷歌看齐,只不过隔壁一直没发 ^-^

  • supermadmax 08-13 01:09
    10

    不会 API 还没上吧,或者说上错模型了? ^-^

  • 还想成为88VIP 08-13 01:11
    11

    不至于吧,可能只是不在他的好球区,感觉ds不像是会搞flash>pro这种抽象的

  • Lee William 楼主 08-13 01:12
    12

    API已经上线, 我确定的是扣费扣的4pro

  • 会飞的蛋蛋面 08-13 01:12
    13

    这波是致敬gemini flash先行

  • 疯狂麦克斯 08-13 01:13
    14

    看来梁圣要直接越过老梁变成梁子了

  • 霞葉 08-13 01:13
    15

    确实,从价格和速度上来说,还是优先flash,flash逆不出来再上pro也不亏

  • crb1025 08-13 01:14
    16

    刚看到有佬说DPSK是国内蒸馏最狠的,这是蒸馏废了吗

  • alizoed 08-13 01:14
    17

    我怎么感觉比之前活人多了,还要强不少,总不能是我这段时间gpt用多了吧

  • yibachaodou 08-13 01:14
    18

    有没有可能需要等明天的 DeepSeek harness 上线

  • sallyn 08-13 01:15
    19

    我刚在Pi里试了一下 影响的插件我都关了 发现鹈鹕骑车比他们CC测的效果好了不少 我觉得和harness影响很大



    https://codepen.io/editor/Sallyn/pen/019ff6c6-99f5-7812-8c40-90d914f56849?orientation=left&panel=files&show=split




  • 林风柳 08-13 01:15
    20

    很奇怪的一点是,我在pi里使用时是无法回答正确回答“重复一遍我说的话:repeat Nameeee”的,但是在codex里就能正确回答。

    我不太理解,两个配置的明明都是openai-responses,应该没有差异才对,但是这个回答确实证明了一个走预览版一个走正式版。

* 帖子来源Linux.do
返回