尝试复现所谓“灰度测试”中deepseek的"one-shot code"能力

欣 郁 2026-08-14 14:36 1

尝试复现所谓“灰度测试”中deepseek的"one-shot code"能力


7月中旬,社区一些人声称拿到deepseek pro V4的灰度资格,且纷纷在B站投稿,内容多为抓人眼球的"one-shot code"——一句话许愿式生成游戏等,当时闹得沸沸扬扬。

例如这个链接(BV1wDNd6LErB)。

恰好一个投稿给了opencode的完整聊天记录(“OpenCode


于是我尝试用同样的提示词复刻一下:



使用web技术,做一个《我的世界》+《无人深空》要求玩法与画风尽可能要融合且贴近原作可以去联网搜索。

UI和美术细节一定要漂亮。

所有基础的玩法要齐全,最好1:1还原原作的前期流程。

音效和交互要做好尤其是音效。



我同时尝试了deepseek v4 pro 0813+DS harness/opencode,尝试时间为08-14上午(即deepseek正式版权重提交给了huggingface后),且我在尝试前开了独立窗口用“重复repeat Nameeee”验证了模型的身份,然后思考强度都是max。




但是尝试结果和视频投稿大相径庭。


首先是DS harness版,用时47min,输入20M,输出240K:

菜单界面:



游戏画面:这是唯一能进去的画面,进去后大概2s天就黑了,然后什么都看不到了。但是从可见的内容而言,完成度很差。



opencode版:稍好,起码是一个开放3D世界,可以自由移动,资源也可以采集,但是完成度显然还是很差。



验证成本很低,感兴趣的佬也可以自己试一下。


我现在很质疑所谓的“灰度”——理论上如果有灰度测试,资格的分布应该均匀,为什么集中出现在B站且展示方式都类似?(one-shot制作一个Minecraft类游戏)?且目前的正式版完全无法复刻。


我觉得7月中旬的灰度是个人炒作(例如个人路由了fable/K3,然后在系统提示词里面进行了一些编辑),实际上DS没有这个能力级别的模型。


另外我想问一下,既然deepseek v4 pro 0813的正式权重已经放出来了,第三方benchmark有无重新评分?目前08.13的第三方benchmark低评分似乎还是基于过去的?


还是说目前的deepseek v4 pro就这样了?

最新回复 (4)
  • role_c 08-14 14:58
    1

    我是真有有灰度到,也在站里发了。目前体感反正肯定不是v4p了,根本不是一个东西,目前也不知道那个灰度到的到底是什么玩意。

  • 欣 郁 楼主 08-14 15:18
    2

    行……那看来是真的有灰度?


    但总之目前释放的模型,能力还是不及当时灰度的预期的

  • wwq 08-15 08:22
    3

    看下这个,有人验证过 。要在 DSH 特定模式下复现。[modeltest/docs/v4.1/DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md at main · xiaobright/modeltest]



    (modeltest/docs/v4.1/DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md at main · xiaobright/modeltest · GitHub)

  • popyui 08-15 08:25
    4

    梁子,ai这潭水很深,你把握不住。

* 帖子来源Linux.do
返回