⚠️, DeepSeek-V4-Pro-0813 你们觉得怎么样? 我们部门内部盲测不如 GLM5.2

alanying 2026-08-13 19:00 1

光看榜单感觉也不是很靠谱。
最新回复 (27)
  • alanying 楼主 08-13 19:00
    1
    其实是 Qwen3.8 > GLM5.2 > K3 > DPSKv4 Pro 的但是标题写 Qwen3.8 怕被喷
  • shintendo 08-13 19:05
    2
    GLM5.2 > K3 是认真的吗
  • foryou2023 08-13 19:09
    3
    估计得重新测试了,官网刚刚才更新了更新日志,就是官方的 harness 还不发布,不知道啥时候发布。
  • shintendo 08-13 19:13
    4
    @foryou2023 说是明天
  • Miaoz 08-13 20:04
    5
    GLM5.2 > K3 认真的吗 +1
  • jackerbauer 08-13 20:52
    6
    主观太强
  • jackerbauer 08-13 20:52
    7
    不过 GLM5.2 > K3 ,确实离谱
  • cue 08-13 20:56
    8
    你们部门……是千问团队吗……
  • Qmanman 08-13 20:57
    9
    glm5.2 不太行
  • isbase 08-13 21:34
    10
    据说模型上错了 再用目前的版本试试
  • alanying 楼主 08-13 21:35
    11
    @jackerbauer @Miaoz @shintendo 确实主观性比较强


    @cue 🤣 我要是千问团队我都不敢对外讲,名声不好。
  • alanying 楼主 08-13 21:35
    12
    @isbase 还有这回事
  • bowen628 08-13 22:46
    13
    官方 harness 已经发了,包名 @deepseek-ai/dsh ,这轮盲测可以顺手重跑一次。模型横评不固定壳,工具 schema 、prompt 拼法、上下文回放全会混进分数,最后测的其实是 model+harness 。利益相关:我参与 BitFun ,我们这边一直把 prompt 做成字节级稳定,SWE-Bench-Pro 那轮 KV cache 平均命中 98.67%;拿同一仓库在 DSH / BitFun 交叉跑,应该比只看榜单有意思。
  • Tink 08-13 22:47
    14
    测试方法是啥啊?
  • exhades 08-13 22:52
    15
    GLM5.2 是什么路边,我这边都是 K3 > qwen3.8max > dsv4Pro > GLM5.2
  • cowcomic 08-13 23:02
    16
    据说已经下架了
  • xiaoz 08-13 23:24
    17
    @cowcomic DeepSeek 官方公众号已经宣布正式上线了。
  • lsylsy2 08-13 23:42
    18
    @exhades v4pro 预览版我感想是不如 glm ,正式版还没测
    @xiaoz huggingface 撤回了,链接进去是 404
  • renzhe8102 08-14 00:41
    19
    @exhades k3 路边
  • FantaMole 08-14 01:22
    20
    之前在梁子的那个内部会议的纪要出来的时候,我就在论坛里的一个帖子提过 DeepSeek 一直是个小而美的公司,梁子本人是很有理想,但是其他人是要吃饭的,这个扁平化的理想主义管理架构在拉进来一堆人之后可能很难管。就 13 号这个混乱百出的样子,感觉可以一窥内部的失控样子

    DeepSeek Pro GA 没有让我感到有惊艳的地方,由于公司项目我搭了一套 AI Coding Framework ,所以只要模型不是太差,能够有 GLM5.2 级别的能力,大部分工作不会有太多体感差距。不过今天处理的一个复杂问题,处理结果不及预期,最后是用 opus5 处理掉的

    DeepSeek Harness ,刚刚才有空探索了一下项目,准备明天尝试一下。不过看知乎上的评价,感觉一堆人说了半天没有重点不知道说了什么东西,全在聊拓展性
  • aarontian 08-14 04:18
    21
    你们部门的评测标准是模型命名是否符合社会主义核心价值观吗。。
  • phrack 08-14 06:25
    22
    @FantaMole 做量化交易的你说理想主义?

    你是说理想是赚钱吗?
  • yuzo555 08-14 07:47
    23
    官网的 API Pro 现在是对的模型了吗?消息很多
  • FantaMole 08-14 08:19
    24
    @phrack 因果颠倒,是已经靠量化恰饱饱了,恰到财富自由了,才开始有兴趣搞 DeepSeek 去追 AGI
  • martinm 08-14 08:56
    25
    自用 K3 > GLM5.2 > DSV4 Pro ,

    顺便一说 KimiCode 开集群模式 + DSV4 Flash 子模型 绝配
  • Auston 08-14 09:04
    26
    有点怀疑你们部门的测试能力,哈哈哈,就跟我们公司一群人在那胡测一下,公司自研模型已经比肩 deepseek 和 glm 了,这你敢信?
  • FakerLeung 08-14 09:19
    27
    笑死了,想起我们大部门的 7 月份的测试结果:
    deepseek-v4-flash-preview 不如 glm-4.7
    deepseek-v4-pro-preview 不如 glm-5.0
* 帖子来源V2EX
返回