盲猜一下Deepseek V4 Pro 正式版出来能干过GLM 5.2 和K3吗?

Diako 2026-08-03 11:25 1

如题,根据当前deepseek v4 flash正式版的的效果,佬们觉得Pro正式版效果会到一个什么水平

最新回复 (19)
  • WWT 08-03 11:27
    1

    之前看灰度正式版的时候感觉就已经能干过glm5.2了 B站上好像有一个测试视频 fable dsv4pro glm5.2 k3 一起比试一下那个引擎骨骼动画之类的 效果和fable真的接近 一度让我相信真给我路由到fable去了^-^

  • xiaosanmu 08-03 11:28
    2

    体感上,flash 比 5.2强,速度快,而且价格也便宜。

  • ppdx 08-03 11:28
    3

    马上智谱也会端新的模型出来了。而且换了基模,就不要用现在的模型互相对比了。

    到时候应该就是 V4的正式版,打新的 GLM 的模型了。

  • 00:00 08-03 11:29
    4

    pro干过glm5.2是绝对的,一是模型参数量,二是多了2个月的后训练时间

    k3的话不好说

  • Diako 楼主 08-03 11:32
    5

    因为GLM 5.2实际用来干过活,效果确实很不错,比较有参照

  • Diako 楼主 08-03 11:33
    6

    目前B站的正式版的测评看起来是差不多,有一些方面比GLM5.2差一点,前面用这个干过活确实可以

  • 老玉米 08-03 11:34
    7

    我自己这两天实际体验下来,v4-flash真的快,也真的便宜,9.5亿token才37块钱,能力和glm5.2相比,确实差不多,不同场景下,效果各有胜负

    所以V4干过5.2应该没问题,至于K3,我没有深度使用过,就不评价了

  • meme 08-03 11:35
    8

    b站那个感觉不可信,都是几百个粉丝那种号发的,有点像骗流量的。

  • jcc 08-03 11:35
    9

    之前有人说ds路由到了肥波或者opus


    实际上是路由到了ds的正式版flash上了


    这要是pro版本,感觉应该会更强

  • undefined 08-03 11:36
    10

    v4f喜欢自己加戏,即做过度设计。

    一句话做xx的时候,是需要这种能力的,

    但是对现有的东西进行升级改造加新功能,这玩意就是纯属添乱了。

    所以我挺讨厌那些一句话xx评测模型能力的。

  • jcc 08-03 11:36
    11

    不过,v4的【有效】上下文很长,所以改现有的大型项目的时候,对项目整体的理解非常的稳


    不像某些模型,完全是凭经验凭知识去猜项目的情况,ds是真的能都读进来理解


    就是flash的知识和智商差了点

  • blaumeer 08-03 11:38
    12

    没有多模态还是不方便,不过作为备用还是可以的

  • Diako 楼主 08-03 11:43
    13

    前面开了个qwen的plan,不然也去用ds了,得先把额度用完,1389,ds都可以用几十亿的token了,qwen3.8用起来也差强人意,不太行

  • 项太傅 08-03 11:46
    14

    干掉 GLM 5.2 感觉一点问题没有,但是 K3,难说得很。K3 是个很全面的模型。

  • mark 08-03 11:47
    15

    flash都这个样子了,5.2不和路边一条一样被踹死了吗 ^-^

  • 焕昭君 08-03 11:48
    16

    这是真的,特别是2api、浏览器自动化这块…

    ds4f一言不合就开干,嘎嘎开干,管他什么干实践出真知,主要是ds4f也速度很快很多东西很快就能实践出结果的。浏览器自动化这块也操作的很快…

  • xwl 08-03 11:50
    17

    有多模态必定干过,价格摆在那,k3太贵了。

  • 若时间无垠 08-03 11:51
    18

    glm5.2能干过,但是k3不好说,毕竟k3有多模态,能直接做一些事

  • 项太傅 08-03 11:52
    19

    模型拉不开差距的,梁文峰在投资交流会说了,各家人才差不多。DS 最强的是 infra,然后 harness 值得期待。

* 帖子来源Linux.do
返回