据说 GPT6 的技术路线,可以压榨出十几倍的参数效果

siriusliangcn 2026-09-03 15:50 1

OpenAI 证明此路可行,那等几个月被开源模型们摸索清楚了,那岂不是本地 27b 的模型能跑出 300b 模型的效果?哪怕 12b 能出 100b 的效果也行啊!


要 token 自由了?


是不是可以 Mac Studio 买起来了……

最新回复 (7)
  • zhanying 09-03 15:59
    1
    不太相信,截止目前,“没有银弹”还是真理。。。
  • sentinelK 09-03 16:03
    2
    你如果只看跑分的话,qwen3.8-27B 的 xhigh 跑分,也可以和 flash-0731 有来有回。甚至吊打上 T 规模的老模型。

    但是这是春秋笔法,没意义。
  • cubecube 09-03 16:27
    3
    @sentinelK 有意义啊,3.8flash 很好用
  • shitshit666 09-03 16:55
    4
    @sentinelK 但是跑分的话,好像也是模拟日常使用
  • coefu 09-03 17:01
    5
    要是真行,全世界都不要新建 idc 了,openai 又找 amd 订了卡。

    当前 transformer 架构下,scaling law 依然有效。

    存算一体没有搞成之前,冯诺伊曼体系下,只有堆量,物理规律决定的。
  • sentinelK 09-03 17:09
    6
    @shitshit666 没错,但是很多维度的体验是跑分没法告诉你的。

    比如更小体量的模型,因为缺知识量,所以直觉更差,就需要更多的重试次数。
    比如为了能力更好,越小的模型性格越偏激,必须要拿到真凭实据(收敛到极致),导致 thinking 起来完全停不下来。
  • longaiwp 09-03 17:54
    7
    @sentinelK 这不就是跑分没有告诉你的事情,又不是跑分的设计有问题,你需要另外一个跑分衡量你想要的标准。
* 帖子来源V2EX
返回