关于国产LLM的差距

欣 郁 2026-08-01 08:17 1

感觉还是要正视国产llm和国外的差距。


客观事实:


1)deepseek v4 flash ga在8项agent相关评分都超过glm5.2


2)deepseek v4 flash ga在agent评分上和gpt 5.6 luna互有胜负,整体小负;


3)deepseek v4 flash ga在agent评分上,全面落后opus-4.8;


结合主观感受(网上评测、个人体验),如下鄙视链基本是合理的:opus-4.8 > gpt 5.6 luna >= deepseek v4 flash=glm5.2。


好,那么让我们清理一下记忆,回到07-31之前:当时deepseek v4 flash ga尚未发布,国模声势最大的就是glm5.2和kimi-k3.


我截取了2026.6.1至2026.7.31之间的搜索结果(尤其是第一个链接,小蓝书问题下的回答)


如果单单从“中文互联网舆论”来看,glm5.2的能力甚至都能与opus 4.8比肩。


但实际情况如何?昨天(07-31)我们看到了,glm5.2是和deepseek v4 flash差不多的模型(agent能力稍差,但参数量大,实际表现可能略好),都谈不上稳吃gpt 5.6 luna。


即在26-7-31之前,除了kimi-k3(和qwen3.8 max),其他所有国模无论是性能还是价格,都比不过gpt 5.6 luna。而kimi-k3的推理产能根本上不去(各种限购),更多是象征意义,实际意义有限。


即:


1. 尖端模型:仅个别国产模型性能达标,但受限于算力,对全球市场份额几乎无影响;


2. 腰部模型:若掀开传统印象的遮羞布,gpt 5.6 luna才是真正的价格屠夫/斩杀线


实际上这个结论在此刻(08-01)仍然没变:gpt 5.6 luna仍然比最好的国产腰部模型(v4 flash ga)要略强,考虑到支持多模态的特性以及同档位的价格,“抛开可及性不谈”,似乎没有理由不选gpt 5.6 luna。v4 flash ga仅仅在国模的优势主场稍微找回了场子而已(可以想象如果没有v4 flash ga,国模的劣势有多大)——这个格局可能得v4 pro ga才能改善。


国产LLM的处境实际上完全与舆论的火热相反:中文舆论有过多虚美之辞,而英文舆论吹国模也是为了对OA两家哈气。但实际上国产LLM的差距仍然很大。


引申一些推断:


1. 根据deepseek的朴实风格,你可以永远相信它的跑分的客观性;


2. 八月初发布deepseek v4 pro ga,官方自己必定会和kimi k3、fable、gpt5.6sol比较,到时候就可以知道kimi k3的真实能力档位。

最新回复 (19)
  • jcc 08-01 08:20
    1

    luna只是标价和ds差不多


    真要写代码用起来你就知道了


    ds的价格是真的低,关键就是ds逆天的动不动能缓存12个小时的硬盘缓存


    最后,实际上,开源的问题就在这,你觉得开源落后,其实可能是因为闭源也在同步的跟进和使用开源的技术,所以闭源会比开源领先一些


    但是,你要知道,dsv4flash,用到的技术,全都是4月份的,这个ga版,只更新了后训练数据而已


    那么,4月到现在8月,这段时间,ds的技术难到没有迭代吗?可以猜一猜,肯定还有东西没拿出来的

  • 卡里姆•汗 08-01 08:21
    2

    好奇luna的常规缓存是多少,ds基本都是99,感觉要加上缓存进行考虑

  • KILITER 08-01 08:23
    3

    说了这么多到底想表达啥意思?佬友

  • kk C 08-01 08:23
    4

    我觉得就是深度思考的Grok4.5水平

  • ba lao 08-01 08:27
    5

    GPT 5.6 Lunna 成为新的国模斩杀线。

  • 欣 郁 楼主 08-01 08:28
    6

    我只是吐槽一下,gpt-5.6-luna真的造成了国模危机(即使v4 flash发布也没完全改善),但“2026.6以来,中文+英文舆论对国模舆论热度”似乎遮盖了这一点。。。。

  • markk 08-01 08:31
    7

    那么这种情况下谁还用glm5.2,智谱咋整啊

  • jcc 08-01 08:31
    8

    真要有危机,对面的危机更大


    你想想啊


    luna能解决问题的话,他们的100刀 200刀的订阅,卖给谁啊?大家都用luna,他们岂不是要倒闭了


    这个斩杀线,对所有人都一样的,OpenAI 和A 社自己,他们也跑不了

  • Anemo_Slime 08-01 08:32
    9

    差距不是很大的情况下,模型滤镜可以弥补这一点了,喜欢用谁就用谁。

  • wjy 08-01 08:32
    10

    这么便宜的模型能和grok4.5有来有回,如果我是友商我直接吓哭了

  • 卡里姆•汗 08-01 08:33
    11

    说实话,至少我深度体验下来,gpt5.5末期的5.5(high)是打不过glm5.2,就后端比glm5.2强,但是强不了多少,但是现在不好说,所以评价要看时期的,如果是5.6出来之前的glm5.2确实强,5.6系列也确实拉开了距离,但是我当时用的是sol,现在luna已经大于5.2了吗

  • apparition 08-01 08:33
    12

    放心,luna 很快就会降智平衡性能溢出

    deepseek v4 flash 或其他国模不降智

    仍可一战

  • 欣 郁 楼主 08-01 08:33
    13

    我理解luna和dsf(deepseek v4 flash ga)应该是同一个档位的价格?

    中少量、pay as you go式地使用肯定dsf占优;大量使用,luna有codex订阅,所以可能能做到价格相当?


    但这种功能腰部模型,一般用量就是很大的(代码和办公自动化场景)。


    且luna还有多模态、耗时低(粗看测评大概2-4倍)、每任务消耗token相对少——综合来看如果luna实际价格哪怕是dsf的2-3倍,市场都可以接受?

  • jcc 08-01 08:35
    14

    luna有订阅


    其实,ds也有订阅啊


    比如,各家的编程工具的套餐里,dsflash 甚至都有直接免费的


    算下来,几乎都比gpt的便宜

  • imgdo 08-01 08:35
    15

    确实这样的,我有个聚合国模渠道,自己一直用luna和前段时间的5.4mini,很容易对比出来

  • 欣 郁 楼主 08-01 08:36
    16

    确实,虽然很难承认。

    而且5.6 lunna是6月就发布的模型了,也就是国模在传统优势领域已经落后2个月了,但舆论和实际处境完全不符合。

  • jcc 08-01 08:38
    17

    一个冷知识,dsv4flash的架构和模型结构是4月份的


    只是更新了后训练数据


    luna虽然是6月的,但是也是最近才更新了架构然后降价的


    你可以认为,后训练的数据 OpenAI 领先,但是架构的话我认为ds领先

  • 小八 08-01 08:38
    18

    实际体验下来 luna的解决能力一般般 开到max 实际上也不如v4 flash ga oai的建议都是luna作为调用工具使用 我拿v4 flash ga写的代码让opus5去给我review 体感是非常好的 基本上都可以正常交付了

  • ba lao 08-01 08:38
    19

    正常很多舆论都是一群非技术的人带出来的。

    你单论舆论没什么意思,还是要看实际。

* 帖子来源Linux.do
返回