Gemini 4 Argon 全知指数,低于前代Gemini 3.1 Pro、3.8 Flash,或定位Sol/Flash/Sonnet级模型

PSP 2026-10-02 10:49 1

这个参数和模型的数据知识量有关。Gemini 4 Argon不排除是可能是Gemini 4 Flash的前身,因为测下来分数大致类同Gemini 3.6 Flash这个等级,正式版后训练优化,有应该能超过Gemini 3.8 Flash,对标Gemini 3.1 Pro。


可能并非旗舰超大杯(Fable级,Opus级)


[AA-Omniscience Accuracy]是一个用于评估大语言模型跨领域知识可靠性的基准测试。该基准包含6000个问题,覆盖六个领域下的42个主题,核心指标为全知指数(Omniscience Index)**,其分数范围在-100到100之间,综合评估模型的事实回忆能力和知识校准能力。


Gemini 4 模型的设计思路,和之前 Gemini 3完全相反了。


Gemini 3是疯狂堆积总参数,激进缩小激活参数。最后非常疯狂,虽然代码和代理能力不行。但是全知能力,Gemini 3 Flash可以吊打当时旗舰Claude Opus 4.5。Gemini Flash 3系列的全知指数,大幅强于Claude Opus 4.5/4.6/4.7/4.8四兄弟。



搞了半天, Gemini 4 Argon 可能就是Gemini 4 Flash?Pro就要断更9个月了
Pro继续难产吗?

[image]


真正的Gemini 4 Pro可能和Gemini 3.5 Pro一样,还在后训练中 ^-^


@yeahhe


最新回复 (13)
  • ba lao 10-02 10:53
    1楼

    不会是学习了面壁智能的高性能低参数量的策略吧

  • jzhone 10-02 10:56
    2楼

    Google它还是那么爱Flash

  • PSP 楼主 10-02 10:59
    3楼

    这是什么情况啊?不了解面壁。

  • ba lao 10-02 11:01
    4楼

    2B的模型AA拿了32分。

  • PSP 楼主 10-02 11:04
    5楼

    这么夸张。


    不过Gemini 4和之前 Gemini 3的反了。


    Gemini 3是疯狂堆积总参数,激进缩小激活参数。最后非常疯狂。全知能力Flash可以吊打Opus。Gemini Flash 3系列的全知指数,大幅强于Claude Opus 4.5/4.6/4.7三兄弟。

  • light2199 10-02 11:04
    6楼

    能有谷歌家传统的pro的水准,dsv4pro的记忆,那就是妥妥的酒馆神器,否则就是路边一条

  • Evaleanosrey 10-02 11:08
    7楼

    这么说 argon 还是 flash?那 pro 级到底什么时候端上来啊

  • sparklydream 10-02 11:09
    8楼

    根据灰测 tps 来看 argon 大概不是 flash?

  • PSP 楼主 10-02 11:10
    9楼

    还没训练完成呢,预计在Fable 5.5之后,你看就连6.1 astra训练完成了,它都不出了


    顺序应该是6.1 astra>Fable 5.5> Gemini 4 Pro

  • PSP 楼主 10-02 11:10
    10楼

    能不能详细说说看?灰度测试的情况?

  • PSP 楼主 10-02 11:17
    12楼

    真正的Gemini 4 Pro可能和Gemini 3.5 Pro一样,还在后训练中。


    说不定等Gemini 3.5 Pro发布了再说 ^-^

  • LKM1729 10-02 12:02
    13楼

    2027年:我们发布了Gemini 5 Flash,而Gemini 4 Pro仍然在后训练中

  • AreSet 10-02 12:06
    14楼

    老实说,要是他的能力真能与前沿模型并肩,flash还更快,这不是美滋滋

* 帖子来源Linux.do
返回