Gemini 3.6 Flash表现一言难尽

SharkyMew 2026-07-23 01:38 1

以下图片出自3.6F在官方app的回答,模型现在连基本的自我认知能力都要丧失了,严重的幻觉和奇怪的回退逻辑层出不穷,感觉3.5P前景渺茫啊






最新回复 (7)
  • deepcake 07-23 01:47
    1

    首先模型没有自我认知,只要提示词里没有定义则不知道自己是谁,99%模型都是这样


    后面两个是Gemini官网安全审查(拒绝任务)、降智的锅(怎么佬能刚好都遇上呢),官网越来越离谱了






    前言
    众所周知Gemini目前被称之为美国豆包
    而这一切的源头几乎都来自于网页端官网降本+降智导致的问题
    隔壁的Ai Studio也是网页端,但智力比官网高许多,几乎是满血版
    因此Gemini网页端官网降智 != Gemini模型降智,
    具体表现为思考强度低、不主动调用搜索
    尽量能用Ai Studio就别用官网。远离降智官网,拥抱满血Ai Studio
    且调API也是满血
    如果真要用…
  • SharkyMew 楼主 07-23 02:02
    2

    的确,不过Google没有在提示词和模型训练过程中加入模型自我认知的语料确实比较意外,虽然之前也出现过Opus4.8自认为Qwen的事情,但是那个大概率是蒸馏,而这个就纯粹是瞎回答了


    另外审查方面我想表达的就是很对时候莫名其妙给你ban了,重试有概率能回答(但是也有概率依旧不回答)


    此外,知识截止日期感觉像硬编码在提示词里而非真的到了2026年1月(虽然可能是我倒霉碰上了降智)

  • 谷恒调冶 07-23 02:03
    3

    其实flash最大的问题还是思考不足,试想让你思考1秒和1分钟出来的结果会是一样吗

  • SharkyMew 楼主 07-23 02:05
    4

    这一点确实,Google感觉走歪了方向,现在对着成本和速度的方向一去不复返了 ^-^

  • Brady 07-23 02:05
    5





    我用的时候问这些简单问题从来没有出过问题, 是不是没有开thinking

  • deepcake 07-23 02:06
    6

    3.6 Flash 知识有更新,之前最多是2025年1月,现在有一些问题能到2025年8月


    看到的说法是知识有更新但是模型没有掌握那些信息?


    我试过Qwen3.7 Max也说是26年的知识,结果大多数认知也跟3.6 Flash一样停在2025

  • SharkyMew 楼主 07-23 02:06
    7

    嗯,thinking确实会好很多,但是搜索不积极的问题依旧显著,还是建议能把手动强制开搜索的途径保留下来,不然以Gemini的工具调用积极性真的没谁了……

* 帖子来源Linux.do
返回