当前的大模型是否已经达到了边界,无法再更近一步。

uname 2026-06-10 15:01 1

从23年到现在,3年不到,能力其实已经完成了飞一般的跃升。

但是不可否认的是,关键性的几个版本节点为:sonnect3.7、opus4、sonnet4.5/opus4.5;4o、gpt5.2/codex5.3、gpt5.5.其他节点版本并未感受到能力突飞猛进,甚至部分版本出现了倒退的情况。5.6也迟迟没有端上来。哪怕是哈吉米2.5-3.1也并没有实质性的进展。

对了,上述说的是coding agent能力,其他领域方面还是有待商榷。除此之外,还有一个非常现实的问题,就是所有的模型版本更新后,他的能力水平会在1-7天内维持一个较高水准,随后快速跌落,比如5.4 gpt的奇怪话癖,在5.5有做修复,然而一周之后又出现了大量的5.4的话癖和口头禅。并且随着版本更新,价格也是出现翻倍的情况,我是相信官方绝对不是随意定价,而是当前的token成本就是这么高。如果真的是这样的话,那计算机岗位复活? ^-^

最新回复 (11)
  • MoLeft 06-10 15:07
    1

    其实大模型搞再多,他能力是有限的,所以现在各种agent都是提升框架的优势,从架构弥补大模型的能力不足

  • pkoukk 06-10 15:12
    2

    GPT 5.5 发布于4.23,满打满算也就一个半月

    大模型有没有更进一步我不知道,大家都大模型进步的速度要求暴涨

    以前两个版本之间至少差半年的

  • Pinging 06-10 15:14
    3

    并非啊 去年大家都在说堆参数是不是不行了 结果今年照样堆出来5.5和4.6两个重磅级模型 技术跑在担忧前 总有办法可以解决的

  • shetou 06-10 15:25
    4

    可能会发展更好的架构,更厉害的算法吧。

  • Humpy 06-10 15:25
    5

    当前模型的能力很大程度受限于上下文长度和注意力机制的不足,如果上下文没有突破,我觉得能力提升应该很难吧。

  • unsanctioned 06-10 15:38
    6

    啊哈哈哈,盲生你发现了华点。


    大家是越来越心急了。两家平均25天一个新玩具。


  • 淞枫 06-10 15:41
    7

    模型的本质,还是靠概率计算下一个词吧,如果一直是这个架构,感觉上限已经是肉眼可见了

  • hcw 06-10 15:42
    8

    视觉能力还是得提升,不用playwright的话coedx前端改显示问题完全不会改,

  • neteroster 06-10 15:45
    10

    vibe coding 脱离玩具实际可用在生产级别编码上也就是去年底到今年初的事情吧,我ChatGPT发布就开始大量玩/用 AI,个人觉得今年是最快的一年
    硬智力也提升很大,特别是 5 → 5.5 的渐进提升,当然一般人手头也没那么难的数学问题了

    数据也已经注得差不多了

    现在重点范式大概是 RL + 轻监督,不需要 SFT 时代那么多标注数据,而且用户用模型就有新数据,这里可以造飞轮,我…


    纵观从古法编程的时代,到copilot编程人们关于ai是否“只能写几十行代码的玩具”的争论,再到chatgpt 3.5时代“模型真的能思考吗”的遐思,步入o1-preview时代“模型能思考,但他真的能理解吗”的困惑,进入agent时代「模型能用好工具,但他真的能创新吗」的追问,一路跑到了oai模型做出四大级别成果,模型网络安全能力逐渐能对现实产生真正影响的今天


    我充分理解很多人对LLM和这条技术路线上限的怀疑,虽然一路走来我也带着怀疑,但我还是想说,正如我的签名所说,深度学习是一个关于「相信」和「相信的人」之间的故事。

  • llmtest 06-10 18:30
    11

    现在小参数dense模型还是很有发展空间的 应该想的不是模型的能力边界而是怎么控制成本

  • LN 06-10 20:18
    12

    但是小模型基本只能看Qwen,但是换帅之后不知道还会不会继续坚持搞小模型了

* 帖子来源Linux.do
返回