Transformer,又或AGI的前方又在何处?

550W 2026-07-27 01:17 1

Transformer从何而起?


谷歌在2017年6月12日在arXiv上发表了《Attention is all you need》的预印本,自此,transformers问世


而当时还是小公司,成立了数年却苦于找不到研发方向的OpenAI一看到这篇文章,就想到了利用Transformers构建模型


之后,在2018年,OAI和谷歌相继发布了GPT-1和BERT,接下来便是一代代的模型迭代,一代代的参数量增加,模型能力也一代代的变强,GPT-2拥有15亿参数,便出现了涌现能力,但在这之前,马斯克离开了OpenAI,没能见到GPT2的发布,所以OAI只能找新的金主。也就是微软,自此,御三家的两家已经成型(谷歌+DeepMind、微软+OAI)


自此微软开始注资OAI,但是由于理念不合,阿莫带兄妹离开了OAI,创办了今天的A/


2022年,GPT3.5首次应用了RLHF(人类反馈的强化学习),这次oai内部的“低调研究预览”让oai打破了世界上最快用户量破亿的记录,而这也成为了oai一个梗,GPT4和GPT4o的发布,让大家都信心十足


Scaling law似乎成了AI界的摩尔定律,可这个“摩尔定律”却没有持续多长时间


然而,GPT4.5的表现给了AI界当头一棒,Scaling law的红利似乎到此为止,虽然可能是最会迄今为止说人话的OAI模型(别问我我也没用过),但是价格确实……很难绷,而且智力也没什么提升,甚至不如引入了思维链的o1模型,GPT4.5也被OAI纳入了Legacy模型


好死不死,下一步AI的进步又双叒叕是谷歌做出来的,就是22年1月发布的

《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,这个阶段的“思维链”甚至只是往提示词里面塞“Let‘s think step by step”之类的玩意,


然后就是24年9月发布的o1和25年年初的Deepseek-R1,后面放出的R1-Zero也证明了纯RL也可以涌现出思维链(幻觉率你先别管)


25年2月,A/发布了Claude3.7 sonnet,引入了混合推理的范式,用户第一次可以再api端调节思考强度了,似乎初代cc(不是哈雷那个)也在这附近发布了


然后便是claude4系列,提供了长达1M的上下文,也是遥遥领先,不过谷歌还是在24年2月发布的Gemini 1.5Pro突破了1M上下文,这么说来OAI反而是最后端上来1M模型的?


到了现在,就是claude5啊,gpt5.5、5.6的天下了,谷歌也只能跑去做产品化了 (怪不得叫美国大豆包) 还有异军突起的马斯克,力大砖飞的kimi,国产扛把子的GLM,等等模型就都上来了


历史大概就是这样了,但是形势正在变得严峻。据统计,有人类创造的高质量无污染的数据总量只有9万亿tok到27万亿token,悲观估计没准今年就用完了,而用AI输出训练AI众所周知会造成严重的流口水,提升模型参数量这条路可能快走到头了。而现在训练一个sota模型的成本也在不断上升,从21年来,5年内从大约300w美元到了现在的3亿美元甚至更多 (英伟达赚大了) 而且,每个数据中心都是一个电老虎,也对环境保护,基建之类提出了考验


自从纯dense力大砖飞走不通了,端上来的就是优化了。像MOE啊,各家的稀疏注意力啊(DS的,minimax的,等等等等),投机解码啊,多头潜在注意力全都蹦出来了,但是模型能力还是差点意思


那下一步该怎么走呢?现在A/开放给大家用的fable5,又或者mythos,已经很强了。但是你敢完全放心把一个有点难度的复杂任务完全交给模型吗?似乎是不能的。那如果定义AGI是能在大部分具有经济价值的任务上持平或超越人类顶尖水平的模型,又该怎么达到呢?


还请老友们赐教

最新回复 (19)
  • hucccl 07-27 01:24
    1

    实际体验 现在的模型很强但是又没有那么强 AGI只能说还要等新技术吧

  • chinajojo 07-27 01:34
    2

    接下来的发展,也是参数优化吧我觉得,从小到大再到小,或者参数量的激活加大。

  • HGWXX1379 07-27 01:35
    3

    没有能力回答这个问题,只能捉两只虫。GPT-2的参数量远没有这么大,也许你说的是GPT-3。RFHL→应为RLHF

  • 550W 楼主 07-27 01:45
    4

    参数从小到大再到小,不就是现在发生的莫

    从最开始的小模型到scaling law触顶再到蒸馏出来的端侧模型

    激活参数量变大是指从MOE变回dense或者计算量更激进的版本?

  • Marisa 07-27 02:06
    5

    我觉得,当单个智能无法完全依靠,那么只能引入社会性抉择,就像我们自己,组织架构。


    但我们人类会出现的问题,这类智能也会出现。前路漫漫 ^-^

  • SpookerV5 07-27 02:46
    6

    自身不做这个所以给出的不准确(叠甲先)

    ICML 今年的热点是 dLLM ,如果后面能够证明这条路线比 AR 好的话 LLM 将迎来速度上的巨大提升

  • 1363511234lhq 07-27 03:52
    7

    人类为什么要发明工具?我以前非常浅显的认为是为了方便偷懒,在昨天我想明白了,发明工具是为了转移或减小熵增。


    如何理解呢?之前的人们要出去打猎,徒手只能摘果子,果子给的能量又不够,必须制造工具去打猎。


    往往是有风险的,这个就是成本问题。如果没有工具在打猎的过程中会增大的死亡的几率。


    如果没有汽车,人类用双脚去丈量世界,迟早会累死,或者说是相比于不用汽车代步会死得快一点。我们大家都知道乌龟是因为代谢慢,运动少才活的比较久。


    而还有一个很重要的东西,他来了叫做符号。符号也是为了降低成本,减小熵增。也正是因为有了符号才慢慢而衍生出了语言。


    而人类并不是因为有了语言等一些符号才会思考。


    只不过符号让群体有了共振(合作),也可以极大地减少熵增。


    所以,现在的大模型一直在通过符号复制符号解答问题,本质上他不是一种思考能力,但确实也是为了降低转移熵增。


    那如果机器人学会了思考,他也会进化,而且是用最小成本去进化。


    我前两个礼拜在思考蚂蚁为什么能分工合作,萤火虫的光为什么能同步。


    我把这一类称作是一种类智能。还有点事儿留给大家一个问题。


    那什么是思考呢?

  • 猫猫 07-27 04:26
    8

    ​回溯到 2021 年时,我在某个播放量不算多的视频底下冲浪,意外看到一位佬提到了 GPT-3 这个奇奇怪怪的关键词。

    ​好奇心驱使着就去网络上搜了搜,也算是第一次接触到了当代 Transformer 的大门~

    ​当时上网搜索,国内甚至只有寥寥几个新闻媒体报道了“1750亿参数”之类的新闻。我也好奇地去尝试过 GPT-3,当时感觉这不就是个小玩具嘛 ww,总之也就没怎么放在心上……

    ​谁知时代巨轮在转角处加速,转眼到了大半年后,随着 GPT-3.5 推出、伴生的 ChatGPT 引爆全球互联网欸~!还是感叹自己没有眼光了 w。

    ​那年还出了 Stable Diffusion 之类 AI 画图相关的技术,感觉 2022 年真的是 Transformer 元年了~

  • Er_er 07-27 04:31
    9

    人在使用工具的情况下,不也是给AI训练样本,现在AI不是没有能力,而是注意力稀碎或者是对于各种交互边界的揣度猜测过度,导致跑偏,人类在这种情况下更像是一个监督者而非工具使用者,AI蒸馏人类的路子走不通了就应该是AI与人结合一起飞升

  • Bluedot 07-27 05:32
    10

    核心之一始终是表示学习,既然说到历史,那历史说得很明确了,Transformer 是学习表示的强力机器,但它从来不保证学习到的表示质量怎么样,而表示质量怎么样,主要看语料。过去几年的历史说,人类互联网文字语料大部分是质量不佳,对模型来说相当于可以填饱肚子,但吃得十分不健康,对进一步提升没有什么作用。现在大家都是做合成数据,要吃好的。Anthropic 从24年开始就大力投入SWE数据(Agent轨迹),SWE数据可以从人造的沙盒里获得,也可以直接薅用户的,那这个数据就及其宝贵,因为里面带着环境的“动力学信息”,因果关系极其丰富,表示极其高质量,如果比较起来,这个就是漂亮菜,人类互联网语料就是一坨印度糊糊。很微妙的是,如果想要改善这个语料的质量,只需改善软件就能大幅提高语料质量,从环境本身到语料的这个管道里,丢掉的信息少,混入的噪声极其少,反观人类作为语料来源,人类对环境压缩得太多,输出的基本上是极度有损的东西,还有不少噪声,体现为 OpenAI 扩张到十亿C端用户几乎没有什么自我加速作用。更微妙的是,模型“自身的表示”也在软件和硬件中,这意味着当模型要自我改进时,从SWE往下做,做软件,做硬件,是一条高速公路,所有自我改进所需学习的“表示”都在其中了,且表示距离很近。当下大家在做的当然就是胡闹厨房升级版,尽量教模型怎么自己 cook,等模型会自己 cook 了,大家就可以享受生活。

    关于耗能和基建。应该说不要以人的条件去看这件事,模型极高的投入成本带来的是极低的智能分发成本,对于这个世界来说,以 Scaling 的角度来看,主要的成本是时间,而人类的 Scaling 被生物条件限制住了,20年成熟,时间成本就要付出一大截,大脑里的知识根本无法直接分发,靠文字“浅拷贝”,那是浅的不能再浅。类似的过程工业革命就教给大家一次了,建工厂是高 Capex,巨额投入,但换来了巨量的产出,现在只是重复一下。想要把最基本最通用的生产要素给商品化,老天爷不收你一点税过不去,就好像不提高温度就烧不出铁水,青铜时代的人要是听到今天的耗能起码是要吓一跳,或者根本无法理解。

    这一些问题本身都很深,Scaling 怎么做是一个高度耦合的问题,大家也是撞着头去做,很多时候唯一的方法就是撞得头破血流。

  • 1363511234lhq 07-27 05:38
    11

    其实我那个时候就想做了,而且我还把它接到了我的微信群里面,我的人非常不理解这玩意儿有啥用。


    而我那个时候就想把词典做成预料来搞,一切都晚了,那个时候我还没有那么聪明,哦,现在我也不是那么聪明

  • 1363511234lhq 07-27 05:47
    12

    其实有一条路,就是蚂蚁的路


    蚂蚁会在路上留下信息素,这个信息素就是让他们能分工合作和准确的找到食物和回家的路。


    那对应了现实的什么工具呢?


    agent​^-^记忆,图谱。


    那为什么他还没有进化出意识呢?


    因为大模型的人格参数太大了,每次都需要蒸馏很久很久还要加训练。


    现在有一个比较好的方法,比方。你把你自己蒸馏了,然后通过各种agent,mcp,skill等。我们复制的数字生命就可以对这些子agent进行运营操作。

  • 中二猫 07-27 05:57
    13

    说真的,不管这两年模型如果如何进步,能力有多强。都没有 22 年 23 年那个时候我第一次使用 chat GPT 带来的惊为天人的感觉,感觉不可思议

  • 1363511234lhq 07-27 05:58
    14

    也就是所谓的世界模型,和具身机器人的重要核心。


    不过现有的具身机器人有很大的瓶颈期,


    例如他的自由度不够,


    他的带宽大但是因为熵增原则导致外部大量信息处理,不够快


    极度快意味着什么呢?


    意味着就不需要预测,只需观察。例如天气,我在地球上每一个角落都装上一个摄像头,只要信息速度够快,我干嘛还要预测呢。

  • 1363511234lhq 07-27 06:00
    15

    那么下一步要牵扯话题就是量子力学。正所谓遇事不决量子力学。

  • dong 07-27 07:30
    16

    现在的transformers靠堆数据力大砖飞其实是在拼命的低人类已有知识进行过拟合,这是一条邪路因为它不能发现新知识。正路是强化学习,因为强化学习不需要数据,可以从0开始自己探索所有可能路径,强化学习的模型能发现人类未发现的新知识。就像最早的alphago是靠输入海量人类棋局训练来战胜人类,但最晚的alpha抛弃了人类棋局直接使用强化学习随机下棋,最终走出人类从未走过的棋路,吊打alphago

  • repo 07-27 09:46
    17

    统计,有人类创造的高质量无污染的数据总量只有 9 万亿 tok 到 27 万亿 token,悲观估计没准今年就用完了



    有关于这个 Epoch AI 后来的估计是:考虑网页过滤、数据重复训练和质量调整后,有效的人类公开文本约为 300 万亿 token,90% 区间约为 100 万亿到1000万亿 Epoch链接

    万一训练策略足够再蹬几年呢,不过模型现在的问题还是集中在长期可靠性和持续学习,假如真解决的那么相当有可能

  • aoeywu 07-27 09:58
    18

    梁圣泄露的电话会议有提过呀!这一步是agent,下一步是持续学习,接下来是自主学习,最后就有真正AGI了

  • aoeywu 07-27 10:01
    19

    至于那些优化,例如 MOE、稀疏注意力、投机解码、多头潜在注意力 等等都是在目前客观条件限制下达成更好效果的努力。不是发展的重点

* 帖子来源Linux.do
返回