LLM是怎么产生智能的,为什么会有类似人类的思考行为。

屑派大星 2026-09-19 19:10 1



像这种偶尔居然会忘记之前的,再自己返回去查看。是故意拟人吗?实在不能理解。LLM一堆数据结合起来居然会产生智能,简直不敢相信。

最新回复 (18)
  • 屑派大星 楼主 09-19 19:11
    1

    现在的LLM越来越强了,但是内部AI怎么进行思考的还是不太能够理解。

  • 枫哥 09-19 19:11
    2

    这个大部分是agent引导的能力

  • 朱慧月 09-19 19:12
    3

    attention is all you need

  • 屑派大星 楼主 09-19 19:13
    4

    什么意思?难道agent知道某一数据遗忘了,需要重新去看吗?或者是agent的设定中有,如果有遗漏或者忘记某一数据,就必须回去看。

  • 枫哥 09-19 19:15
    5

    你现在用的codex类似的,其实执行的时候,是一轮一轮的,他们连起来,你不了解技术,可能从表面是看不到,有可能一次work,会有好几十轮的来回请求应答,每轮都会把上下文、skill什么当做输入,所以看着他有记忆,其实他是没有记忆能力的,只有算力。我不知道这样说,你能理解么

  • segfault 09-19 19:18
    6

    从语料中学会最大概率的下一步,从后训练中矫正行为,让他更像一个真实的人。至于为啥这么做能更好,只能说从正确的路往后看,都是对的,放到之前不可想象。

  • anzi 09-19 19:22
    7

    现在都是伪智能,就比如模型是训练好的,但是你激活需要输入你的需求,假设你输入1和2到模型,模型就会根据1和2根据训练的时候那样子在预测推理最高的值那么你会得到3,这样子纯粹是推理预测最高最接近的值而已,至于那个gpt6 agi就不清楚了

  • mclae 09-19 19:24
    8

    从GPT3到GPT3.5 突然就出现了思维链?

  • SYA 09-19 19:24
    9

    真相是目前的人工智能其实没有智能,全靠芯片和算法驱动。内容生成都是语料统计的结果而已,全程条件概率计算

  • undefined 09-19 19:25
    10

    你这个问题,真的有人能回答的上来吗。

    智能是怎么涌现的现在有定论没

  • maataa 09-19 19:26
    11

    了解一下reAct框架就知道了,codex这种框架会让大模型扮演一个助手角色,第一句你问了帮我修复这个bug,其实发给大模型的是,你是一个代码助手,用户的问题是修复这个bug,你有下面的工具,读,写,只要你输出某某格式,框架帮你运行这个读写操作,然后大模型就判断,read code,然后框架会把read的结果打包,连着之前的上下文给大模型(这时候的大模型和第一轮的其实只是获得了更多的信息,然成从这一步继续回答罢了),所以其实每一轮交互都只是不断的接收上下文和工具调用结果,然后输出对应的回答什么的。大模型本身其实是概率预测,词语接龙,只不过吸收了很多的数据语料,代码什么的,预测的比较准罢了。以上都是个人理解。

  • 還sんì吥懂 09-19 19:26
    12

    更高级的智能是“涌现”出来的(虽然听起来是玄学

    被后训练覆盖好的工作流确实是很智能




    虽然本质上是文字接龙


    根据开放权重模型的做法应该是 {{role}} assistant 开始接话之后立即接一个<thinking>(每家具体的标记不一样),后面模型就会接思考的内容。

    工具调用之后也会接一个<thinking>,这样就可以一遍思考一边调用工具辣


    更加接近人类的行为是出现在后训练阶段,各大厂商回去买真实的工作流/内容,让模型的输出更接近这些真实工作流的数据(所以买来的数据和通过买来的数据变化出来的合成数据 + 后训练方法是各家的护城河)



    放一几个卖数据的vendor的连接仅供参考


    其实日常可以看一下他们都花什么价钱买数据,就能推测出下一步的frontier在哪里








    其实埃哲森这样的外包公司也在往外卖数据 (很多别的公司都在卖数据)

  • Hifumi Mizuhara 09-19 19:28
    13

    世界线混乱了吧,难道不是o1和R1嘛

  • Neptune 09-19 19:28
    14

    类似拟合吧,一个超巨大拟合函数 ^-^

  • Leif Yang 09-19 19:29
    15

    比起这个问题,我更在意的是,人是怎么产生智能的,思维与语言的运作机制如何?

  • allinai 09-19 19:29
    16

    大模型本身其实是概率预测,词语接龙,只不过吸收了很多的数据语料,代码什么的,预测的比较准罢了。



    好像就是概率、统计、预测、多元回归、增加参数维度、拟合,


    楼主提的问题很好,楼主佬可以去看看最小的推理模型


    看完回来科普下,我也想知道

  • starless 09-19 19:29
    17

    我昨天好奇模型为什么能reasoning,看了原理似乎是给提示词“请深度思考…”

  • maataa 09-19 20:51
    18

    这个我当时还看过,就是一篇论文讲的,说让大模型step by step输出,然后效果提升了很多,Cot,后面被deepseek发扬光大了

* 帖子来源Linux.do
返回