前沿慢讯,一直没看到相关的信息,qwen发布了原生世界模型

xio 2026-06-24 17:59 1

^-^ 科技快讯:阿里通义开源首个原生语言世界模型 Qwen-AgentWorld


2026年6月,阿里巴巴通义千问团队宣布开源发布「Qwen-AgentWorld」——业界首个原生语言世界模型(Native Language World Model)。 该项目旨在打破传统物理模拟器的限制,利用大语言模型原生模拟复杂的智能体交互环境,为 AI Agent 的强化学习训练提供低成本、高扩展性的“数字沙盒”。




^-^ 核心突破:让大模型成为“环境模拟器”


传统 AI Agent 训练需依赖真实软件、终端或物理模拟器,开发成本高且难以规模化并行。Qwen-AgentWorld 另辟蹊径,将“环境反馈”建模为语言生成任务。模型在开发全周期中,将“基于智能体动作预测下一个环境状态”作为核心训练目标,能够高度逼真地预测和输出终端命令、网页点击或工具调用后的世界反馈。




^-^ 七大交互领域统一建模


Qwen-AgentWorld 在单一模型架构内统一支持了 7 大核心交互领域



  • MCP(工具调用协议)

  • Search(网络搜索环境)

  • Terminal(命令行终端)

  • SWE(软件工程环境)

  • Android(移动端操作系统)

  • Web(网页浏览器交互)

  • OS(桌面操作系统)


团队同步推出了配套评测基准 AgentWorldBench,利用来自真实物理环境的观测数据,严格评估该世界模型在上述七大领域的状态预测精确度。




^-^ 三阶段训练管线与开源版本


Qwen-AgentWorld 采用系统的三阶段训练流程:



  1. CPT(持续预训练):注入通用的环境状态变化动态知识。

  2. SFT(监督微调):激活对下一状态预测的推理能力。

  3. RL(强化学习):利用结合规则与评估量规的混合奖励框架,进一步打磨环境模拟的逼真度。


目前已开源的模型包括混合专家架构(MoE)的 Qwen-AgentWorld-35B-A3B(约30亿活跃参数)以及超大规模 397B-A17B 变体。




^-^ 行业影响


通过将真实环境解耦为大模型驱动的语言模拟器,Qwen-AgentWorld 不仅极大降低了 Agent 强化学习训练的算力门槛与工程复杂度,还证明了其能作为“Agent 基础模型”直接提升智能体在多轮、多工具调用场景下的泛化表现,为迈向通用人工智能的自主智能体进化提供了全新的基建方案。


下面是bench



只开源了35A3的模型,大一点的那个没有开源,没有提供在线api,看起来像是rl优化后的两个模型,不知道qwen何意味,开源的版本还是256K上下文

最新回复 (6)
  • David YU 06-24 18:16
    2

    没太看懂,有没有大佬中译中一下,解释一下这是个什么反向

  • shock 06-24 18:19
    3

    核心突破:让大模型成为“环境模拟器”



    让我想起了之前看到的 环境工程。。。。


    不过让大模型来模拟环境反馈 对模型进行训练。 不会出现幻觉叠加幻觉的情况么。。。

    一个幻觉反馈 不会吧模型训练的更坏么。


    环境工程。

    https://mp.weixin.qq.com/s/WaH2ouRp9VZ-EkV4ImJCEg


  • shock 06-24 18:20
    4

    比如说 大模型写代码调用 搜索api. 训练的时候可以用这个世界模型可以模拟api 调用返回值生成mock 数据。


    具体怎么用。不知道。 纯猜测。

  • JackBlue 06-24 18:21
    5

    不是写代码的模型,对于写代码没什么用。

  • HAO 06-24 18:29
    6

    世界模型


    简单的说,语言大模型是输入一段问题文本,输出(预测)答案。现在被用于问答、编程等领域,也扩展出视觉听觉等多模态能力。


    世界模型是输入世界当前的状态以及任务,输出(预测)世界未来的状态,或输出未来因采取的行动 Action


    对具身智能领域意义重大,比如人型机器人在执行任务时,可以使用各种传感器采集世界当前状态,如图像、深度、温湿度、扭矩等等,输入世界模型,决策未来行为;也可以用于仿真领域


    一句话概括,语言大模型是在理解人类文明的知识,世界模型是在理解世界运行的规律,是未来通用人工智能的实现的重要组成

  • HAO 06-24 18:38
    7

    不会只依靠世界模型模拟器采集数据的,数据飞轮有很多组成部分


    有本体采集的,也就是操作机器人完成任务,自己采集自己


    有无本体采集的,通过各类模拟器仿真


    有视频素材


    成本和置信度都不同,互补关系,只依靠其中某一个肯定不现实

* 帖子来源Linux.do
返回