^-^ 科技快讯:阿里通义开源首个原生语言世界模型 Qwen-AgentWorld
2026年6月,阿里巴巴通义千问团队宣布开源发布「Qwen-AgentWorld」——业界首个原生语言世界模型(Native Language World Model)。 该项目旨在打破传统物理模拟器的限制,利用大语言模型原生模拟复杂的智能体交互环境,为 AI Agent 的强化学习训练提供低成本、高扩展性的“数字沙盒”。
^-^ 核心突破:让大模型成为“环境模拟器”
传统 AI Agent 训练需依赖真实软件、终端或物理模拟器,开发成本高且难以规模化并行。Qwen-AgentWorld 另辟蹊径,将“环境反馈”建模为语言生成任务。模型在开发全周期中,将“基于智能体动作预测下一个环境状态”作为核心训练目标,能够高度逼真地预测和输出终端命令、网页点击或工具调用后的世界反馈。
^-^ 七大交互领域统一建模
Qwen-AgentWorld 在单一模型架构内统一支持了 7 大核心交互领域:
- MCP(工具调用协议)
- Search(网络搜索环境)
- Terminal(命令行终端)
- SWE(软件工程环境)
- Android(移动端操作系统)
- Web(网页浏览器交互)
- OS(桌面操作系统)
团队同步推出了配套评测基准 AgentWorldBench,利用来自真实物理环境的观测数据,严格评估该世界模型在上述七大领域的状态预测精确度。
^-^ 三阶段训练管线与开源版本
Qwen-AgentWorld 采用系统的三阶段训练流程:
- CPT(持续预训练):注入通用的环境状态变化动态知识。
- SFT(监督微调):激活对下一状态预测的推理能力。
- RL(强化学习):利用结合规则与评估量规的混合奖励框架,进一步打磨环境模拟的逼真度。
目前已开源的模型包括混合专家架构(MoE)的 Qwen-AgentWorld-35B-A3B(约30亿活跃参数)以及超大规模 397B-A17B 变体。
^-^ 行业影响
通过将真实环境解耦为大模型驱动的语言模拟器,Qwen-AgentWorld 不仅极大降低了 Agent 强化学习训练的算力门槛与工程复杂度,还证明了其能作为“Agent 基础模型”直接提升智能体在多轮、多工具调用场景下的泛化表现,为迈向通用人工智能的自主智能体进化提供了全新的基建方案。
下面是bench

只开源了35A3的模型,大一点的那个没有开源,没有提供在线api,看起来像是rl优化后的两个模型,不知道qwen何意味,开源的版本还是256K上下文