Solar Open 2正式发布:韩国主权基础模型,参数量达250B,声称接近DeepSeek V4 Flash水平

Bunn 2026-07-22 20:43 1

Upstage今日正式发布Solar Open 2,专为智能体(Agentic)应用优化的开放权重基础模型。


Solar Open 2专为真实工作环境中的智能体基座模型而设计与训练,覆盖工具调用、编程、办公自动化等多类智能体场景,并在智能体、韩语、知识及编程等多项基准测试中达到与全球领先模型相抗衡的水平。


该模型采用MoE架构,总参数量达250B,每个token仅激活15B参数,在提升能力的同时大幅优化推理效率。经量化处理后,仅需两块NVIDIA H200 GPU即可运行,使企业在自有基础设施上的私有化部署切实可行。模型支持高达100万token的超长上下文窗口,官方支持韩语、英语和日语。


模型权重已在Hugging Face上以商业可用许可证发布,同步发布的还有《Solar Open 2技术报告》,完整披露架构设计、训练方法、关键实验及评测条件。


构建Solar Open 2,目标不只是基准测试高分,而是一个具备真实工作场景所需性能与成本结构的智能体基础模型。


Solar Open 2在预训练和后训练阶段均将智能体应用作为首要目标,训练场景涵盖搜索、工具调用(MCP)、编程和办公自动化。模型不仅学习生成解释,更学会在真实环境中采取行动、检验结果,并在必要时自我纠正。


为构建真实可用的智能体训练数据,Upstage自主研发了一套数据合成与验证流水线:以来自真实工作环境的源数据为起点,构建能够明确判定正确答案的场景设置,并反复筛选,仅保留通过验证的数据用于训练。


Solar Open 2支持 1M token的上下文窗口。为实现长上下文支持,其采用混合注意力架构,结合GQA(全softmax注意力)与线性注意力。模型以"1个GQA层 + 3个线性注意力层"为一个重复单元,在全部48层中有75%采用线性注意力。线性注意力层以固定大小的状态管理序列信息,避免KV缓存随上下文长度线性增长,从而降低长输入的内存压力。Softmax注意力层采用NoPE(无位置编码),专门针对外推能力设计,以处理超出训练时主要见到的长度范围的输入。


这一设计在训练效率上同样成效显著。在对照实验中,Solar Open 2架构仅用2100亿token便达到了Solar Open 100B全softmax架构需要6710亿token才能达到的MMLU性能水平。详细对比及设计原理已在技术报告中完整发布。


高效推理架构使Solar Open 2得以在相对有限的基础设施上运行:BF16模型需四块NVIDIA H200,量化后仅需两块H200。


这些部署要求以实际应用为出发点,企业在自有基础设施上运行模型并接入智能体服务,而非仅面向研究评测。详细的吞吐量与延迟数据已在模型卡中提供。


Solar Open 2采用专为韩语分词效率优化的tokenizer,处理相同韩语文本仅需全球模型50%至80%的token数量。在韩国职场文本上,Solar Open 2的tokenizer在12款对比产品中效率排名第一,比表现最佳的全球模型领先约24%。以更少token表达相同内容,意味着更低的推理成本与更长的有效上下文。


为更高效地训练250B规模的模型,Upstage自主研发了选择性权重迁移(Selective Weight Transfer)方法。该方法并非随机初始化全部权重,而是从上一代模型Solar Open 100B中筛选出可迁移至新架构的权重,用于初始化Solar Open 2。


除智能体应用、韩语性能与推理效率外,Solar Open 2在核心知识与编程方面同样具有竞争力:


MMLU-Pro(知识):86.2分,同类模型最高。LiveCodeBench(编程):92.4分,同类模型最高。韩语基准平均分:85.4分,超越DeepSeek-V4-Flash(84.9分),大幅领先GPT-5.4 mini(80.8分)和Claude Haiku 4.5(69.6分)。在指令遵循和工具调用评测中:MCP-Atlas:58.2分,与DeepSeek-V4-Flash并列同组最高,而APEX-Agents:16.6分,对比组中最高。


Ko-GDPval基准测试评估智能体在真实职场环境中完成工作任务的能力,涵盖律师、会计师、感染控制专家等58个职业的170个真实工作场景,以模型实际产出的报告、计划书、简报等成果进行评分。


Solar Open 2在该基准测试中取得86.8分,仅比DeepSeek-V4-Pro(86.9分)低0.16分,而后者是一个总参数量1.6T、体量超过Solar Open 2六倍以上的模型。Solar Open 2同时领先包括万亿参数级别的MiMo-V2.5-Pro(84.6分)在内的所有其他对比模型。





Demo: https://open2-beta.upstage.ai/

最新回复 (10)
  • lueluelue 07-22 20:44
    1

    这个排行搒是超过谁放谁吗?hhhhh

  • 墨殇 07-22 20:45
    3

    一般自己放的对比含水量都比较高,在含水量比较高的情况下也不敢宣称把deepseekV4flash完全超过,说明实际能力不是很好

  • Azide 07-22 20:48
    4

    是从头训练的还是微调的?考虑到韩国的前科……

  • Aggron 07-22 20:50
    5

    怎么叫solar,太阳不是在他们北边的朝鲜吗?

  • 匿名者 07-22 20:54
    6

    韩国?那个总是到处偷东西的国家么?

  • 䲜龘 07-22 20:57
    7

    啥都不懂的我有时候在想这个排行榜是不是可以针对性训练啊

  • Bunn 楼主 07-22 21:01
    8

    你看这个榜单有Command A 和Mistral,就知道这个模型有多垃圾了

  • 朴实无华 07-22 21:02
    9

    棒子模型,一律不喜欢思密达~ ^-^

  • sse 07-22 21:05
    10

    参数量达250



    这个参数量的选择,一定是故意的吧

  • pu 07-22 21:21
    11

    比oponai格局大多了,上来就是太阳级solar,后面是galaxy级,最后是universe级.

* 帖子来源Linux.do
返回