Solar Open 2支持 1M token的上下文窗口。为实现长上下文支持,其采用混合注意力架构,结合GQA(全softmax注意力)与线性注意力。模型以"1个GQA层 + 3个线性注意力层"为一个重复单元,在全部48层中有75%采用线性注意力。线性注意力层以固定大小的状态管理序列信息,避免KV缓存随上下文长度线性增长,从而降低长输入的内存压力。Softmax注意力层采用NoPE(无位置编码),专门针对外推能力设计,以处理超出训练时主要见到的长度范围的输入。
这一设计在训练效率上同样成效显著。在对照实验中,Solar Open 2架构仅用2100亿token便达到了Solar Open 100B全softmax架构需要6710亿token才能达到的MMLU性能水平。详细对比及设计原理已在技术报告中完整发布。
高效推理架构使Solar Open 2得以在相对有限的基础设施上运行:BF16模型需四块NVIDIA H200,量化后仅需两块H200。
Solar Open 2采用专为韩语分词效率优化的tokenizer,处理相同韩语文本仅需全球模型50%至80%的token数量。在韩国职场文本上,Solar Open 2的tokenizer在12款对比产品中效率排名第一,比表现最佳的全球模型领先约24%。以更少token表达相同内容,意味着更低的推理成本与更长的有效上下文。
为更高效地训练250B规模的模型,Upstage自主研发了选择性权重迁移(Selective Weight Transfer)方法。该方法并非随机初始化全部权重,而是从上一代模型Solar Open 100B中筛选出可迁移至新架构的权重,用于初始化Solar Open 2。
Solar Open 2在该基准测试中取得86.8分,仅比DeepSeek-V4-Pro(86.9分)低0.16分,而后者是一个总参数量1.6T、体量超过Solar Open 2六倍以上的模型。Solar Open 2同时领先包括万亿参数级别的MiMo-V2.5-Pro(84.6分)在内的所有其他对比模型。