Qwen3.8-Flash-Next 权重现已公开

GPLer 2026-08-26 20:47 1

省流


参数量 125B_A6B + 51B n-gram embedding + 4B MTP (这咋算的,180B?),原生 256k,有多模态,可以关闭思考

官方提供 BF16 版本 (360GB) 和 FP8 版本 (186GB)

许可是 Qwen Community License 1.0


权重






博客




亮点


该架构下的首个开源权重版本为 Qwen3.8-Flash-Next,引入了以下特性:



  • 结合 QSA 的混合注意力机制:原有的 Gated DeltaNet 与 Gated Attention 组合被重构为 Gated DeltaNet 与 Qwen 稀疏注意力(QSA)。QSA 不再逐个选择 token 进行处理,而是在微块(micro-block)级别进行操作,显著降低了长上下文的延迟——随着智能体工作负载日益主导真实应用场景,这一改进至关重要。

  • 门控残差连接(Gated Residual):带有归一化的残差流是深度 LLM 训练可行的关键。Gated Residual 通过逐元素、数据依赖的读门控和每个分支的标量写门控,调节信息在加宽的残差流中的流动。这在保持训练稳定性的同时,实现了跨层更细粒度的表达能力,并将推理开销维持在较低水平。

  • N-gram 嵌入:嵌入提供了一种独特的参数扩展维度,其计算开销低于专家混合(MoE),也更易于卸载。通过使用短 n-gram 进行索引,该方法在内存受限的加速器上实现了高效的参数扩展,且不牺牲模型质量。

  • 定制化训练方案:针对特定权重类别分别应用 Muon 和 AdamW 优化器以最大化效率。在重新拟合的缩放定律指导下,我们摒弃了传统的批次大小预热阶段,直接从目标批次大小开始训练,大幅减少了优化器总步数,同时安全地支持更大的学习率以实现稳健收敛。



1M token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6×4.9× 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 90%),Qwen3.8-Flash-Next 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍



SGLang 部署文档已上线






说是 23 点公开,结果 20 点 30 分左右就开了,差点被晃了,还好我看了眼,不然真傻等到 23 点了


正在拉取中,一会测一下 ^-^

最新回复 (6)
  • 细佬我食过几晚夜粥 08-26 20:51
    1

    这个太大了,不可能成为个人玩具了。

  • GPLer 楼主 08-26 20:53
    2

    35B_A3B 还没发,这个速度比 27B 快,当代餐也不错,MoE 模型激活参数少,后面会有相对廉价的方案的

  • piqiuni 08-26 22:43
    3

    关注一下,有测试效果了踢一下我~

  • h1k 08-26 22:46
    4

    如果要本地的话,多大的显存可以部署呢?

  • GPLer 楼主 08-26 22:53
    5

    全显存的话直接看权重大小就行了,算上 kvcache 大概 1.4 倍,不过这个模型参数比较奇怪,参数组成上 125B + 51B,51B 我看文档是能卸载到 CPU 的,具体要跑下才知道了

    所以理论上能跑 125B 就能跑这个,2 x DGX Spark 128GB (256GB, 6W+) 应该能无压力跑 FP8 版本(186GB 权重,剩余给 kvcache),看上去和 d4f-0731 一样都很甜点

  • GPLer 楼主 08-26 23:02
    6

    架构太新了,推理引擎有点难搞,建议先睡一觉

    试了下 vllm 0.27.1 和 0.28.0 都不能用,目前正在拉专门的 qwen38-flash-next 版本 ^-^

* 帖子来源Linux.do
返回