DeepSeek V4.1 Flash:新架构,更强、更快、更普惠!

桑榆 2026-09-10 14:25 1

公众号官推:


注意^-^,DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。



同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平


官方测试: 多项能力已经超过了GLM5.3、Kimi k3等模型。




此外,该模型更少缓存,更省成本!!


新一代模型大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。



API 定价调整


新价格于 2026 年 9 月 10 日 12:00 开始生效。



官方开源链接:




  1. 模型开源链接:


    deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face




  2. 论文链接:


    DeepSeek_V41_Tech_Report.pdf · deepseek-ai/DeepSeek-V4.1-Flash at main



最新回复 (5)
  • 海獭为什么叫海獭 09-10 14:38
    1

    Causal-Encoder-Decoder 结构



    不是 Only-Decoder,这是 Encoder-Decoder 复苏了,还是什么其他方案 ^-^

  • 桑榆 楼主 09-10 14:42
    2

    看了下官方开源的论文链接:



    • DeepSeek_V41_Tech_Report.pdf · deepseek-ai/DeepSeek-V4.1-Flash at main


  • 海獭为什么叫海獭 09-10 14:58
    3

    Causal,也是,怎么可能会是 Bert 那种

    居然还有 196B 的 Engram,这么大 ^-^

  • Sam Altman 09-10 14:59
    4

    在梁子把 coding plan 端上来之前暂时不将其升级为梁圣

  • gordontsm 09-10 15:00
    5

    用过的佬有没有分享一下体感的,不看广告看疗效

* 帖子来源Linux.do
返回