开源一个在 A100 80GB × 4~5 条件下部署原版 DeepSeek V4.1 Flash 的配方

c.1 2026-09-27 15:54 1



开源推广

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签: 是

  • 我的开源项目完整开源,无未开源部分: 是

  • 我的开源项目已链接认可 LINUX DO 社区: 是

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是

  • 以上选择我承诺是永久有效的,接受社区和佬友监督: 是


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出





现在 DeepSeek V4.1 Flash 等比较新的模型需要用到诸如 fp8、fp4 等特性,而 A100 是 Ampere(sm_80)架构的,对此没有原生支持。vllm 等工具的官方文档已经没有 A100 的配方,很多民间方案需要 A100 80GB × 8 才能跑起来,门槛过高。


前一阵发现了这个项目,作者通过重写算子等方法实现了 A100 80GB × 4 条件下部署原版 DeepSeek V4.1 Flash。如果需要视觉、DSpark 功能,可能还要再加一块卡。


这个项目里有很多作者个性化的配置,我部署的时候遇到了不少问题。比如:



  1. OpenAI compatible 的交互行为有些异常,部分软件接入有问题

  2. Token 解码存在一定问题,使 emoji 无法显示,部分情况下会发生截断

  3. Dspark、图像链路、前缀缓存、1M 上下文等功能不能兼得(一些 DS 特有的技术解释可以参看我的 可视化)


在 AI Agent 的帮助下,我基本解决了上面这些问题,并进行了性能优化。测下来单线程解码速度可以到 55~85 token/s (具体取决于 Dspark 接受率等情况)。


既然得到开源项目的帮助,我的经验也一并开源:




虽然在有限的测试中没有发现新问题,但毕竟没有经过大规模验证,仅供参考。

最新回复 (7)
  • Light 09-27 15:58
    1楼

    320GB显存就不够吧,是怎么做到的?

  • PYJU 09-27 15:59
    2楼

    会了会了,现在A100在哪里领 ^-^

  • 阿皮 09-27 16:02
    3楼

    等一下?我数数 A100 A100 A100 A100…算了,打扰了佬儿!

  • c.1 楼主 09-27 16:04
    4楼

    Engram 卸载到 RAM 以后,剩余的权重 + KV Cache 可以勉勉强强塞下

  • W1nge 09-27 16:13
    5楼

    Emmmmmm


    A100是Ampere架构的吧 佬是不是写错了 ^-^

  • c.1 楼主 09-27 16:17
    6楼

    打错了,已更正

  • Loong 09-27 17:25
    7楼



    请问没有NVlink是否可行?说起来也巧,我正在探究A100部署DeepSeek V4.1 Flash codex正在帮忙分析,我正好就刷到了这篇帖子

* 帖子来源Linux.do
返回