在 sm8x (A100, A6000, 3090/4090, L40)上跑 DeepSeek-V4-Flash 的 vLLM fork

Lazymio 2026-08-06 19:18 1

https://github.com/wtdcode/vllm-backport


花了一点时间一半 vibe 一半自己理解代码把这个 vibe 出来了,期间最大的感悟是



  • 算子补齐感觉现在有 AI 是真的可以几乎接近自动化了,尤其是有很多可以抄的

  • 相比写算子,更麻烦的是确认推理的正确性,很多时候误差一点点积累到最后就开始输出垃圾内容了

  • Fable 确实比 Opus 聪明一点,但是在调试 vLLM 这件事情上还是需要我的一些指导


总之欢迎大家使用和反馈! Repo 里也有 Docker 镜像可以快速部署,也可以点个 Star 。

最新回复 (0)
    没有回复
* 帖子来源V2EX
返回