FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

coolpool 2026-09-01 16:32 1

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。


FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。


论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。


FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。


大佬们尝鲜吗,我还在下

github:https://github.com/FlashML-org/FreeToken



我这笔记本能跑的就3个,难蚌

最新回复 (8)
  • 成都大蛇 09-01 16:34
    1

    要大内存吧 ^-^

  • xzxc 09-01 16:35
    2

    那我的4070 是不是可以自己玩了

  • jlthzy 09-01 16:36
    3

    确实,有内存限制不?

  • czspgreat 09-01 16:37
    4

    要多大内存,我只有64g

  • coolpool 楼主 09-01 16:39
    5

    @成都大蛇 #1 确实,我32GB 内存和8g显卡,能跑的就3个

  • coolpool 楼主 09-01 16:39
    6

    @xzxc #2 可以玩小模型 ^-^

  • coolpool 楼主 09-01 16:41
    7

    @jlthzy #3 有限制,部分

  • coolpool 楼主 09-01 16:42
    8

    @czspgreat #4 下载了能自动识别,我也不大清楚,才看到这个项目 ^-^

* 帖子来源NodeSeek
返回