8G显存 32G d4内存 27B模型能耍起吗...

OctoberSama 2026-08-19 20:32 1

有没有什么神秘黑科技 可以在q3或者q4量化 24k上下文跑出10t/s的速度吗

想玩qwen3.8了24年没买16g显存的版本我真的好后悔 ^-^

最新回复 (17)
  • 霸道蔡徐坤 08-19 20:37
    1

    还不如买api耍^-^,本地也就跑跑文生图还行^-^

  • OctoberSama 楼主 08-19 20:38
    2

    主要是想玩破限 写点小东西 分析下抓包什么的感觉不错

  • lee2008 08-19 20:38
    3

    主要是本地上下文又小、速度又慢,能用来干什么呢。

  • GGbig 08-19 20:42
    4

    跑不了,等35B,倒是可以试一试

  • OctoberSama 楼主 08-19 20:44
    5

    MoE有小显存方案是吗 有没有相关项目教程什么的)

  • impouo 08-19 20:48
    6

    8g…跑点7b得了,就别考虑20b以上的了

  • GGbig 08-19 20:49
    7

    刚刚在B站刷到一个UP的分享,佬可以试试
    具体方法省流:
    ①用LM Studio部署MoE架构模型
    ②把“GPU卸载”参数拉高(视情况而定)
    ③把“Number of layers for which to force MoE weights onto CPU”参数调到20-35左右
    这其实是一种用内存换显存的方法,
    只对MoE模型(如Qwen3.5 35B A3B、GLM 4.7 F…


    看看这个

  • Novic 08-19 20:49
    8

    跑 35BA3B ,用 llama.cpp ,只把激活的专家放在显存,其他丢内存,速度不算太慢。可以玩玩试试

  • fairstar 08-19 20:50
    9

    别想了 老老实实用 35BA3B 吧

  • z1056544889 08-19 20:50
    10

    写小黄文为什么不grok或者deepseek呢,你本地模型聊几句上下文就爆了

  • GoldJay 08-19 20:51
    11

    用习惯了厂商的大模型,本地跑LLM适应不来的,本地跑跑生图模型得了佬

  • 梦秋思 08-19 20:52
    12

    我16G,32内存都觉得不怎么爽,内存小了,上下文开不了太大。

  • kooo13579 08-19 20:58
    13

    qwen 3.8 沒有35BA3B

    好像沒說過要出


    只能用27B了

  • Novic 08-19 21:02
    14

    那我的 8G 小显存大抵也是没救了 ^-^ 只能拥抱云模型了

  • kooo13579 08-19 21:05
    15

    我16G也不夠,

    你等IQ1_XS.gguf看看 ^-^

  • SKT.Shinyruo 08-19 21:17
    16

    我5070 12G + 96G内存,跑的ollama qwen3.8:27b,大概在10t/s

  • Pica 08-19 21:17
    17

    同样的配置,1.5tok/s ^-^

* 帖子来源Linux.do
返回