Gemma4 12B部署体验,5090单卡,80+tokens/s,使用多模态,记得升级llama.cpp到b9503

yeyucca 2026-06-04 14:10 1

这个尺寸对单卡比较友好(5090跑有点傲娇了,后面用lnl 258v应该才是归宿),用的是ud家的Q8_XL,速度80+tokens/s


0605:update llama.cpp b9503可以跑多模态了,大家enjoy




0604:需要说明的是,当前llama.cpp对gemma4uv不识别,导致没法用多模态,再等能,应该很快,毕竟G家这次动了编码器,L家居然没0day适配,再等等,当前给到 text就能正常跑了


最新回复 (16)
  • superloki7 06-04 14:16
    1

    没有mtp的支持么,感觉应该不至于这么低

  • MineMine 06-04 14:16
    2

    我拍了拍俺的 AMD:“没关系,能跑起来已经很棒了”。

  • yeyucca 楼主 06-04 14:41
    3

    刚出来不到12h,还热乎,mtp再等等

  • Ruby 06-04 15:10
    4

    gpt给我说有一版llama.cpp可以跑我现在在编译等会看看

  • zhaoyu 06-04 16:08
    5

    我一直有一个疑问,本地模型的应用场景是什么?

  • 倚栏听风 06-04 17:43
    6

    我之前用L40s 部署的 deepseek70B 速度就那样不会很快

    后面部署的32b 比api块 1倍左右


  • paopao 06-04 17:44
    7

    最常见的就是有隐私需求/成本考虑,还是很明显的吧

  • 倚栏听风 06-04 17:45
    8

    我去试试 31b

  • 倚栏听风 06-04 18:05
    9

    比deepseek70b聪明啊

  • にたま懂个じば 06-04 18:12
    10

    咋感觉我这显示的数值和你的区别这么大^-^

    不过46的速度我都觉得蛮快了

  • hhnnjjcc 06-04 18:27
    11

    啥时候真的能有一个能coding的本地模型啊,能和DS4 FLASH一个档次就可以了

  • yeyucca 楼主 06-04 21:05
    13

    一直想部署DS4,奈何llama.cpp和vLLM这些上游还没ready,又么有苹果设备,吃不到ds4.c



    一直想部署DS4,奈何llama.cpp和vLLM这些上游还没ready,又么有苹果设备,吃不到ds4.c

  • Belope 06-05 18:08
    14

    qwen3.6 27b 接 cc 里 ultracode 按照既往工作做做小项目没问题。其实比较推荐最新预印本那个微调过的 quest 35ba3b,我觉得比 Claude 烧钱版 deep reserch 效果好

  • yeyucca 楼主 06-05 18:31
    15

    微调过的是 35b 能发下具体名字或者链接么?后面可以试试,前面一直认为 27b 稠密模型更优

  • Belope 06-05 18:36
    16

    表述不好佬,不是干活的,是深度搜索用的,我包了个后端给 pi 和 opencode 接的 api 用的哈哈哈,具体是这个:QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks

    中文意思:QUEST:用完全合成任务训练前沿深度研究智能体


    arXiv 页面:



    论文 PDF:

    https://arxiv.org/pdf/2605.24218


    Hugging Face 论文页:

  • NobodySU 06-08 05:53
    17

    GLM4.7-Flash不行吗?我测试DS V4编程能力不如GLM5.1或Kimi K2.6。小模型想来GLM也不会差吧。

* 帖子来源Linux.do
返回