实测Qwen3.8-27B / GLM 5.3 / V4F -- 秦始皇骑北极熊

海绵踢宝宝 2026-08-15 16:27 1

最近V100 32G降到3500左右了,又开始手痒想自部署

于是租了台32G V100,实测了一下Qwen3.8-27B,供大家参考

跑的是Unsloth的GGUF量化版 Qwen3.8-27B-UD-Q4_K_XL


显存占用


256K+MTP+8位KV:显存占用 28,644M


Prefill速度测试(45K文字输入):


60,000 字符 → 45,802 token,耗时 83.75 秒,平均 546.9 token/秒

(瞬时峰值速度在 600–800 token/秒,随上下文变长逐渐降到约 550)

换算到claude code的系统提示词量,差不多首字要2分钟左右


测试提示词(补了三行站里其他佬发的优化要求):


创建一个html,使用SVG绘制秦始皇骑北极熊的2D动画
设计标准:对标 Awwwards 顶级网站水准,达到 Awwwards、FWA、CSS Design Awards 每日最佳网站同等设计品质。
创意自由度:将浏览器视作交互式艺术画布,跳出传统布局框架,追求先锋视觉风格、实验性排版、流畅物理动效、极具冲击力的文字版式。
沉浸式体验:融合代码、高级渲染逻辑,打造统一完整的精品页面,做出突破常规 UI 认知、令人惊艳的数字交互体验。

Qwen3.8-27B-UD-Q4_K_XL


整体观感居然还不错,比V4F好很多(不知道V4抽的什么风)

动画很流畅,熊的方向也是对的,加了很多文字,比较有故事性

问题就是超级雷霆大思考,1927秒,输出 94195 Toks,无数次想停掉 ^-^




v4-flash(官网API)


输出 23187,2分钟

一大坨,要质量有速度,要美观有速度




GLM 5.3


输出 32404,火山渠道的速度一般,5分钟才跑完

个人最喜欢的一版,开屏动画比另外两版有冲击力。

点击甚至有配乐;就是为什么北极熊会倒着走 ^-^




总结


虽然V100已经便宜很多了,但这速度似乎还不够电费的

除非有任务能24小时一直满载,不然休想回本了,可能跑Hermes会划算一些?

最新回复 (8)
  • 海绵踢宝宝 楼主 08-15 16:34
    1

    补个说明,都是cherry studio直接发的提示词,没有用harness;

    思考强度都是max

  • 不要吃太饱 08-15 16:37
    2

    看到glm的我笑了,这熊倒着走 ^-^

  • kk C 08-15 16:39
    3


    实话说,不如Grok4.5Free

  • 海绵踢宝宝 楼主 08-15 16:43
    4

    Grok好久没用了,总偷偷酱汁,降怕了 ^-^

    感觉现在Codex Free更划算

  • kk C 08-15 16:44
    5
  • kk C 08-15 16:48
    6

    创建一个html,使用SVG绘制秦始皇骑北极熊的2D动画



    我的提示词只有一句话后面提示词还没有说,我去试试。

  • 稳 何 08-15 16:52
    7

    用佬的提示词,正价grok4.6现在跑了17分钟还没结束

  • kk C 08-15 16:59
    8


    6分钟,秦始皇骑花枝鼠来了。Grok4.5


* 帖子来源Linux.do
返回