GLM5.2 真的挺好用的

喵喵喵 2026-06-22 10:21 1



爆杀Deepseek,Claude用不起,Codex不稳定,只能部署个GLM了。开源万岁 !


性能指标大概是prefill 10000+tokens/s, decode 100+ tokens/s


部署脚本


vllm serve zai-org/GLM-5.2-FP8 \
--served-model-name claude-opus-4-8 claude-opus-4-7 claude-opus-4-6 GLM-5.2\
--tensor-parallel-size 8 \
--max-num-batched-tokens 16384 \
--max-num-seqs 64 \
--max-model-len auto \
--gpu-memory-utilization 0.9 \
--tool-call-parser glm47 \
--enable-auto-tool-choice \
--reasoning-parser glm45 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 5 \
--kv-cache-dtype fp8_ds_mla \
--kv-offloading-size 512 \
--kv-offloading-backend native \
--host 0.0.0.0 --port 8104

不是壕,服务器是公司的,只是拿来用用 ^-^

最新回复 (19)
  • Mozi 06-22 10:23
    1

    1100多G的显存,牛逼啊

    八个H200

  • admin 06-22 10:23
    2

    多么土豪的佬才能这样玩,你这价格可以让我玩一辈子gpt了

  • fen 06-22 10:23
    3

    太狠了,这就部署了 ^-^,deepseek还是要等待后训练版本

  • WM 06-22 10:23
    4

    抢了一个星期完全抢不到,全都是人数过多,我都没见过能抢的按钮是长什么样子的 ^-^

  • zanexu 06-22 10:24
    5

    NB啊佬,这是个人用户 还是企业啊

  • 墨殇 06-22 10:24
    6

    卧槽,1个人用就直接拉满百分百了吗?

  • yxbj 06-22 10:24
    7

    这就是有钱大佬的力量么!?台牛了

  • rainice 06-22 10:25
    8

    这成本也太高了吧,太有实力了,感觉这都几百万了吧

  • 喵喵喵 楼主 06-22 10:25
    9

    测下来估计能40-60并发吧,不过目前就我一个人用,反正机器闲着也是闲着

  • 刺猬 06-22 10:25
    10

    太牛了,这就是有钱大佬的力量吗,太有实力了

  • 火鸡工程师 06-22 10:26
    11

    太强了,比很多野鸡云服务厂商还牛逼

  • inlife 06-22 10:26
    12

    让佬友们帮你免费压力测试下不?^-^

  • 马保国 06-22 10:26
    13

    太豪了、此时此刻我只想说、我是学生、送我

  • fanxing 06-22 10:27
    14

    请问什么叫claude用不起? ^-^

  • 墨殇 06-22 10:27
    15

    刚刚找了一位佬友说拼glm国产卡本地部署来着,有兴趣找其他佬友一起拼吗佬友 ^-^看看定价多少合适?

  • rc 06-22 10:28
    16

    这电费都不少钱了吧,吓哭我啦! ^-^

  • a111111 06-22 10:28
    17

    羡慕,除了羡慕还能说什么呢?太富了。

  • TechnologyStar 06-22 10:29
    18

    能用ldc和你换吗,同样按token计费,你可以用newapi封装一下

  • _maoyu 06-22 10:29
    19

    佬友有考虑分发一部分出来吗? ^-^

* 帖子来源Linux.do
返回