目前有哪些第三方的GLM 5.2是BF16满血的吗

Mozi 2026-06-19 09:56 1

自部署满血的GLM 5.2应该需要1.5T的显存,是FP8的两倍

最新回复 (18)
  • Sam Altman 06-19 09:57
    1

    opencode go 貌似直接接的官方 api ^-^

  • Mozi 楼主 06-19 09:58
    2

    那比官方便宜还是贵呢?我说的是比较国内的Coding plan

  • Eeevan 06-19 09:58
    3

    Opencode Go 套餐额度分析(GLM、Deepseek对比官网) - 开发调优 - LINUX DO

  • Divergence 06-19 09:58
    4

    FP8 量化应该是基本不太影响精度的,影响精度的是再往下接着量化。

  • Mozi 楼主 06-19 10:00
    5

    如果不影响精度,那影响什么呢

    为什么输出效果会差这么多呢

  • Sam Altman 06-19 10:02
    6

    佬友已经发额度分析了,其实现在第三方 glm5.2 套餐好像只有 opencode go 和 ollama 是能用的,其他几乎都是^-^,但我听说 ollama 就是量化版本

  • haoquan 06-19 10:15
    7

    别说第三方,甚至官方自己都是fp8量化,来源是openrouter:

  • Asamul 06-19 10:16
    8

    智谱自己的都是fp8的,fp8影响不大的,真正影响的是fp4 ,这会明显感觉智商差好多。

  • Mozi 楼主 06-19 10:17
    9

    那火山引擎的不会是FP4吧

    看很多人都不推荐火山引擎的

  • inndeex 06-19 10:19
    10

    有佬用硅基流动吗?他们最近上了GLM5.2但是我看还挺贵的 ^-^ 官方限速太坑了

  • lueluelue 06-19 10:46
    11

    话说 GLM 5.1 / 5.2 这种模型量化一下差距应该不小吧,低精度每次思考 token 能 1.2 倍?

  • 时牧 06-19 10:48
    12

    火山的据说都直接路由到别的模型上了,还刷到过有人用glm分词器bug来做测试

  • Divergence 06-19 10:50
    13

    我说了,FP8 量化不影响精度,你接着量化就会影响了

  • Leon 06-19 15:59
    14

  • 咪叭 06-19 16:08
    15

    其实规模越大的模型,量化的影响就会更小一点

    如果被明显阉割的话,可能是阉割了KV Cache

  • mi tu 06-19 16:13
    16

    现在好像没有满血的渠道,都是fp8吧

  • 星火花葵 06-19 16:16
    17

    如果真基本不影响效果,官方为什么不提供fp8版本呢

  • 星火花葵 06-19 16:18
    18

    智谱官方提供的glm5.2也是fp8的吗竟然? ^-^

* 帖子来源Linux.do
返回