Nvidia 128G 的那个小盒子用哪个模型好?

abctest 2026-08-26 20:59 1

试了最新出的 Qwen3.8-27B ,吐字很慢,4token/s 。
试了 Qwen3.6-35B-A3B ,质量感觉不行,幻觉有些严重。

最新回复 (2)
  • volvo007 08-26 21:07
    1
    因为这货的带宽太低了,所以非常不适合稠密模型的推理。所以比较合适的还是两台上满血 d4f
  • biaoyu 08-27 04:49
    2
    适合用 MOE ,稠密不行
* 帖子来源V2EX
返回