有没有什么好的 Qwen3.8-27B 的渠道呢

Ruinique 2026-08-25 22:25 1

不介意付费,但是不希望比 codex 反代的 luna 贵,希望可以稳定一点

最新回复 (19)
  • 苏白 08-25 22:31
    1

    佬 为什么不租算力 几百块一个月自己部署呀

  • Ruinique 楼主 08-25 22:34
    2

    主要是感觉 4090 48g * 2 也不便宜吧,有哪些便宜的租算力的平台呢?

    而且我觉得云端推理上会有成本优势吧

  • 落寞书生 08-25 22:36
    3

    只是部署qwen3.8 27b的花,没必要整两张4090,三个魔改2080ti也可以跑q8量化,使用llama.cpp跑,decode速度能够跑到45t/s

  • 薛定谔的Tomcat 08-25 22:37
    4

    我也在找这个渠道,感觉比ds-v4-flash性价比高点。我看目前自部署基本上6块钱左右一个小时,pro6000显卡,几个人一块用的话应该还行。

  • 整点东东 08-25 22:38
    5

    Qwen3.8-27B 好用么,我公司部署的,我都没用

  • 落寞书生 08-25 22:39
    6

    编码来说的花,个人感觉跟v4 flash差别不大,我平时自己部署这个跑

  • 苏白 08-25 22:40
    7

    佬 那上下文怎么说 按照你的方案做的话

  • ai应该一直工作 08-25 22:41
    8

    比luna便宜很难吧,我记得qwen3.8不是输入都要12元了吗

  • 落寞书生 08-25 22:42
    9

    我是个人使用,三张2080ti,跑慢256k上下文,显存正好够用

  • 苏白 08-25 22:43
    10

    佬用的什么平台租的算力呀 能推荐一下吗

  • 落寞书生 08-25 22:44
    11

    我不是租的,自己买的魔改卡,自己本地部署的

  • 苏白 08-25 22:45
    12

    fp8 或者gptq可以吗 如果跑 3090

  • Nec 08-25 22:45
    13

    自己买的自部署吗,你这5张卡也太有钱了

  • mordo7238 08-25 22:45
    14

    单卡4090 24G部署了个NVFP4的,开了200k上下文,长上下文时跑30~40tok/s,短上下文时能跑90tok/s

  • 落寞书生 08-25 22:46
    15

    3090原生不支持fp8,得40系起步

  • 苏白 08-25 22:47
    16

    t4可以吗 rtxt4。这个显卡

  • 落寞书生 08-25 22:47
    17

    自己想本地搞一些东西就买了,魔改卡现在也不贵,内存比较贵

  • soobir 08-25 22:47
    18



    a100部署了bf16,256k上下文,智力还可以,就是有点慢

  • 落寞书生 08-25 22:49
    19

    rtxt4显卡没听说过,不考虑并发的花llama.cpp硬件兼容性较好,10系列显卡好像都支持

* 帖子来源Linux.do
返回