command code 上架了qwen3.8-27b模型,价格那么高!

Fsharp 2026-08-20 15:30 1

0.4美刀的输入价格,而DeepSeek-v4-flash波峰才0.44,波谷0.22,qwen3.8-27b真的这么强吗?能27b的身板硬撼ds4flash?

如果是真的,公司有一个 ubuntu server 上插了两张5090,我感觉可以ollama部署一个q8的开256k的context试试了,反正不是我家电费。

最新回复 (11)
  • HeriX 08-20 15:32
    1

    毕竟是27B dense, 比较消耗算力的

    比v4f激活参数要高

  • 剑圣 08-20 15:34
    2

    v4f激活参数只有13B,推理成本差不多是27b的一半

  • Fsharp 楼主 08-20 15:42
    3

    那智力水平呢?我的意思是,真的会有人花0.4的价格用qwen3.8-27b,也不用0.44的价格用ds4flash吗?

  • 剑圣 08-20 15:44
    4

    智力水平目前还不好讲,应该是各有优劣

  • Fsharp 楼主 08-20 15:45
    5

    那也就是互有输赢,直接跟云端大模型在一个水平上了?虽然是flash版,但是真的不敢想象。

  • 长夜 08-20 15:45
    6

    27b是稠密模型。你不要被这个数字骗了。推理成本比ds4f还高。ds4f激活的专家模型才13b。


    你正儿八经在自己机器上部署,ds4f比千问27b跑得快……

  • huahong 08-20 15:57
    7

    编码能力在线的,强烈建议本地部署试试,但是速度可就不一定了,我本地测试10分钟写一个鹈鹕骑车页

  • Tokinx 08-20 15:59
    8

    理想情况下是不是只需要部署一个13b(我需要的那1个专家)就可以了。。。只是ds4f是个专家团。。。

    怪不得之前用qwen 27b和35ba3b 感觉27b比35b好用。。。 ^-^

  • 长夜 08-20 16:31
    9

    有一种很经典的部署方式就是,把不用的专家卸载到内存/虚拟内存里面,只把要用的专家加载到缓存。


    所以ds4f的部署要求并不是太高的。

  • 西东 08-20 19:08
    10

    13b(我需要的那1个专家)



    实际上那 13B 是一簇专家。

  • lucas_red 08-20 19:34
    11

    那没办法,27B只是方便本地部署,没说成本会比满血flash低。线上推理的成本还是看激活参数的。拿来卖性价比确实不如满血的flash。

* 帖子来源Linux.do
返回