双4090跑qwn3.8-27b-fp8最高能到多少?

Timetzh 2026-08-15 20:06 1

本地服务器跑用来快速分析新闻和做股票数据总结。qwen3.5-35B-A3B-FP8差不多是167,今天试了试最新的qwe3.8-27B-FP8差不多是71,速度慢了但是问题质量综合还没有提高,各位都是如何做优化提高速度的?

最新回复 (10)
  • Ljj 08-15 20:52
    1

    同显卡插个眼哈哈哈对了佬一般用来干嘛

  • GloryDuck 08-15 21:09
    2

    fp 8 vllm 开了 mtp 大概也就到 50tokps。


    佬的 70 是怎么跑出来的呀

  • xcstg 08-15 21:15
    3

    我双2080ti魔改22g,agent环境里面大概是50左右,fp8权重,200k上下文+图片识别

  • kurssy 08-15 21:27
    4

    总之很慢 而且一直思考 我只能关了 不过不思考好像又不太聪明 很鸡肋

  • 咪叭 08-15 21:28
    5

    要快还得是35B A3B,所以我才更喜欢35B版本


    日常还是35B好用的

  • Timetzh 楼主 08-15 21:36
    6

    目前就是自己的股票系统,采集全球的新闻,然后千问翻译过滤打标签,然后让claude和codex做了一些工具,可以查自己的数据库出结论

  • Timetzh 楼主 08-15 21:37
    7

    不知道哎,我就让它从魔塔下载,然后进行测试自动优化,参数上面应该写了

  • Timetzh 楼主 08-15 21:39
    8

    目前测试看起来是的,差距很小,再跑一些文字看看,如果提升不大不值得换了

  • 系统提示 08-15 21:46
    9

    vllm 和 sglang 要不你都试试?

  • Timetzh 楼主 08-15 21:57
    10

    目前是vllm,sglang没试过,可以后面让它自己测试下

* 帖子来源Linux.do
返回