Qwen3.8-flash-next 鹈鹕骑自行车(多张)

darkhandz 2026-09-11 21:15 1

本地一台DGX Spark GB10部署的Qwen3.8-flash-next,prefill 2100~2300, decode 30~40 tok/s。

pi agent,只安装了一个看对话耗时的插件,用cc-switch配置的api,思考强度也做了映射:




配置

“contextWindow”: 240000,

“maxTokens”: 16384,

“thinkingLevelMap”: {

“max”: null,

“off”: “none”,

“minimal”: null,

“high”: null,

“low”: “low”,

“medium”: “medium”,

“xhigh”: “xhigh”

}



提示词:画一个鹈鹕骑自行车的动画, html格式, 不需要测试


跑了10多次xhigh的,8次medium的,4次low的,发现个奇怪的情况:xhigh每次耗时一般在12~16分钟(思考是英文的),low在2~4分钟(思考是中文的,内容比medium长),medium不知道为什么都在1~2分钟之间(思考是英文的)。我怀疑lowmedium不知道我在哪里配置搞反了。


以下是xhigh




14分钟



16分钟



13分钟



17分钟



16分钟



6分钟



16分钟



7分钟



12分钟



13分钟



16分钟



33分钟



10分钟



以下是medium




1分钟+









2分钟



以下是low




4分钟



6分钟



2分钟



4分钟



4分钟



2分钟



2分钟



3分钟


最新回复 (5)
  • PonyDavi 09-11 21:19
    1

    后面几张图真的是笑死我了,太离谱了

  • 蹲神 09-11 22:29
    2

    应该一层放一张



    方便针对性boosts吐槽

    笑死



  • talentchuangz 09-11 22:30
    3

    大佬,你是怎么部署的,单机有30到40tps,我撑死了20多呀,也是单spark,大佬能教下嘛

  • darkhandz 楼主 09-11 22:41
    4

    我是这里拿的配置 blazux/qwen3.8-Flash-DGX

  • talentchuangz 09-11 22:44
    5

    挺牛逼,大佬,这个速度直接一上来就达标拉

* 帖子来源Linux.do
返回