Qwen3.8-Flash-Next-FP8 前端效果测试

GPLer 2026-08-26 23:58 1

前言


本帖为 FP8 量化版本模型测试,BF16 满血版本测试贴在这,可以对比着看看



前言
本帖为 BF16 满血版本模型测试,FP8 量化版本测试贴在这,可以对比着看看

测试环境
模型: Qwen/Qwen3.8-Flash-Next
显卡: 4 x A800 80GB
引擎: vllm/vllm-openai:qwen38-flash-next (目前只能用这个,v0.28.0 起不来)
上下文长度: 256k (原生 256k 简单测测够用)
软件: Cherr…


测试环境


模型: Qwen/Qwen3.8-Flash-Next-FP8 (从权重大小来看 BF16 有爆显存风险)

显卡: 4 x A800 80GB

引擎: vllm/vllm-openai:qwen38-flash-next (目前只能用这个,v0.28.0 起不来)

上下文长度: 256k (原生 256k 简单测测够用)

软件: Cherry Studio

思考强度: 默认 (xhigh)

投机解码: MTP, 3



不启用 MTP,输出速度大概 83 token/s;启用 (MTP, 3) 输出速度大概 158 token/s



web 前端效果测试


鹈鹕骑自行车



提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。






鹈鹕骑自行车-PELICAN-CYCLE-CO-现场演示.html.txt (61.5 KB)



简评: 确实很认真,做了一整个完整的产品落地页,但是努力的方向好像错了?



秦始皇骑北极熊



提示词: 画html,一个秦始皇骑北极熊的2d动画,画好看一些





北溟乘熊图-始皇巡冰.html.txt (50.2 KB)



简评: 粗看好像没啥问题,整体观感看上去似乎比 27B 强



天气卡片



提示词: 以 iOS 18 的设计风格做一个带有动画效果的天气卡片,要求是使用 HTML、CSS 和基础 JavaScript,使用横板天气页面(拥有 4 个天气卡片 (晴天,大风,暴雨,暴雪))。应足够美观,实现一定的交互效果。






天气面板-Weather-Board-40.html.txt (60.5 KB)



简评: 还行?就是不知道为什么全做成落地页风格了,一页还放不下



鹈鹕骑摩托车



提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑摩托车的2D动画。





鹈鹕特快-PELICAN-EXPRESS-沿海公路-3-号.html.txt (43.7 KB)



简评: 抛开脸没了不谈,似乎还行?



梁文峰骑大鲸鱼



提示词: 创建一个HTML,内容是SVG绘制一个梁文峰骑大鲸鱼的2D动画。





骑鲸者-梁文峰与一头大鲸.html.txt (47.2 KB)



简评:看上去有点想法,可惜按钮交互都是坏的



魔方



提示词见之前贴





CUBICLAB-33-空间枢轴手势魔方.html.txt (62.4 KB)



简评:刚点开没看见魔方以为坏了准备开喷,按下重制按钮整个人都震惊了,质感和动效神了



长颈鹿打螺丝



提示词: 创建一个HTML,内容是SVG绘制一个长颈鹿打螺丝的2D动画





长颈鹿精密螺丝厂-工位-07-打螺丝中.html.txt (69.1 KB)



简评:观感不错,可惜依旧做成落地页,且按钮好像都用不了





题目大部分来源上次 Qwen3.8 27B 测试,可以对照着看看



鹈鹕骑车
提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。
[图片]
[图片]
鹈鹕公路-SVG-骑行动画.html.txt (34.8 KB)
秦始皇骑北极熊
提示词: 画html,一个秦始皇骑北极熊的2d动画,画好看一些
[图片]
[图片]
始皇驭熊北巡-雪原夜行.html.txt (31.8 KB)
魔方
提示词见楼下
[图片]
[图片…




看上去似乎效果一般?可能和量化了有关,等研究明白了后面试试 BF16 版本


文件下载后改后缀为 html 运行,有别的测试题或需要测试的内容也可以留言,不是特别复杂的看到了都会测

最新回复 (6)
  • 天天开心 08-27 00:01
    1

    强,我只有两张48G4090,FP8都搞不了,等社区发布Q4尝尝,不会Q4连27B都打不过吧

  • GPLer 楼主 08-27 00:07
    2

    我感觉你这个配置跑 27B FP8 更好,200k 上下文单卡就能塞得下,这个模型激活参数只有 6B,按 qwen3.6 时候的经验来说,应该是没密集模型 27B 来的强的,但是速度会更快,类似 35B_A3B

  • 天天开心 08-27 00:12
    3

    对,我现在就是单卡4090跑27B,300K上下文没问题,但是我主要是看这次120B跑分比较高,想试试

  • GPLer 楼主 08-27 00:39
    4

    建设完毕,睡觉去了,明天跑个 BF16 版本看看满血能力

  • piqiuni 08-27 11:45
    5

    fp8这样吃多少显存呀,双H100 80GB能部署吗

    另外大佬有计划试试glm的flash吗

  • GPLer 楼主 08-27 12:29
    6


    直接载入最少需要 220GB 显存,如果再开启 MTP 最少需要 230GB 显存,不过可以配置 VLLM_PLE_CPU_OFFLOAD=1 环境变量将 51B 的 NGram 卸载到内存,这种情况下试了下双卡 160GB 显存能正常开 256k 上下文跑起来并使用,实测体验上看上去没什么影响




    关于 glm 5.3 flash,这是个 320B_A18B 的模型,即使是 FP8 四卡 320GB 显存也跑不了,我打算后面跑跑看看非官方的 NVFP4 版本

    目前磁盘空间不太够了,Qwen3.8-Flash-Next 帖子挂两天没人要测就删了腾空间去测 GLM-5.3-Flash-NVFP4 了,顺便看看预览版和正式版不符大伙有没有讨论出说法

    这次的 Qwen3.8-Flash-Next 感觉大家的热情都不是很高,测出来的结果也一般般,等 Qwen4 了

* 帖子来源Linux.do
返回