Qwen3.8-Flash-Next 前端效果测试

GPLer 2026-08-27 03:17 1

前言


本帖为 BF16 满血版本模型测试,FP8 量化版本测试贴在这,可以对比着看看



前言
本帖为 FP8 量化版本模型测试,BF16 满血版本测试贴在这,可以对比着看看

测试环境
模型: Qwen/Qwen3.8-Flash-Next-FP8 (从权重大小来看 BF16 有爆显存风险)
显卡: 4 x A800 80GB
引擎: vllm/vllm-openai:qwen38-flash-next (目前只能用这个,v0.28.0 起不来)
上下文长度: 256k (…


测试环境


模型: Qwen/Qwen3.8-Flash-Next

显卡: 4 x A800 80GB

引擎: vllm/vllm-openai:qwen38-flash-next (目前只能用这个,v0.28.0 起不来)

上下文长度: 256k (原生 256k 简单测测够用)

软件: Cherry Studio

思考强度: 默认 (xhigh)

投机解码: MTP, 3



需要配置环境变量 VLLM_PLE_CPU_OFFLOAD=1 将 51B 的 NGram 卸载到内存,不然显存差一点默认参数会 OOM




开启 (MTP, 3) 输出速度大概 128 token/s



web 前端效果测试


鹈鹕骑自行车



提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。






鹈鹕骑自行车-Plate-No07-活动标本.html.txt (53.9 KB)



简评: 落地页做的不错,次要骑车蓝图效果还行,但是主要骑车画面主体不会动,而且肢体错位了,多花点精力在主要任务上会更好



秦始皇骑北极熊



提示词: 画html,一个秦始皇骑北极熊的2d动画,画好看一些





始皇北巡图-骑白熊巡于冰海.html.txt (55.6 KB)



简评: 满血版模型怎么效果反而变差了,按钮也全用不了



天气卡片



提示词: 以 iOS 18 的设计风格做一个带有动画效果的天气卡片,要求是使用 HTML、CSS 和基础 JavaScript,使用横板天气页面(拥有 4 个天气卡片 (晴天,大风,暴雨,暴雪))。应足够美观,实现一定的交互效果。





天气-四象限.html.txt (52.8 KB)



简评: 如果没有 html 标签的话功能还是挺完整的



鹈鹕骑摩托车



提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑摩托车的2D动画。





鹈鹕骑摩托车-PLATE-07.html.txt (52.5 KB)



简评: 拉完了,还不如量化版本



梁文峰骑大鲸鱼



提示词: 创建一个HTML,内容是SVG绘制一个梁文峰骑大鲸鱼的2D动画。





骑鲸记-梁文峰与深蓝号.html.txt (41.4 KB)



简评: 功能看上去还正常,但是意境没量化版好



魔方



提示词见之前贴





RUBIK-LAB-空间姿态引擎-Threejs-333.html.txt (50.4 KB)



简评:奇怪的画风,按钮交互没反应,魔方转不了



长颈鹿打螺丝



提示词: 创建一个HTML,内容是SVG绘制一个长颈鹿打螺丝的2D动画





工位-07-长颈鹿打螺丝装配单元.html.txt (49.8 KB)



简评:不错,按钮也都能用,这才是应有的水平





题目大部分来源上次 Qwen3.8 27B 测试,可以对照着看看



鹈鹕骑车
提示词: 创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画。
[图片]
[图片]
鹈鹕公路-SVG-骑行动画.html.txt (34.8 KB)
秦始皇骑北极熊
提示词: 画html,一个秦始皇骑北极熊的2d动画,画好看一些
[图片]
[图片]
始皇驭熊北巡-雪原夜行.html.txt (31.8 KB)
魔方
提示词见楼下
[图片]
[图片…




看上去似乎满血版本模型的效果还是不太行(甚至更差了),测试结果效果一般看上去也不是量化导致的,难道是投机解码的原因?


文件下载后改后缀为 html 运行,有别的测试题或需要测试的内容也可以留言,不是特别复杂的看到了都会测

最新回复 (8)
  • W1nge 08-27 03:23
    1

    哇拉完了

    太失望了我敲

  • GPLer 楼主 08-27 03:25
    2

    不知道是不是 MTP 的原因,不过我看别的贴用在线 API 测鹈鹕效果也很一般,这个模型整体能力上感觉确实不如之前的 27B,不管是满血版本还是 FP8 量化版本都很难一次生成出没有 BUG 的页面,可能配上 Agent 框架会好点

  • W1nge 08-27 03:26
    3

    27b用mtp用到飞起也没啥区别啊

    我们Qwen4是不是也要完蛋了

  • GPLer 楼主 08-27 03:28
    4

    Qwen 好像近几代都是这样,小参数的模型很强,大参数的模型反而不太行 (Qwen3.8 Max 力大砖飞先不谈)

    感觉大参数但是激活参数极少这条路线似乎上限不是很高的样子

  • Brady 08-27 03:34
    5

    我早上看评分是比27B都要高的, 就是每一项都高一些. 实际那么拉跨吗?

  • GPLer 楼主 08-27 03:35
    6

    有可能是 Agent 特化了,反正对话直出看上去不行

    白天我试试关掉 MTP 会不会改善,理论上应该没影响才对

    网页聊天好像也上线了这个模型,可以去实际试试感受下,或者看看白天其他人的测试结果

  • W1nge 08-27 03:41
    7

    确实,好像有一种说法是Claude激活参数是其它几家的五倍十倍

    所以claude编程能力特别强?

    也解释了GLM为什么编程能力比起别的地方会特别突出


    但是不知道真的假的,感觉有点玄乎 ^-^

  • GPLer 楼主 08-27 03:47
    8

    claude 尤其是 mythos 5 / fable 5 在一些后出的新测试题上表现也有相对来说不错的领先,技术上肯定是有点东西的,不像纯背题选手

    之前看到过一篇帖子,说是循环 transformers,但这么久也没见谁复刻出来想必没那么简单


    至于 GLM 和 d4f-0731 架构好像没改,纯粹的后训练仙人

* 帖子来源Linux.do
返回