Strata这个qwen-3.8-flash确实可以

EVELance 2026-10-04 17:07 1

跑的 qwen3.8-flash-next-iq3_s。


随便画了几个东西


截图







HTML


太古屋: oldest-house.txt (26.9 KB)


鹈鹕: pelican.txt (53.8 KB)


太古屋这个是让它自己去搜的:



做一个HTML用于介绍《控制》里的太古屋,这个房子的原型是at&t的长线大厦,在游戏里是联邦控制局(FBC)的总部。更多信息你可以调用 Grok MCP 搜索。

整体视觉设计要符合《控制》的风格。



然后又让它做成了纸质版风格:



再做一般做成游戏里那些纸质档案风格。



硬件和性能


5070Ti + 64G DDR4 3600,CPU是5700X。系统是 Win11 26H2。

开到256K上下文,大约跑到40-50tps。


显存内存基本吃满了:



^-^ 注意图里是专家占用的显存部分,实际显存是吃满了(默认保留了700M的样子)。

运行过程中显卡功耗大概在150w。


最新回复 (7)
  • cainiao3hao 10-04 17:14
    1楼

    确实很可以,都不敢想象我这显存加内存能跑qwen3.8-flash-next-uncensored-iq3,还能塞1M上下文,速度也还可以 ^-^


    这就是moe模型的魔法吗,3.8-27b的q6塞个1m都够呛,让claude分析了下,llama.cpp确实做不到对某个模型处理这么细,操作粒度都太粗了

  • Mozi 10-04 17:16
    2楼

    普通台式电脑能达到这种效果。应该只有这个模型可以实现吧?

  • EVELance 楼主 10-04 17:17
    3楼

    uncensored 用的什么版本呀?我也来搞一个,我现在先装的原版。

    之前跑27B,完全没这速度。


    毕竟它这个专用推理引擎只兼容这一个模型,不过给了无限想象,只要有个好用的flash,搞专门的优化工具可以让很多设备都跑起来了。

  • cainiao3hao 10-04 17:19
    4楼

    Orca的,让claude帮我配的


    另外推理的时候硬盘读取速度巅峰也就50M左右,sata盘都能hold住,很亲民了

  • EVELance 楼主 10-04 17:20
    5楼

    哦我搜到了那个Orca的,回头试试看。sata盘都能hold住吗,真不错。

  • Blackwood416 10-04 17:34
    6楼

    q2q3真能用吗?低于q4的我都不敢用 ^-^

  • cainiao3hao 10-04 17:40
    7楼

    有一部分计算是返回成bf16的,不是llama.cpp那种暴力全局量化,项目中默认的原版量化模型,量化方式也是挺细致的,q3表现跟bf16差不多


    而且想要的话是可以q4的,这方面又没限制你,不过我的配置想上q4的话,上下文跟系统内存会被压的比较极限 ^-^

* 帖子来源Linux.do
返回