【教程】用aimax395部署qwen 3.8 flash next并达到50toks/s ( Halogen flash server )

LeonLee 2026-10-03 22:55 1

用aimax395部署qwen 3.8 flash next并达到50toks/s( Halogen flash server )


好久没有逛linuxdo了,想水文绞尽脑汁想不出,遂写点没有技术含量的 ps.纯手写无ai,放心食用


准备工作



  1. 一台Ubuntu(推荐)系统下的aimax395机器,安装podman

  2. 一个会动的脑子

  3. 一双会动的手(


提醒


请首先在bios中将显存分配调到最小(我的是512mb)


对!没错!是最小!


教程


Step 1 安装ROCm


sudo apt install libatomic1 libquadmath0
sudo usermod -a -G render,video $LOGNAME
# Download and install GPG key
sudo mkdir --parents --mode=0755 /etc/apt/keyrings

# ROCm release signing key
wget https://stable.repo.amd.com/rocm/gpg/packages.gpg -O - | \
gpg --dearmor | sudo tee /etc/apt/keyrings/amdrocm.gpg > /dev/null

sudo tee /etc/apt/sources.list.d/amdrocm-stable.sources << EOF
X-Repo-Id: amdrocm-stable
Types: deb
URIs: https://stable.repo.amd.com/rocm/core/packages/ubuntu2604/
Suites: stable
Components: main
Architectures: amd64
Signed-By: /etc/apt/keyrings/amdrocm.gpg
Enabled: yes
EOF

sudo apt update
sudo apt install amdrocm-core-sdk10.0-gfx1151

ROCm官方页面


Step 2 通过modelscope获取模型


通过你喜欢的方式下载模型并放到一个你想放的目录


Step 3 跑起来!


podman run --rm \
-p 8731:8731 \
--device /dev/kfd \
--device /dev/dri \
--group-add keep-groups \
--ipc=host \
--ulimit memlock=-1:-1 \
-e HALOGEN_CHECKPOINT=/models/qwen38-flash-next-v2.hgn \
-e HALOGEN_MODEL_ID=Qwen/Qwen3.8-Flash-Next \
-e HALOGEN_VISION_TOWER=1 \
-e HALOGEN_TEMPERATURE=0.6 \
-e HALOGEN_TOP_P=0.95 \
-e HALOGEN_TOP_K=20 \
-e HALOGEN_ROPE_YARN=4 \
-e HALOGEN_REASONING_EFFORT=medium \
-v /path/to/your/models:/models \
ghcr.io/peonist-ai/halogen-flash-server:0.15.1

模型相关参数如HALOGEN_TEMPERATURE等可以自己调,将***/path/to/your/models***改为你的模型所在目录,然后就可以用了, api地址是http://xxx.xxx.xxx.xxx:8731


演示(使用oh my pi,medium强度,耗时25分钟)


prompt:生成一个赛车游戏


https://telegraph-image-92x.pages.dev/file/5165ec32716acc1b8878e-f42bce2b53bcf728a0.gif(图片大于 4 MB)

最新回复 (3)
  • chinajojo 10-03 22:59
    1楼

    ai395的设备也不便宜…好像ai495也出了,不过如果买它,买dgx spark或者mac mini会不会更好

  • LeonLee 楼主 10-03 23:01
    2楼

    我是出的时候买的,那时候万元出头,只能说还是内存带宽太低,还是有点受限


    macmini不了解,dgxspark个人觉得还不如搞几张二手计算卡来的划算

  • LeonLee 楼主 10-04 14:30
    3楼

    补充:手里有这台机器的其实可玩性还很高的,其他很多模型(包括但不限于llm)都可以在上面跑的很优秀,再挂点其他啥服务还是很有意思的,可玩性极高,我会持续更新有趣的项目^-^^-^

* 帖子来源Linux.do
返回