用aimax395部署qwen 3.8 flash next并达到50toks/s( Halogen flash server )
好久没有逛linuxdo了,想水文绞尽脑汁想不出,遂写点没有技术含量的 ps.纯手写无ai,放心食用
准备工作
- 一台Ubuntu(推荐)系统下的aimax395机器,安装podman
- 一个会动的脑子
- 一双会动的手(
提醒
请首先在bios中将显存分配调到最小(我的是512mb)
对!没错!是最小!
教程
Step 1 安装ROCm
sudo apt install libatomic1 libquadmath0
sudo usermod -a -G render,video $LOGNAME
# Download and install GPG key
sudo mkdir --parents --mode=0755 /etc/apt/keyrings
# ROCm release signing key
wget https://stable.repo.amd.com/rocm/gpg/packages.gpg -O - | \
gpg --dearmor | sudo tee /etc/apt/keyrings/amdrocm.gpg > /dev/null
sudo tee /etc/apt/sources.list.d/amdrocm-stable.sources << EOF
X-Repo-Id: amdrocm-stable
Types: deb
URIs: https://stable.repo.amd.com/rocm/core/packages/ubuntu2604/
Suites: stable
Components: main
Architectures: amd64
Signed-By: /etc/apt/keyrings/amdrocm.gpg
Enabled: yes
EOF
sudo apt update
sudo apt install amdrocm-core-sdk10.0-gfx1151
ROCm官方页面
Step 2 通过modelscope获取模型
通过你喜欢的方式下载模型并放到一个你想放的目录
Step 3 跑起来!
podman run --rm \
-p 8731:8731 \
--device /dev/kfd \
--device /dev/dri \
--group-add keep-groups \
--ipc=host \
--ulimit memlock=-1:-1 \
-e HALOGEN_CHECKPOINT=/models/qwen38-flash-next-v2.hgn \
-e HALOGEN_MODEL_ID=Qwen/Qwen3.8-Flash-Next \
-e HALOGEN_VISION_TOWER=1 \
-e HALOGEN_TEMPERATURE=0.6 \
-e HALOGEN_TOP_P=0.95 \
-e HALOGEN_TOP_K=20 \
-e HALOGEN_ROPE_YARN=4 \
-e HALOGEN_REASONING_EFFORT=medium \
-v /path/to/your/models:/models \
ghcr.io/peonist-ai/halogen-flash-server:0.15.1
模型相关参数如HALOGEN_TEMPERATURE等可以自己调,将***/path/to/your/models***改为你的模型所在目录,然后就可以用了, api地址是http://xxx.xxx.xxx.xxx:8731
演示(使用oh my pi,medium强度,耗时25分钟)
prompt:生成一个赛车游戏
https://telegraph-image-92x.pages.dev/file/5165ec32716acc1b8878e-f42bce2b53bcf728a0.gif(图片大于 4 MB)