Mac mini oMLX 部署本地大模型测试,并发提速最高可达2.93倍,Qwen3.5-4B-MLX-4bit 输出可达 87.9 tok/s

Mozi 2026-03-10 18:04 1

测试模型为Qwen3.5-4B-MLX-4bit (3.0 GB)

测试平台为Mac mini M4

测试的时候,后台应用比较多,可能会影响输出效果





oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.5-4B-MLX-4bit
================================================================================

Single Request Results
--------------------------------------------------------------------------------
Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem
pp1024/tg128 2687.7 28.81 381.0 tok/s 35.0 tok/s 6.346 181.5 tok/s 3.89 GB
pp4096/tg128 10594.5 32.25 386.6 tok/s 31.3 tok/s 14.690 287.5 tok/s 4.16 GB

Continuous Batching — Same Prompt
pp1024 / tg128 · partial prefix cache hit
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 35.0 tok/s 1.00x 381.0 tok/s 381.0 tok/s 2687.7 6.346
2x 61.3 tok/s 1.75x 376.4 tok/s 188.2 tok/s 5441.3 9.619
4x 87.3 tok/s 2.49x 370.5 tok/s 92.6 tok/s 11056.0 16.922
8x 85.2 tok/s 2.43x 368.2 tok/s 46.0 tok/s 22250.1 34.264

Continuous Batching — Different Prompts
pp1024 / tg128 · no cache reuse
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 35.0 tok/s 1.00x 381.0 tok/s 381.0 tok/s 2687.7 6.346
2x 67.3 tok/s 1.92x 365.1 tok/s 182.6 tok/s 5609.9 9.412
4x 72.2 tok/s 2.06x 361.4 tok/s 90.3 tok/s 11332.6 18.428
8x 87.9 tok/s 2.51x 361.8 tok/s 45.2 tok/s 22643.9 34.288




9B效果:

Qwen3.5-9B-MLX-4bit (5.8 GB)



oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.5-9B-MLX-4bit
================================================================================

Single Request Results
--------------------------------------------------------------------------------
Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem
pp1024/tg128 4857.8 57.01 210.8 tok/s 17.7 tok/s 12.099 95.2 tok/s 6.51 GB
pp4096/tg128 20027.3 58.91 204.5 tok/s 17.1 tok/s 27.509 153.6 tok/s 6.75 GB

Continuous Batching — Same Prompt
pp1024 / tg128 · partial prefix cache hit
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 17.7 tok/s 1.00x 210.8 tok/s 210.8 tok/s 4857.8 12.099
2x 36.3 tok/s 2.05x 201.2 tok/s 100.6 tok/s 10179.5 17.226
4x 44.3 tok/s 2.50x 197.5 tok/s 49.4 tok/s 20737.4 32.298
8x 50.2 tok/s 2.84x 197.8 tok/s 24.7 tok/s 41417.4 61.823

Continuous Batching — Different Prompts
pp1024 / tg128 · no cache reuse
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 17.7 tok/s 1.00x 210.8 tok/s 210.8 tok/s 4857.8 12.099
2x 36.7 tok/s 2.07x 204.0 tok/s 102.0 tok/s 10038.1 17.014
4x 48.1 tok/s 2.72x 195.2 tok/s 48.8 tok/s 20987.0 31.640
8x 51.9 tok/s 2.93x 204.4 tok/s 25.6 tok/s 40084.0 59.816
最新回复 (19)
  • 爱吃蔬菜小熊猫 03-10 18:06
    1

    M4这么强的嘛,本地跑9B的这个我还找了个20G显存的显卡才跑起来的

  • Rice R. Rug 03-10 18:06
    2

    感谢分享

  • wren 03-10 18:10
    3

    oMLX 新的工具吗

  • Mozi 楼主 03-10 18:11
    4

    感觉像 SGLang 吧

  • Mozi 楼主 03-10 18:16
    5

    八比特才需要20G显存吧

  • Cynthia L. Roe 03-10 18:28
    6

    9b q4量化我3050ti 8g都能跑啊,不过只有12tps

  • Cynthia L. Roe 03-10 18:28
    7

    真快啊,3050ti开各种优化也只有38tps

  • Mozi 楼主 03-10 18:32
    8


    9B 8并发最高是这个速度

  • lhlhlh111000 03-10 18:33
    9

    早上看只有两三百星,现在再看直接破2k星了,传播好快~

  • 爱吃蔬菜小熊猫 03-10 18:45
    10

    对,我跑的Q8的

  • zhenshen 03-10 18:50
    11

    我32G内存,可以跑27b的,但是你们记得关闭思考模式,要不然很慢,小模型的思考很长

  • mgy 03-10 19:11
    12

    ^-^昨天才100多,今天已经2k了

  • Mozi 楼主 03-10 19:29
    13

    0.8B 的模型 400 多 token/s,简直就是翻译神器


  • xdeek 03-10 20:32
    14



    oMLX - LLM inference, optimized for your Mac

    GitHub - jundot/omlx: LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar · GitHub

    Benchmark Model: Qwen3.5-9B-MLX-4bit


    Single Request Results


    Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem

    pp1024/tg128 4580.0 47.30 223.6 tok/s 21.3 tok/s 10.588 108.8 tok/s 6.51 GB

    pp4096/tg128 18243.1 51.80 224.5 tok/s 19.5 tok/s 24.821 170.2 tok/s 6.75 GB


    Continuous Batching — Same Prompt

    pp1024 + image tokens / tg128 · partial prefix cache hit


    Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)

    1x 21.3 tok/s 1.00x 223.6 tok/s 223.6 tok/s 4580.0 10.588

    2x 40.7 tok/s 1.91x 180.2 tok/s 90.1 tok/s 16771.4 23.061

    4x 52.8 tok/s 2.48x 479.8 tok/s 120.0 tok/s 12596.0 22.291


    Continuous Batching — Different Prompts

    pp1024 + image tokens / tg128 · no cache reuse


    Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)

    1x 21.3 tok/s 1.00x 223.6 tok/s 223.6 tok/s 4580.0 10.588

    2x 40.3 tok/s 1.89x 197.4 tok/s 98.7 tok/s 15312.7 21.670

    4x 45.7 tok/s 2.15x 271.1 tok/s 67.8 tok/s 15122.2 33.484

  • wren 03-10 23:13
    15

    哦 这个和llama.cpp 哪个好些呢?

  • 还是不懂 03-10 23:19
    16

    期待在 m5 max上的表现了,毕竟又加了 matmul 矩阵加速

  • ⚡️我钢铁侠🔋 03-11 16:53
    17

    Qwen-3.5默认不能关思维链,用来翻译我感觉不太方便,除非中转处理一道

  • Mozi 楼主 03-11 16:54
    18

    ??可以关闭的,lmstudio 和 omlx 都支持关闭

  • ⚡️我钢铁侠🔋 03-11 17:00
    19

    LM Studio在哪里关闭?我只看到有关闭推理过程解析方式的 ^-^

* 帖子来源Linux.do
返回