测试模型为Qwen3.5-4B-MLX-4bit (3.0 GB)
测试平台为Mac mini M4
测试的时候,后台应用比较多,可能会影响输出效果


oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.5-4B-MLX-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem
pp1024/tg128 2687.7 28.81 381.0 tok/s 35.0 tok/s 6.346 181.5 tok/s 3.89 GB
pp4096/tg128 10594.5 32.25 386.6 tok/s 31.3 tok/s 14.690 287.5 tok/s 4.16 GB
Continuous Batching — Same Prompt
pp1024 / tg128 · partial prefix cache hit
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 35.0 tok/s 1.00x 381.0 tok/s 381.0 tok/s 2687.7 6.346
2x 61.3 tok/s 1.75x 376.4 tok/s 188.2 tok/s 5441.3 9.619
4x 87.3 tok/s 2.49x 370.5 tok/s 92.6 tok/s 11056.0 16.922
8x 85.2 tok/s 2.43x 368.2 tok/s 46.0 tok/s 22250.1 34.264
Continuous Batching — Different Prompts
pp1024 / tg128 · no cache reuse
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 35.0 tok/s 1.00x 381.0 tok/s 381.0 tok/s 2687.7 6.346
2x 67.3 tok/s 1.92x 365.1 tok/s 182.6 tok/s 5609.9 9.412
4x 72.2 tok/s 2.06x 361.4 tok/s 90.3 tok/s 11332.6 18.428
8x 87.9 tok/s 2.51x 361.8 tok/s 45.2 tok/s 22643.9 34.288

9B效果:
Qwen3.5-9B-MLX-4bit (5.8 GB)

oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.5-9B-MLX-4bit
================================================================================
Single Request Results
--------------------------------------------------------------------------------
Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem
pp1024/tg128 4857.8 57.01 210.8 tok/s 17.7 tok/s 12.099 95.2 tok/s 6.51 GB
pp4096/tg128 20027.3 58.91 204.5 tok/s 17.1 tok/s 27.509 153.6 tok/s 6.75 GB
Continuous Batching — Same Prompt
pp1024 / tg128 · partial prefix cache hit
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 17.7 tok/s 1.00x 210.8 tok/s 210.8 tok/s 4857.8 12.099
2x 36.3 tok/s 2.05x 201.2 tok/s 100.6 tok/s 10179.5 17.226
4x 44.3 tok/s 2.50x 197.5 tok/s 49.4 tok/s 20737.4 32.298
8x 50.2 tok/s 2.84x 197.8 tok/s 24.7 tok/s 41417.4 61.823
Continuous Batching — Different Prompts
pp1024 / tg128 · no cache reuse
--------------------------------------------------------------------------------
Batch tg TPS Speedup pp TPS pp TPS/req TTFT(ms) E2E(s)
1x 17.7 tok/s 1.00x 210.8 tok/s 210.8 tok/s 4857.8 12.099
2x 36.7 tok/s 2.07x 204.0 tok/s 102.0 tok/s 10038.1 17.014
4x 48.1 tok/s 2.72x 195.2 tok/s 48.8 tok/s 20987.0 31.640
8x 51.9 tok/s 2.93x 204.4 tok/s 25.6 tok/s 40084.0 59.816