macbook m5 128G 到底怎么配置本地模型啊

cyberhunter 2026-04-20 22:37 1

我用omlx 安装qwen3.5-122b-4bit 好慢 一秒一个token 感觉不太对,有大佬知道怎么配置吗?

最新回复 (17)
  • krismile 04-20 22:45
    1

    你什么配置,还能部署122b ^-^ 我4090部署35b都感觉已经不流畅了

  • cyberhunter 楼主 04-20 22:46
    2

    最新款顶配128G啊,我看测评都是说流畅使用。。。我发现全部模型都不流畅 头疼

  • krismile 04-20 22:48
    3

    omlx



    别想了,要是那么容易部署高质量的,token何至于那么贵,而且最终用下来必须非常流畅迅速,不然上下文一多又卡,除非你把他当豆包用,没事发一句

  • krismile 04-20 22:49
    4

    你去部署一个qwen3.5的0.8B,你就知道什么叫快了

  • leioukupo 04-20 23:00
    5

    128g,部署27b肯定流畅,上下文拉满

  • cyberhunter 楼主 04-20 23:09
    6

    我怀疑是我的操作有问题,脑壳疼,都是很慢

  • 小林康娜 04-20 23:10
    7

    确实不太对,不过就这么靠掐指一算啊

    贴点参数配置什么也可,不然我只能推荐你去找个视频跟着从头做一次来排查了

  • 还是不懂 04-20 23:16
    8

    不是很对劲的佬 (前段时间升级了macos,那边好像也有metal4相关的更新),

    最开始没啥上下文的时候 高性能模式 能有 50多个/s滴


    用的是这个混合量化的,有一点大,不过改一些不复杂的代码还行


  • 啁啾 04-20 23:20
    9

    果子芯片的极限性能肯定比不过桌面级显卡的。内存大能跑得动绝大部分模型才是优势


    搜了下 M5 Max 的半精度算力是 70 TFLOPS。作为参考 4090 的半精度算力有 303 TFLOPS

  • Karmal 04-20 23:23
    10

    不量化不可能能流畅运行122B的,不要随便相信网上讲的,基本都是量化的,256g内存也差不了多少,每秒估计也就8个token,M芯片多并发倒是还挺好的

  • sarla999 04-20 23:29
    11

    可以试试ollama,或是llama.cpp,简单易用。

  • leioukupo 04-21 19:20
    12

    你怎么部署的?

    ollama?? llama.cpp??还是苹果特有的?

  • cyberhunter 楼主 04-22 00:32
    13

    我是用omlx 苹果专用的 直接用网页端测试

  • ye4wzp 04-22 00:38
    14

    ollama



    ollama 可以啊,选mlx 模型,我m1max跑 glm4.7和千问 3.5 高度可用

  • 美短银虎斑 04-22 01:36
    15

    你直接下载一个 LM studio 就都完事了

  • 泰戈 06-07 13:09
    16

    0.8b做不了数据分析吧,搞不了编程吧?

  • 泰戈 06-07 13:12
    17

    多少b,AI模型全称是什么呢?都是说能跑多么多么的快,上手就废。

* 帖子来源Linux.do
返回