本地部署AI大模型求教【35万预算配置】

daben 2026-06-20 20:51 1

公司制造业,推智能化一年多了,顺带想搞本地大模型,折腾了三四个月,硬件配置已经定了,端午后到货:


CPU:Intel Xeon Platinum 8368 38C 2.4GHz ×2

内存:DDR4 3200 64G RDIMM ×8

系统盘:480G SATA SSD ×2(RAID1)

热数据盘:3.84T U.2 NVMe SSD(直通)

冷数据盘:8T SATA HDD ×3(RAID5)

RAID卡:LSI 9560-8i 4G + 超级电容

GPU:RTX 4090 24G 双宽涡轮 ×8

网卡:双口1G RJ45 + 双口25G

电源:2000W ×4


需求还比较模糊,大方向是:员工能用上本地聊天AI,有类似阿里百炼那样的工作流/智能体/知识库平台(倾向Dify),做好权限管理,另外对OpenClaw和Hermes也比较感兴趣。预计并发也就几个到十几个人,带不动就限制使用。


现在卡在几个问题上,请教各位:




  1. 宿主机用裸机还是虚拟化?

    直接装Ubuntu/Rocky,还是上PVE之类的虚拟化,坏了能回滚?主要担心虚拟化对GPU直通和NVMe直通有没有坑。




  2. 模型怎么选?

    Qwen3.6-35B-A3B(MoE)和Qwen3.6-27B是最近看到的,但不确定名字记对没有。要不要上量化版本?或者直接DeepSeek/Kimi/GLM系列更稳?




  3. Dify的知识库怎么搞?

    听说Dify知识库挑格式,用起来麻烦。有人建议上知识图谱,是微软开源的那个GraphRAG吗?能和Dify集成吗?




  4. 权限管理怎么做?

    One API还是New API?有没有更好的方案?




随便从哪个角度聊都行,有一点思路对我帮助都很大,谢谢各位!

最新回复 (6)
  • acai 06-20 21:14
    1

    qwen3.6 27B强于35B,也可以试试量化的minimax m3、m2.7,moe模型激活参数不是很大,显存+内存足够用,deepseek、glm、kimi模型都有点大,就算能跑也比较极限了,可以测一下,能不能满足并发的速度,每秒小于10token就几乎没法用了。dify的设计与生态都不错,有团队的工作空间,可以共享知识库、工作流等。自己能将必要的部分做好备份就行,没必要pve,又不是多人开小鸡用,也没有多机故障转移等,就是一个尽可能跑满gpu的本地模型与一套智能体框架,除了能跑大一点的模型,与普通机器搭智能体框架没什么区别。

  • xiedian 06-20 21:16
    2

    这个配置可以尝试大参数模型的量化版,qwen27和35b就没必要上了

  • MeverikC 06-20 21:17
    3

    本地的话建议用 litellm ,权限 用量 等都是带的

  • dalamud 06-20 21:18
    4

    装debian/ubuntu,然后dify、模型这些全都跑容器里,有raid的情况下,需要备份的数据情况不多

  • ZYist 06-20 21:31
    5

    佬咨询一下,这个 27B 强于 35B 是在帖主这种特定环境下吗?还是说真的前者性能强于后者?

  • sborne 06-20 21:35
    6

    35万预算上qwen35ba3b?那玩意我5070ti也能跑啊,这么多预算别考虑moe了,跑长任务链蠢得跟猪一样,能上稠密尽量上稠密

* 帖子来源Linux.do
返回