请教下佬友们部署小模型

AhuraMazda 2026-08-16 06:18 1

像qwen3.8-27B这样的模型。如果想自己部署一份,最便宜的设备是什么。主要用途是搞一些带隐私数据的轻量级编程和一些文字数据分析。

最新回复 (13)
  • enget 08-16 06:25
    1

    最便宜的是 4090/5090 方案。但是 prefill 速度不快,长上下文的处理速度和 ttft 捉急,恐怕得找个 60g 以上显存的才会好一点。

  • Demorain 08-16 06:29
    2

    60gb以上都不是消费级显卡能载入的了感觉,不过确实没办法,要不就是走amd/苹果/nVidia spark+共享内存的路子载入模型了吧

  • 黑化喵喵 08-16 06:29
    3

    mac mini ? 24G 左右 我之前 32G 部署 3.5 27B应该是OK的 int4量化的


    还有就是那种 小计算站 英伟达出的那种 都是很小的 桌面的

  • Demorain 08-16 06:31
    4

    话说这种小模型到底能干吗?参数量这么低智商也不行,又不支持长上下文,只能做点文字或者翻译相关的,代码真能搞吗?不敢吧

  • Wag 08-16 06:31
    5

    打算等amd的192g统一内存轻薄本出来之后买一个来玩玩小模型,装个linux win双系统顺便打个游戏,还是感觉x86比arm省点心 ^-^ 就是能不能别一下子五六万那就买不起了

  • enget 08-16 06:32
    6

    你可以去看最新的跑分,都快追上 opus4.6 了。


    主要是 prefill 速度要快,我看到 5090 只有 200tps,假设输入一个 30k 的信息,光是预处理就要 150s,没办法用。

  • 黑化喵喵 08-16 06:32
    7

    我这几天 用 1.7B的小模型 用的都很有感觉 在一个 i3-6100上面跑的

  • enget 08-16 06:33
    8

    mac mini ? 24G 左右 我之前 32G 部署 3.5 27B应该是OK的 int4量化的



    不行的,你这只是能部署,你没有试过给他接入 claude code 里面,接入后你就会发现 ttft 要 3 分钟,没办法用

  • 黑化喵喵 08-16 06:35
    9

    对 那是接入 claude 因为 claude 提示词 好像就2M还是多少 首字两分钟 后面也是 卡的冒烟


    增加了 缓存以后好一点 但是 读取项目目录都不OK


    但是 干别的 都还OK的 写代码 那提示词都处理不过来

  • enget 08-16 06:36
    10

    是,配置低只能部署上 chat 一下,想拿来干正事是不可能的。所以我上面才说需要有一个 60g 的显卡。

  • 黑化喵喵 08-16 06:37
    11

    不是 首先可以 OCR 比如你有个PDF 十几页 你想提取里面的东西 就先OCR 大概30s左右吧 识别率90


    然后 拿 qwen1.7b 提取关键词 然后给关键词整理成 key value


    最后 拿Rag 还原 key和value 的对应关系


    加上代码开发 基本能完成文档 数字化的功能

  • 黑化喵喵 08-16 06:40
    12

    是 没错


    大模型 参数越多越无敌 没问题 大就是好!^-^


    但是我最近也感悟出 不同参数模型的不同应用场景^-^

  • Demorain 08-16 06:42
    13

    今天在抖音刷到了一个ubuntu小主机,说是从电车拆下来的,叫做周视视觉控制器(听下来就是摄像头算法的大脑)。
    [image]
    [image]
    32gddr5内存,128gufs,32gemmc,里面有一块NVDIA的Orin(12核 Cortex A78处理器),总CUDA算力254TOPS(RK3588才8tops!!!夸张!)好像直逼3060了,配台电脑光d5内存都多少钱了……



    要不就是搞搞歪门邪道?看看这种破解一下还可以有可玩性啊哈哈(看着好像也是共享内存的路子)

* 帖子来源Linux.do
返回