我发现个人部署本地 llm 真的很垃圾。

jony83 2026-08-21 10:55 1

本地显存 48g 4090d,llm 为 fp8 量化版 qwen36.-27b


工作流是 yt-dlp--funasr---获取文案--qwen 提取观点 ---langgraph 调用 qwen 多 agent 对话---crawl4ai 搜索补充---生成文案龙骨---qwen 分段生成。


最终文案丢给 gpt ,无论怎么调提示词或流程,基本都是说废话太多,前面提到的观点后面重复解释之类。
而且调试也费时。
最后换成在线 api ,一切解决了。


本地模型可以用来生/编辑图、生视频、背景音等,短文可以,长篇还是算了,本地 llm 注意力机制的能力就决定了不能胜任。

最新回复 (3)
  • laonger 08-21 11:22
    1
    3.6 很老了,为啥不直接用 3.8 ?
  • jony83 楼主 08-21 11:27
    2
    @laonger 2 个多月的感受。3.8 也一个样,只要传入的参数多或要求多,注意力机制能力就有可能忽略一些要求。
    就像一条流水线上并行处理能力,可能你提了 10 条要求,一条流水线过去,他只处理了 8 条,使用 8 条的结果拼装,自然满足不了你的需求。
  • laonger 08-21 12:33
    3
    感觉收到量化的影响很大
* 帖子来源V2EX
返回