请教, 如何相对可靠地约束 Agent/LLM 处理或者输出内容时"不丢语义+文字最少"?

seven777 2026-08-17 18:51 1

当前状态, Agent/LLM 输出的内容都偏累赘,尤其是非代码类内容输出,它总是尝试解释更多.
是否有可靠的方法约束 Agent/LLM 尽可能做到"不丢语义+文字最少+最短篇幅"?
就非代码内容来说:



  1. 最短篇幅, 可以强制要求输出内容优先以表格形式,大概就是当前最的文字组织方式了.

  2. 不丢语义+最少文字, 好像是有上限的, Agent/LLM 能把 1000 字的水文压到 100 字,然后就不太愿意再精简了.


关于代码:



  1. 我觉得代码的水平进步太多太明显了, 得益于 Agent/LLM 本身的能力增强,也得益于"lint + format"工具.

  2. 目标明确 + "lint + format"工具配置得当, 代码基本靠谱.

  3. 我个人感觉目前 Agent/LLM 真的弱的地方是"高阶能力", 比如架构 + 长期规划.比如我从事的企业服务领域, 如何接入 Agent/LLM 能力,如何控制安全,如何分配控制和配合权限,如何做更少但更准确的事,如何权衡理性和感性,如何顺应又激活人的本性和活力.这些内容它都能说出些内容,但似乎都泛泛而谈,远不如代码能力那么的实在和真实.

最新回复 (13)
  • chnwine 08-17 18:57
    1
    恭喜你进入了禅道, 体验下 Grok Bot 看看跟你想的有一点贴近不?
  • seven777 楼主 08-17 19:25
    2
    @chnwine #1 我立刻去看了,没有尝试.原因如下:
    1. 看介绍,"拥有自己电脑的云端 AI 助手",无非就是 AI 应用的另一种方式, 与我请教的"文本压缩"的主题偏离.
    2. 中短期看来, Agent/LLM 是分国界的, 我不太想舍近求远拥抱 Grok 了, 无论是付费模式,价格,都不友好.
    3. 尝鲜的欲望很低.(虽然我算是早期 Grok 的试用者+粉丝, Grok v1-v2 是比当时的任何模型都拥有更强的"逻辑推理能力"的)
  • yonlin 08-17 19:29
    3
    请使用文言文回复
  • seven777 楼主 08-17 19:32
    4
    @yonlin #3 我没找到类似的 skill , 真的在找.
    另外一个话题, 文言文在大模型语料里有比重吗? 文言文对 Agent/LLM 不友好是很明显的.
  • ovtfkw 08-17 19:35
    5
    @seven777 原因说这么多 其实就一个
  • seven777 楼主 08-17 19:39
    6
    @ovtfkw #5 你觉得是啥?
  • itfarmer 08-17 20:19
    7
    https://caveman.so/
    https://ponytail.dev/
    仅供参考
  • yonlin 08-17 21:13
    8
    @seven777 看来你很认真。推荐一本书《 Cloude Code 实战:Harness 工程之道》,作者:黄佳,你的问题书中都有答案。微信阅读推荐值:89.2%
  • seven777 楼主 08-17 22:56
    9
    @itfarmer #7 这俩库我仔细看了,非常感谢.原来还真的有人孜孜不倦在做这些努力.
    虽然我知道它本质是"提示词工程",但这俩库真的帮助到了我改善我自己的"规则体系".
    非常感谢.

    @yonlin #8
    在大模型日新月异的今天,这一类"xxx 实战"的书都是短期商业行为,没有学术意义.
    非常感谢您.
  • yonlin 08-18 10:39
    10
    @seven777 不知道哪来的实力傲慢,你的水平比作者还高?真有水平的话为什么还问那些早就有答案的问题?
  • seven777 楼主 08-18 10:54
    11
    @yonlin #10
    你批评的对.
    但是你为什么认为我的态度是傲慢呢?
    1. 这个书我花了 10 分钟左右的时间浏览了网络上的在线版本,可能有误差或内容差异,但我想不会偏差太大.
    2. 这本书里讲的概念没有一个我是陌生的,都是近 1 年内常听常看的概念.(虽然每个概念我都是浅尝辄止)
    3. 这本书里讲的重点,有一半现在继续是正确的方向和做法,有一半已经逐渐式微.
    我决定买这本书看一遍.
  • seven777 楼主 08-18 11:13
    12
    最近让我对 AI 原理产生更大敬畏和更大兴趣的是"阿里的 ROME 事件"资料,前期没去深入了解这件事.
    我读了很多相关的内容, 那里确实有些新的内容.
    关于 harness , 我自己的体会和判断是它依然是短期工具, 我对"马具插件"的理解有这些:
    1. 不管是企业用户还是个人用户, 目前使用 AI 能力的还是"个人", 个人就有喜好, 插件多了一定会产生选择难题.
    2. 插件的质量是参差不齐的, 文不对题的插件很多.
    3. 重复插件太多太多(不是我瞎猜的,我使用的某个环境,我甚至把插件都卸载了,甚至把记忆,本地记忆都关了).
    4. 插件的使用效果有差异, 讲究与 LLM 配合, 微调甚至讲究"变量和方法的命名"都会对插件的功效产生影响(类似 MCP 里的变量和方法的命名,对使用效果产生了明显的影响.)
    5. harness 是个泛称, 形态各种各样, 甚至国内很多工具不叫 harness 但实际使用中遵循是相同的思想, 本质上还是约束/影响(谈不上控制,控制大模型是模型厂家的事)大模型的行为.

    对于企业应用 AI, 我的判断是, 只要使用 AI 的还是"个人", 大模型在普通企业都是小打小闹, 等到 AI 可以"可控+自主"干活的时候, 企业应用才会爆发.
  • seven777 楼主 08-18 11:47
    13
    @yonlin #8
    我微信读书买了这本书,我坚持我的观点,它是商业行为,没有学术意义.
    我个人不推荐.
    1. 它不能作为工具书, 所有此类 IT 类的"xxx 实战"都会随着技术发展而过时,甚至会误导后来读者.
    2. 它的写作风格(至少不适合我),我现在不会去看具体的代码和细节到某个变量的内容.这本书的页数靠这个凑起来的.
    3. 这本书关于<安全防护>的内容已经严重缺失和滞后了, 这一块的工程实践真的是日新月异.

    不管怎样,感谢您帮助我,真心感谢.
    网络上,包括 V2EX 里, 我也有看不惯的人和行为, 没必要一定要骂一句,批评一句.
    损耗的是自己的元气.
    祝您快乐.
* 帖子来源V2EX
返回