【Agent 原理解析】明明只会“吐字”,AI拿什么帮你干活?

Nick Hugo 2026-08-31 00:00 1


「 现在的 AI,和两年前的 ChatGPT 到底有什么区别?」

「 不止步于聊天,现在的 AI 还能帮你完成各种任务。」

「 一切的改变发生在 —— AI 拿起工具的那一刻。」

「 就像工具的使用是人类文明开始的标志,AI 对工具的使用也拉开了 Agent 时代的序幕」



一、前言


如果说 2022 年 ChatGPT 的发布标志着 AI 元年的开启,2026 年无疑是从 AI 转向 Agent 的关键一年。


从年初爆火的 OpenClaw 再到现在各个厂商推出的 Agent 产品(比如 腾讯力推的 Workbuddy


一切表明着 AI 正在从聊天工具转变为真正的 生产力工具


自 AI 诞生开始转变便开始发生,对于工具使用的技术脉络的发展经过了若干个关键时期:


Function Calling(2023)→ Computer Use(2024)→ MCP(2025.03)→ Skills(2025.09)→ Agent 规模化落地(2026)


尽管概念层出不穷,不过本文的目的在于让你跳过技术细节,直接了解 Agent 最核心的概念



如何让 AI 使用工具 & 怎么更好的使用工具





本文大概 2500字 阅读完毕约15min 科普向 欢迎捉虫





二、从“会想”走向“会做”


想法不会自己落地,AI 即使再聪明,也需要一套能够获取信息、执行任务并反馈结果的外部能力。为了更好的了解Tool 跟 AI的关系:


故事从一家“公司”开始


假设你是一名天使投资人,手里有资金、资源和一个美好的愿景:



我要创办一家能够改变行业的公司。



但是你只有美妙的构想,所以你还需要一个能够理解目标、制定战略并协调资源的 CEO —— AI


AI 可以分析市场、设计商业模式、拆解阶段目标,甚至给出一份非常完整的创业计划。但问题在于,一家只有董事长&CEO、没有任何部门和员工的公司,是无法真正运转的


它还需要市场部门调查用户需求,需要研发部门开发产品,需要财务部门核算成本,需要销售部门联系客户,也需要法务、行政、客服等角色处理具体事务


这些能够被 AI 调用的职能部门,就是 Tools, 因此:


你 → AI → 工具(Tools)
就像
投资人 → 职业经理人 CEO → 各个职能部门与业务系统


你负责规划愿景蓝图, AI 负责将蓝图转化为实际可执行的计划, Tools 负责落实并获得反馈。缺少 Tools 所有的计划便是空中楼阁。


根据需求不同,可以设计对应的 Tools 以解决特定需求,基本所有 AI 底层内置了几种基础工具,举个例子:

































工具 对应部门 主要作用
Read / Write 信息与档案 读取已有资料,记录和更新工作成果,让 AI 既能了解现状,也能积累经验。
Search 市场与情报 获取外部世界的最新信息,避免 AI 只依赖已有知识闭门造车。
Code / Shell 研发与生产 编写程序、运行命令、处理数据,把方案转化为能够实际运行的结果。
Email / Calendar 沟通与协作 连接团队成员,同步信息、协调日程并推动任务流转,让 AI 能够参与真实的多人协作。

Not Only 执行


除了执行Tools 更关键的是它可以为决策提供更多有效的信息,例如可以返回执行的结果,实时调整后续计划实现闭环控制。


市场调研工具会返回用户反馈,财务工具会返回成本变化,销售系统会返回成交情况,研发工具也可能告诉 AI:“这个方案暂时无法实现。”


AI 根据这些结果重新判断



  • 产品方向是否需要调整?

  • 预算是否需要重新分配?

  • 原来的计划是否还值得继续?

  • 下一步应该调用哪个部门?


于是,一个完整的工作闭环便形成了:



提出目标 → 制定计划 → 调用工具 → 获得结果 → 调整决策 → 继续执行





三、"吐字"是一切的开始


Tools 的重要性不言而喻,那么 AI 是怎么调用工具的呢?


其实很多看起来复杂的技术,底层原理往往出奇地简单


从“工业革命” 到 “人工智能”


自第一次工业革命 ,人类本质上只干了一件事 —— 烧开水



  • 烧开水 + 活塞 + 连杆 = 蒸汽机;

  • 烧开水 + 汽轮机 + 切割磁场 = 发电机

  • 烧开水 + 原子能 = 核能发电


AI 也是如此。


无论它看起来多么聪明,语言模型最基础的能力始终只有一个 —— 吐字


根据历史信息,继续生成下一个字(Token)。


它不会真正点击鼠标,不会自己打开文件,也不会直接发送邮件。我们看到的各种能力,本质上都是围绕“吐字”进行的工程化扩展



吐字 + 自然语言 = 与人对话

吐字 + 固定格式 = 结构化输出

吐字 + API 接口 = 调用外部服务

吐字 + 命令解释器 = 运行代码和操作系统

吐字 + 工具反馈 + 循环决策 = Agent



其中,工具调用的原理尤其简单:



吐字 + 约定格式 + 外部执行器 = Tool Calling






举个栗子


如果我想知道今天天气,那么AI怎么调用工具实现?


我们先想想,人会怎么解决这个问题:



1. 打开百度或天气软件
2. 输入“北京今天天气”
3. 查看搜索结果
4. 整理出温度、天气和风力等信息
5. 回答问题


把这些具体动作进一步抽象,其实就是:



选择工具 → 输入参数 → 执行工具 → 获取结果 → 组织回答


AI 调用工具时,走的也是类似的流程。


首先,系统需要提前告诉 AI 这里有一个天气查询工具:


{
"name": "get_weather",
"description": "查询指定城市的天气信息",
"parameters": {
"city": "需要查询的城市",
"date": "需要查询的日期"
}
}

这相当于告诉 AI:



需要查询天气时,请提供城市和日期。



当 AI 收到“北京今天的天气怎么样”这个问题后,它会判断需要调用 get_weather这个工具。


随后,AI 会“吐出”一段符合约定格式的文字:


{
"name": "get_weather",
"parameters": {
"city": "北京",
"date": "今天"
}
}

注意,这时 AI 依然只是在 生成文字,它本身并 没有真的查询天气


由于我们采用了特殊的格式,因此外部程序读取这段文字后,会识别出:


调用工具:get_weather
查询城市:北京
查询日期:今天

然后,外部程序真正访问天气服务,并将 查询结果返回给 AI 。假设返回:


{
"city": "北京",
"temperature": "28℃",
"condition": "多云",
"wind": "3级"
}

AI 再根据这些信息 生成最终回答



北京今天多云,气温约为 28℃,风力 3 级。



整个过程可以概括为:



用户提出问题

AI 判断需要查询实时天气

AI 生成工具名称和参数

外部程序执行天气查询

查询结果返回给 AI

AI 整理结果并回答用户


所以,AI 调用工具和人使用工具并没有本质区别:
































人使用工具 AI 调用工具
判断应该使用天气软件 判断应该调用 get_weather
在搜索框输入“北京今天天气” 生成城市和日期参数
点击搜索 外部程序执行调用
阅读天气信息 接收工具返回结果
用语言告诉别人 生成最终回答

区别只在于:



人通过点击、输入和阅读来操作工具;AI 则通过 生成约定格式的文字 来表达自己想调用哪个工具、传入什么参数。






这里是Nick Hugo 一枚计算机相关专业在读博士,前段时间出去见了见市面,断更了很久,感觉又有很多想做的东西跟想法了,希望以后能跟佬友们多多分享~

最新回复 (2)
  • 胡九九 08-31 00:24
    1

    一直有个疑问,比如网页的 ai 为啥无法使用工具,难道不是只要是 llm 就可以使用工具嘛?非常不理解

  • koubibulaien 08-31 00:31
    2

    agent提供工具的底座叫做harness。传统的则是直接的tool calling。部分网页端的模型只有最基本的吐字能力,厂商没有给他提供tool。但是部分厂商会配的有搜索工具,绘图工具之类的方便用户使用

* 帖子来源Linux.do
返回