AI Agent 是如何规划和使用工具的
普通的大模型调用是”一问一答”:给提示词,返回文本。而 AI Agent(智能体)让模型从”会说”变成”会做”:围绕一个目标自主地规划步骤、调用工具、观察结果、修正行动,直到任务完成。
什么是 Agent
一个 Agent 通常由四部分组成:
- 大模型:负责理解、推理与决策的”大脑”
- 规划:把大目标拆解为可执行的步骤
- 记忆:短期记忆(当前对话上下文)与长期记忆(向量库持久化)
- 工具:搜索、代码执行、数据库查询、API 调用等外部能力
模型本身只会生成文本,工具让它的双手伸向真实世界。
核心循环:思考-行动-观察
Agent 的运行是一个循环(ReAct 范式):
- 思考(Reason):分析当前状态,决定下一步做什么
- 行动(Act):调用某个工具,带上参数
- 观察(Observe):读取工具返回结果,作为新的上下文
- 循环以上步骤,直到认为目标达成,输出最终答案
例如”帮我查北京明天天气并写进日报”:Agent 先调天气 API,观察结果,再调文档工具写入,最后汇总回复。每一步的决策都由模型根据累积上下文做出。
工具调用:Function Calling
工程上,工具以”函数签名”(名称、描述、参数 schema)注册给模型:
- 模型在回复中输出结构化的调用意图(函数名 + 参数)
- 运行时执行函数,把结果回填给模型
- 工具描述写得好不好,直接决定模型会不会用、用对用错
这与微服务里”接口文档质量决定调用方能否正确集成”是同一个道理。
规划与多智能体
复杂任务需要显式规划:
- 任务分解:先列出子任务清单(计划),再逐项执行
- 反思修正:执行失败时回顾原因、调整计划,而非盲目重试
- 多智能体:多个角色分工(规划者、执行者、审查者),类似团队协作
局限与现实
Agent 目前仍有明显边界:
- 错误会沿循环累积,一步错可能步步错
- 长循环消耗大量 token,成本与延迟都高
- 工具权限越大,误操作风险越大,需要沙箱与确认机制
因此落地时常见做法是:把 Agent 限制在流程清晰、工具受限的场景(客服工单、数据查询、代码修复),而非放任其自由发挥。Agent 的价值不在于”全自动”,而在于把人从重复的多步操作中解放出来。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 非鱼小站!
评论
WalineDisqus







