AI Agent(智能体)
由模型围绕目标动态选择步骤和工具,并依据环境反馈持续行动直至完成、停止或交还人类的系统。
AI Agent 不是一个孤立的大语言模型,也不只是“带系统提示词的聊天机器人”。它是一套运行时系统:模型在给定目标、上下文、工具和约束后,决定下一步动作,观察动作结果,更新状态,再决定继续、结束或请求人类输入。
一个实用定义应同时满足两点:
- LLM 参与控制 workflow 的执行,而不只是生成某一步文本。
- 系统能够通过工具读取环境或改变环境,并根据结果调整后续行为。
因此,单轮问答、固定情感分类和完全写死的自动化流水线通常不属于 Agent;它们可以是 Agent 使用的组件。
传统软件擅长规则明确、输入结构化、路径可穷举的任务。Agent 的价值主要出现在:
- 任务包含大量自然语言、文档、网页或代码等非结构化信息。
- 需要根据中间结果动态决定下一步,无法提前写出所有分支。
- 规则数量巨大、例外频繁,维护成本高。
- 环境能提供可验证反馈,例如测试结果、API 响应、检索证据或业务状态。
- 失败可以停止、回滚或交还人类,不会直接造成不可接受损失。
Agent 不是“更高级的自动化”同义词。它用灵活性换取更高延迟、成本、测试难度和错误累积风险。
- Goal:接收用户目标,并澄清成功标准与权限边界。
- Context:读取当前消息、历史、状态、检索证据和环境信息。
- Decide:模型决定回答、调用工具、修改计划、暂停或结束。
- Act:运行工具、API、代码或其他受控动作。
- Observe:将结构化结果、错误和真实环境变化返回系统。
- Update:更新短期状态、计划或需要保留的记忆。
- Stop or continue:检查完成条件、最大步数、风险阈值和人工检查点。
六个工程组件
Section titled “六个工程组件”- Model:做语义判断、规划和工具选择。
- Instructions / harness:定义目标、角色、策略、停止条件和 guardrails。
- Tools:提供数据读取、外部动作或委派能力。
- State / memory:保存当前运行所需状态和跨运行长期信息。
- Environment:文件系统、浏览器、数据库、业务系统或模拟世界。
- Evaluation / oversight:trace、自动检查、权限控制和 human-in-the-loop。
自治程度是连续谱
Section titled “自治程度是连续谱”Agent 不只有“全自动”和“非 Agent”两档:
- 建议型:模型提出下一步,人类执行。
- 审批型:模型准备动作,高风险步骤必须批准。
- 受限自治:在 sandbox、只读工具或固定预算内自行循环。
- 高自治:长时间跨系统执行,仅在异常时请求人类。
合适的自治程度取决于可逆性、权限、可验证性和错误成本,而不是模型能力越强就越应放权。
传统 AI 中的 Agent 已包含感知、策略、动作和环境。强化学习 Agent 通过状态、动作与奖励学习策略。LLM 出现后,自然语言模型开始承担通用控制器角色:ReAct 把推理与动作交替,function calling 让工具调用结构化,框架进一步封装状态、循环和编排。
早期 AutoGPT 类原型强调长链自治,但可靠性有限。随后工程实践转向较短循环、清晰工具、显式状态、可观测性、评估、sandbox 和人工检查点。当前趋势不是单纯追求更多自治,而是为任务选择合适的 control–agency 平衡。
“用了 LLM 就是 Agent”
Section titled ““用了 LLM 就是 Agent””如果 LLM 只在固定流程中生成一段文本,它仍是普通 LLM 应用。
“用了工具就是 Agent”
Section titled ““用了工具就是 Agent””固定调用一个检索函数可能只是 workflow。Agent 的关键是模型能依据状态动态决定动作和后续路径。
“多 Agent 一定比单 Agent 强”
Section titled ““多 Agent 一定比单 Agent 强””多 Agent 会增加通信、状态同步、失败定位和评估成本。单 Agent 配合清晰工具通常是默认起点。
“Memory 就是把所有历史存进向量库”
Section titled ““Memory 就是把所有历史存进向量库””有效记忆需要写入、检索、压缩、更新、遗忘和来源策略。无选择地累积历史会造成污染和上下文冲突。
“模型会自己知道什么时候停”
Section titled ““模型会自己知道什么时候停””生产系统必须定义成功条件、最大步数、超时、预算、错误阈值和人工升级路径。
“Guardrail 能替代权限控制”
Section titled ““Guardrail 能替代权限控制””提示词或分类器不是安全边界。敏感动作仍需最小权限、身份认证、授权、sandbox、审计和人工确认。
与相邻概念的区别
Section titled “与相邻概念的区别”| 概念 | 控制路径 | 是否动态用工具 | 典型用途 |
|---|---|---|---|
| Chatbot | 单轮或对话响应 | 可选 | 问答、生成文本 |
| Deterministic automation | 代码预定义 | 固定 | 稳定重复流程 |
| Agentic Workflow(智能体工作流) | 代码主导,局部使用模型 | 可动态但边界明确 | 可预测的多步任务 |
| AI Agent | 模型依据状态动态控制 | 是 | 开放、多步骤、需适应环境的任务 |
| Multi-Agent system | 多个 Agent 协作或 handoff | 是 | 真实存在专业边界或并行需求的复杂任务 |
RAG 是为模型提供外部证据的方法;它可以是普通问答链的一部分,也可以被 Agent 反复调用。MCP 是连接工具和数据源的协议;它不自动提供规划、可靠性或权限设计。