← 返回博客列表

AI Agent 是什么:从概念到落地的完整指南

2025 年底开始,“AI Agent”成了技术圈出现频率最高的词之一。但如果你去问十个人”AI Agent 到底是什么”,大概率会得到十个不同的答案。有人说它是更高级的 Chatbot,有人说它是能自己写代码的 AI,还有人觉得它就是 AutoGPT 那样的自动化脚本。

这些理解都不算错,但都不完整。这篇文章试图给你一个从概念到落地的完整认知框架——AI Agent 的本质是什么、它由哪些能力构成、有哪些设计模式、以及你该怎么选择技术方案。

Agent 不是 Chatbot

先厘清一个最常见的误解。Chatbot 和 Agent 的核心区别不在于”聪不聪明”,而在于控制权在谁手里

Chatbot:用户提问 → 模型回答(单轮/多轮对话)
         控制权始终在用户手中,每一步都需要用户驱动

AI Agent:用户设定目标 → 规划 → 使用工具 → 执行 → 验证 → 反馈
          控制权交给 Agent,它自主决定下一步做什么

举个例子:你对 ChatGPT 说”帮我分析上个月的销售数据”,它会告诉你分析方法,但不会真的去拿数据。而一个 Agent 会自己连接数据库、执行 SQL 查询、生成图表、写出分析报告——你只需要提出目标,剩下的它来搞定。

用一句话概括:Chatbot 是问答机器,Agent 是任务执行者。

Agent 的四大核心能力

一个完整的 AI Agent 系统由四个能力模块构成,缺一不可:

┌─────────────────────────────────────┐
│            AI Agent                  │
├──────────┬──────────┬───────────────┤
│  感知     │  决策     │  执行         │
│Perception│Reasoning │ Action        │
├──────────┼──────────┼───────────────┤
│ 用户输入  │ 任务分解  │ 工具调用       │
│ 环境状态  │ 规划推理  │ API 请求       │
│ 工具反馈  │ 工具选择  │ 代码执行       │
│ 记忆检索  │ 反思纠错  │ 文件操作       │
└──────────┴──────────┴───────────────┘
         ↕ 记忆系统(Memory)↕
  • 感知(Perception):Agent 接收信息的能力。不只是用户的文字输入,还包括工具返回的结果、环境状态变化、从记忆中检索到的历史信息
  • 决策(Reasoning):Agent 的”大脑”。基于 LLM 的推理能力,完成任务分解、规划路径、选择工具、判断何时需要人工介入
  • 执行(Action):Agent 的”手脚”。通过 Function Calling 调用外部工具、API、数据库,在真实世界中产生效果
  • 记忆(Memory):Agent 的”经验”。短期记忆维护当前对话上下文,长期记忆积累跨会话的经验和知识

这四个能力的基座是增强型 LLM(Augmented LLM)——不是裸模型,而是 LLM + 检索(RAG)+ 工具(Tools)+ 记忆(Memory)的组合体。所有 Agent 框架的底层都是在这个基座上构建的。

Agent 的三种范式

从简单到复杂,Agent 的执行范式可以分为三层:

1. ReAct:推理 + 行动交替

最经典的 Agent 范式。LLM 交替进行推理(Thought)和行动(Action),观察结果后继续,直到任务完成:

Thought: 用户要查订单,我需要调用订单查询 API
Action:  query_orders(user_id="123")
Observation: [返回 3 个订单...]
Thought: 找到了,最近一个订单是 4 月 20 日的
Answer:  您最近的订单是 4 月 20 日下单的...

ReAct 的优势是简单直观,LangGraph 的 create_react_agent 一行代码就能创建。但它的问题是没有全局规划——Agent 走一步看一步,遇到复杂任务容易跑偏。

2. Plan-and-Execute:先规划再执行

先让 LLM 制定完整计划,再逐步执行,执行过程中可以根据结果修订计划:

1. 制定计划(将复杂任务分解为子任务列表)
2. 逐步执行每个子任务
3. 根据执行结果调整计划
4. 汇总结果

适合多步骤、有依赖关系的复杂任务。代价是多了一次”规划”的 LLM 调用,但换来了更高的任务完成率。

3. 多 Agent 协作:专业分工

把一个复杂任务拆给多个专业 Agent,每个 Agent 扮演特定角色,协作完成。这是当前最热门的方向,CrewAI 和 LangGraph 都在这个领域深耕。

六种 Agentic 设计模式

Anthropic 在 “Building Effective Agents” 指南中,将 Agentic 系统分为 **Workflow(预定义流程)**和 **Agent(自主决策)**两大类,并总结了六种核心设计模式:

  1. Prompt Chaining(提示链):顺序调用 LLM,前一步输出作为后一步输入。最简单,适合线性流程
  2. Routing(路由分发):对输入分类,路由到不同的专业处理器。适合多类型请求的统一入口
  3. Parallelization(并行化):将任务拆分为独立子任务并行处理,或多次生成后投票取最优。适合可并行的场景
  4. Orchestrator-Workers(编排-工作者):中央编排 LLM 动态分解任务,委派给工作者执行。适合任务结构不确定的场景
  5. Evaluator-Optimizer(评估-优化):一个 LLM 生成,另一个评估,循环迭代直到满足标准。适合需要高质量输出的场景
  6. Autonomous Agent(自主 Agent):ReAct 循环,Agent 自主决定使用工具直到完成任务。灵活性最高,但最难控制

Anthropic 的核心建议是:**从简单开始,仅在必要时增加复杂度。**能用 Prompt Chaining 解决的问题,不要上多 Agent。

选择设计模式的决策路径:需求明确、流程固定?→ Workflow。需要动态决策?→ Agent。不确定?→ 从最简单的 Prompt Chaining 开始。

三条架构路径:你的 Agent 该有多”自主”

2026 年 4 月的一篇论文 “The Cartesian Cut in Agentic AI” 从认知科学视角提出了 Agent 架构的三条设计路径,核心问题是:控制权应该放在哪里?

Agent 架构的三条路径(自主性递增):

Bounded Services        Cartesian Agents       Integrated Agents
(有界服务)             (笛卡尔 Agent)        (集成 Agent)

LLM 输出受严格约束       LLM 与运行时通过         LLM 与运行时深度融合
运行时完全控制执行流      符号接口耦合             控制状态内化

自主性:低               自主性:中              自主性:高
鲁棒性:高               鲁棒性:中              鲁棒性:低
可监督:容易             可监督:中等             可监督:困难

典型:RAG 管道           典型:LangGraph          典型:端到端 RL Agent
     结构化输出 API            CrewAI                  未来方向
                              OpenAI SDK

当前主流 Agent 框架几乎都属于中间的 Cartesian Agents 路径——通过工具调用、状态管理等符号接口将 LLM 和运行时连接起来。这带来了模块化和可审计性(你可以检查每一步工具调用),但也引入了接口瓶颈(所有信息必须通过文本序列化传递)。

对于大多数生产场景,Cartesian Agents 是当前最务实的选择。Bounded Services 适合高可靠性要求的场景(如金融合规),Integrated Agents 目前还停留在研究阶段。

Agent 技术栈全景

2026 年的 Agent 生态已经相当成熟,从协议到框架到基础设施形成了完整的技术栈:

  • 协议层:MCP(工具连接标准)、A2A(Agent 间通信)、ACP(轻量级消息协议)
  • 框架层:LangGraph(图结构工作流)、CrewAI(角色化多 Agent)、OpenAI Agents SDK(Swarm 模式)
  • 能力层:RAG(知识检索)、Function Calling(工具调用)、Memory(记忆系统)
  • 基础设施:向量数据库、模型服务、可观测性平台、安全治理

如果你刚入门,建议的学习路径是:LLM 基础 → Prompt Engineering → Function Calling → RAG → 单 Agent(ReAct)→ 多 Agent 协作 → 生产化部署

从 Demo 到生产:五个关键问题

搭一个 Agent Demo 很容易,但要上生产,你需要回答这五个问题:

  1. 成本:每次 Agent 执行消耗多少 Token?多 Agent 场景下成本会指数级增长。用 max_iter 限制迭代次数,用缓存减少重复调用
  2. 可靠性:Agent 跑偏了怎么办?设置 Guardrails(护栏)做输入输出检查,关键操作加 Human-in-the-Loop(人工审批)
  3. 可观测性:Agent 做了什么、为什么这么做?集成 LangSmith 或类似平台,记录每一步的推理过程和工具调用
  4. 安全:Prompt 注入、工具滥用、数据泄露怎么防?输入过滤、权限最小化、敏感操作审批是基本功
  5. 状态管理:用户中途离开怎么办?用 Checkpointer 做状态持久化,支持断点续传

写在最后

AI Agent 不是一个单一的技术,而是一套将 LLM 从”对话工具”升级为”任务执行系统”的方法论。它的核心价值在于:让 AI 不只是回答问题,而是真正替你完成工作。

但也不要被”自主”这个词迷惑——当前阶段,最好的 Agent 不是最自主的,而是在合适的地方自主、在关键的地方受控的。Anthropic 说得好:从简单开始,仅在必要时增加复杂度。

想深入学习?我的 GitHub 仓库 中有 400+ 篇 AI Agent 学习笔记,覆盖基础概念、设计模式、框架实战、协议标准、安全治理等完整知识体系,从入门到生产级开发一站式覆盖。