跳转到内容

第 1 章:AI Agent 原理与演进

第 1 章:AI Agent 原理与演进

本章要点

  • 理解大语言模型与自主智能体之间的本质区别
  • 掌握 Agent 的四要素核心模型(规划、记忆、工具、行动)
  • 剖析感知-决策-执行-反思的环境交互闭环

1.1 从 LLM 到 Agent 的范式演进

传统大语言模型(LLM)的本质是一个基于上下文进行 Token 预测(Next-token Prediction) 的概率模型。它在单次交互中被动响应用户提示词(Prompt),产生文本输出。

然而,现实场景中的复杂任务通常要求:

  1. 多步骤拆解与动态调整
  2. 连接外部数据源与 API 执行真实动作
  3. 根据执行结果自我纠错

AI Agent(自主智能体) 正是在 LLM 的基础上,赋予了模型主动感知环境、制定计划、使用工具并持续自我迭代的完整能力圈。

+-------------------------------------------------------+
| AI Agent |
| |
| +--------------+ +--------------+ |
| | 规划 (Plan) | | 记忆 (Memory)| |
| +-------+------+ +-------+------+ |
| | | |
| v v |
| +----------------------------------+ |
| | LLM 核心推理引擎 | |
| +-----------------+----------------+ |
| | |
| v |
| +----------------------------------+ |
| | 工具与行动 (Tools) | |
| +----------------------------------+ |
+-----------------------+-------------------------------+
|
v
外界环境 (Environment)

1.2 Agent 的四要素模型

一个成熟的 AI Agent 架构通常由以下四大部分共同构成:

1. 规划 (Planning)

  • 子任务拆解:将复杂宏观目标拆解为简单可执行的子步骤。
  • 自我反思:对之前的执行结果进行检查并发现错误,动态修改当前策略。

2. 记忆 (Memory)

  • 短期记忆 (Short-term Memory):利用 LLM 上下文窗口保留当前会话历史。
  • 长期记忆 (Long-term Memory):结合向量数据库(Vector DB)存取历史经验与先验知识。

3. 工具 (Tools)

  • Agent 能够利用外部 API、搜索引擎、Python 代码解释器、数据库查询接口等弥补大模型内部知识储备与实时计算能力的不足。

4. 行动 (Action)

  • Agent 根据规划与工具结果,执行具体指令并生成最终结果反馈给用户。

1.3 小结与下一章预告

本章我们探讨了 Agent 的基础原理与组成模型。在下一章 第 2 章:Agent 核心认知架构 中,我们将详细拆解思维链 (ReAct) 推理机制与工具调用的具体实现。

💬 章节讨论与反馈留言

欢迎对本章节内容提出改进建议或疑问!留言将自动同步存入 GitHub Discussions,方便作者与其他读者跟进回复。