Appearance
AI Agent(智能体)是当前 AI 从"会聊天"走向"能做事"的核心范式。它不是一个模型,而是一个完整系统:以 LLM 为大脑,自主感知环境、制定计划、调用工具、执行行动来达成目标。本笔记梳理其定义、三组件、四要素与五步工作循环。
什么是 AI Agent
一句话:AI Agent 就是能自主思考、做决策、执行动作的 AI 程序,可理解为一位"超级实习生"——你给它一个目标,它自己拆分步骤去完成。
微软的定义:AI Agent 是让 LLM 真正"做事"的系统——给它工具和知识去作用于世界,而不仅是回复提示词。
与传统对话 AI 的区别:
| 普通对话 AI | AI Agent |
|---|---|
| 你问一句,它答一句 | 你给目标,它拆分步骤去完成 |
| 只生成文本 | 会调用工具、执行操作 |
| 无状态、被动 | 有记忆、主动规划、持续行动 |
三大组件(最简模型)
Agent = LLM(大脑) + Tools(手脚) + Loop(驱动循环)- LLM:负责推理、规划、决策——"动脑"
- Tools:API、代码函数、数据库、搜索等——"动手"
- Loop:循环驱动——"思考→行动→观察"反复迭代直到完成
四要素(Google 白皮书架构)
| 要素 | 角色 | 说明 |
|---|---|---|
| 模型 | 大脑 | 核心推理引擎,处理信息、评估选项、做决策 |
| 工具 | 手 | API 扩展、代码函数、数据存储,连接外部世界 |
| 协调层 | 神经系统 | 管理运行循环:规划、记忆(状态)、推理策略(CoT/ReAct) |
| 部署 | 身体和腿 | 安全可扩展的服务器、监控、日志、多 Agent 通信(A2A) |
五步工作循环
Agent 通过持续循环达成目标,可分解为五步:
① 获取任务 → ② 扫描场景 → ③ 深度思考 → ④ 执行行动 → ⑤ 观察与迭代(回到③)以客服智能体查订单为例:
- 获取任务:用户问"我的订单 12345 在哪?"
- 扫描场景:确认需要查数据库、调用物流 API
- 深度思考:规划多步——查订单 → 拿追踪号 → 查实时状态
- 执行行动:调用
find_order('12345')→get_shipping_status('ZYX987') - 观察与迭代:拿到"正在配送中",整合成回复
核心洞察
- Agent 本质是"上下文窗口管理":它持续循环"整合上下文 → 发出指令 → 观察结果 → 重新整合上下文",精准管理 LLM 注意力。
- 开发者角色转变:传统开发像"砌砖工"逐行写逻辑;Agent 开发者像"导演"——设置场景(指令/提示)、选演员(工具/API)、给背景(数据),引导自主演员完成表演。
- Context Engineering:每次调用 LLM 需填充指令、事实、工具、示例、会话历史、用户档案,这正是 Agent 要管理的核心。
一句话总结
Agent = LLM(大脑)+ Tools(手脚)+ Loop(驱动循环),把 AI 从"会聊天"变成"能做事";四要素为模型/工具/协调层/部署,本质是持续循环的上下文窗口管理。
关联概念
- 相关:[AI-Agent-类型与适用场景](/学习笔记/AI技术/AI Agent/AI-Agent-类型与适用场景)、[AI-Agent-主流框架对比](/学习笔记/AI技术/AI Agent/AI-Agent-主流框架对比)
- 基础:人工智能导论-搜索求解策略(Agent 规划与搜索思想一脉相承)