Skip to content

AI Agent(智能体)是当前 AI 从"会聊天"走向"能做事"的核心范式。它不是一个模型,而是一个完整系统:以 LLM 为大脑,自主感知环境、制定计划、调用工具、执行行动来达成目标。本笔记梳理其定义、三组件、四要素与五步工作循环。

什么是 AI Agent

一句话:AI Agent 就是能自主思考、做决策、执行动作的 AI 程序,可理解为一位"超级实习生"——你给它一个目标,它自己拆分步骤去完成。

微软的定义:AI Agent 是让 LLM 真正"做事"的系统——给它工具和知识去作用于世界,而不仅是回复提示词。

与传统对话 AI 的区别:

普通对话 AIAI Agent
你问一句,它答一句你给目标,它拆分步骤去完成
只生成文本会调用工具、执行操作
无状态、被动有记忆、主动规划、持续行动

三大组件(最简模型)

Agent = LLM(大脑) + Tools(手脚) + Loop(驱动循环)
  • LLM:负责推理、规划、决策——"动脑"
  • Tools:API、代码函数、数据库、搜索等——"动手"
  • Loop:循环驱动——"思考→行动→观察"反复迭代直到完成

四要素(Google 白皮书架构)

要素角色说明
模型大脑核心推理引擎,处理信息、评估选项、做决策
工具API 扩展、代码函数、数据存储,连接外部世界
协调层神经系统管理运行循环:规划、记忆(状态)、推理策略(CoT/ReAct)
部署身体和腿安全可扩展的服务器、监控、日志、多 Agent 通信(A2A)

五步工作循环

Agent 通过持续循环达成目标,可分解为五步:

① 获取任务 → ② 扫描场景 → ③ 深度思考 → ④ 执行行动 → ⑤ 观察与迭代(回到③)

以客服智能体查订单为例:

  1. 获取任务:用户问"我的订单 12345 在哪?"
  2. 扫描场景:确认需要查数据库、调用物流 API
  3. 深度思考:规划多步——查订单 → 拿追踪号 → 查实时状态
  4. 执行行动:调用 find_order('12345')get_shipping_status('ZYX987')
  5. 观察与迭代:拿到"正在配送中",整合成回复

核心洞察

  • Agent 本质是"上下文窗口管理":它持续循环"整合上下文 → 发出指令 → 观察结果 → 重新整合上下文",精准管理 LLM 注意力。
  • 开发者角色转变:传统开发像"砌砖工"逐行写逻辑;Agent 开发者像"导演"——设置场景(指令/提示)、选演员(工具/API)、给背景(数据),引导自主演员完成表演。
  • Context Engineering:每次调用 LLM 需填充指令、事实、工具、示例、会话历史、用户档案,这正是 Agent 要管理的核心。

一句话总结

Agent = LLM(大脑)+ Tools(手脚)+ Loop(驱动循环),把 AI 从"会聊天"变成"能做事";四要素为模型/工具/协调层/部署,本质是持续循环的上下文窗口管理。

关联概念

  • 相关:[AI-Agent-类型与适用场景](/学习笔记/AI技术/AI Agent/AI-Agent-类型与适用场景)、[AI-Agent-主流框架对比](/学习笔记/AI技术/AI Agent/AI-Agent-主流框架对比)
  • 基础:人工智能导论-搜索求解策略(Agent 规划与搜索思想一脉相承)