AI Agent 知识概念总结

从 LLM 到 Agent:大模型应用落地的最重要形态——AI Agent(智能体)核心知识概念梳理。

什么是 AI Agent

AI Agent(人工智能智能体)是指以大语言模型(LLM)为大脑核心,能够自主感知环境、做出决策并执行行动的智能系统。它不只是”问答机器人”,而是能理解目标、拆解任务、调用工具并最终完成复杂任务的自主执行者

一句话概括:LLM 负责”思考”,Agent 负责”做事”。传统 AI 应用是人提问 AI 回答,Agent 则是人提出目标,AI 自己规划并执行。

Agent 的五大核心组成

一个完整的 AI Agent 通常由以下五个模块构成:

  • LLM 大脑(Brain):负责理解、推理、决策,是 Agent 的智力核心
  • 规划(Planning):将复杂目标拆解为可执行的子任务序列
  • 记忆(Memory):存储历史交互与经验,支持上下文与长期知识
  • 工具(Tools):调用外部能力,如搜索、计算器、API、代码执行等
  • 行动(Action):将决策转化为实际输出,如生成文本、操作软件、调用接口

感知-思考-行动循环(ReAct 模式)

Agent 的核心工作模式是 ReAct(Reasoning + Acting),即思考与行动交替进行:

感知环境 → 思考推理 → 采取行动 → 观察结果 → 再次思考…

这个循环不断迭代,直到完成任务。ReAct 模式让 Agent 摆脱了”一步到位的回答”,而能够像人一样边做边想、根据反馈修正

规划能力

规划是 Agent 区别于普通对话模型的标志性能力,主要包括:

  • 任务分解:把大目标拆成若干子任务(如”写一篇报告”拆为:查资料 → 列提纲 → 逐章撰写 → 校对)
  • 思维链(Chain-of-Thought, CoT):通过逐步推理提升复杂问题的解决准确率
  • 自我反思(Self-Refine):执行后对结果进行自我检查与修正
  • 树状思考(Tree-of-Thought, ToT):探索多条推理路径,择优而行

规划能力是 Agent 从”能用”到”好用”的分水岭:任务拆得越合理,执行质量越高。

记忆机制

Agent 的记忆分为两类:

  • 短期记忆(工作记忆):当前任务中的对话上下文,依赖 LLM 的上下文窗口
  • 长期记忆(持久记忆):跨会话的知识沉淀,通常借助向量数据库(如 Milvus、pgvector)以向量化 + 相似度检索的方式存取

长期记忆让 Agent 能够”记得用户偏好””积累领域知识”,也是 RAG(检索增强生成)技术的基础。

工具使用与 Function Calling

Agent 通过工具调用突破 LLM 自身的局限:

  • Function Calling:LLM 根据用户需求输出结构化调用指令,由程序执行真实函数
  • RAG(检索增强生成):先从知识库检索相关内容,再交给 LLM 生成答案,解决幻觉问题
  • MCP(Model Context Protocol):标准化 Agent 与外部工具/数据源的连接协议,让一个 Agent 对接多个生态

工具是 Agent 的”手和脚”。没有工具的 LLM 只能回答”怎么做”,有了工具才能真正”做到”。

多智能体协作

单个 Agent 能力有限,复杂任务可由多个分工明确的 Agent 协作完成

  • 分工模式:如 Product Manager Agent 拆需求 → Developer Agent 写代码 → Reviewer Agent 审查
  • 对话模式:多个 Agent 相互辩论、互补,提升决策质量
  • 典型案例:MetaGPT 模拟软件公司各角色协作产出整个项目

常见 Agent 框架与平台

  • LangChain / LangGraph:最流行的 Agent 开发框架,支持编排、记忆、工具
  • AutoGPT / MetaGPT:早期多智能体自主任务框架
  • CrewAI:轻量级多角色协作框架
  • Dify / Coze(扣子)/ FastGPT:低代码 Agent 搭建平台,业务人员也可快速上手

Agent 与传统程序的区别

维度 传统程序 AI Agent
逻辑来源 人工编写的固定规则 LLM 动态推理生成
任务适配 需求变则代码变 自然语言描述即可调整
容错能力 异常即崩溃 可自我反思、修正
扩展能力 需重新开发 挂接工具即扩展

应用场景

  • 开发助手:理解需求、生成代码、修复 Bug、执行 CI/CD
  • 智能客服:自主查询订单、解答问题、引导售后流程
  • 办公自动化:整理文档、汇总邮件、生成报表
  • 个人助理:安排日程、管理信息、跨应用操作

局限与挑战

  1. 幻觉问题:LLM 可能一本正经地输出错误结论,工具与 RAG 只能缓解不能根除
  2. 稳定性:多步执行链路长,任一环节出错都可能让整个任务跑偏
  3. 成本与延迟:多轮思考 + 工具调用消耗大量 Token,速度与费用仍需权衡
  4. 安全与权限:Agent 自主执行外部操作,需要严格的权限控制与审计机制
  5. 评测困难:开放任务的执行质量难以自动化衡量

小结

AI Agent 的底层逻辑并不神秘:LLM 做大脑、规划做思路、记忆做沉淀、工具做手脚、行动做结果。理解这五个概念,就抓住了 Agent 的骨架。至于它能走多远,取决于工程化能力——毕竟从”能演示”到”能稳定上线”,中间隔着大量工程细节。

技术的演进永远是从”人适应机器”走向”机器适应人”。Agent 正是这条路上关键的一步。


AI Agent 知识概念总结
https://chaggle.github.io/2026/08/08/summary/ai-agent-concepts-20260809/
作者
chaggle
发布于
2026年8月8日
更新于
2026年8月9日
许可协议