AI Agent 知识概念总结
从 LLM 到 Agent:大模型应用落地的最重要形态——AI Agent(智能体)核心知识概念梳理。
什么是 AI Agent
AI Agent(人工智能智能体)是指以大语言模型(LLM)为大脑核心,能够自主感知环境、做出决策并执行行动的智能系统。它不只是”问答机器人”,而是能理解目标、拆解任务、调用工具并最终完成复杂任务的自主执行者。
一句话概括:LLM 负责”思考”,Agent 负责”做事”。传统 AI 应用是人提问 AI 回答,Agent 则是人提出目标,AI 自己规划并执行。
Agent 的五大核心组成
一个完整的 AI Agent 通常由以下五个模块构成:
- LLM 大脑(Brain):负责理解、推理、决策,是 Agent 的智力核心
- 规划(Planning):将复杂目标拆解为可执行的子任务序列
- 记忆(Memory):存储历史交互与经验,支持上下文与长期知识
- 工具(Tools):调用外部能力,如搜索、计算器、API、代码执行等
- 行动(Action):将决策转化为实际输出,如生成文本、操作软件、调用接口
感知-思考-行动循环(ReAct 模式)
Agent 的核心工作模式是 ReAct(Reasoning + Acting),即思考与行动交替进行:
感知环境 → 思考推理 → 采取行动 → 观察结果 → 再次思考…
这个循环不断迭代,直到完成任务。ReAct 模式让 Agent 摆脱了”一步到位的回答”,而能够像人一样边做边想、根据反馈修正。
规划能力
规划是 Agent 区别于普通对话模型的标志性能力,主要包括:
- 任务分解:把大目标拆成若干子任务(如”写一篇报告”拆为:查资料 → 列提纲 → 逐章撰写 → 校对)
- 思维链(Chain-of-Thought, CoT):通过逐步推理提升复杂问题的解决准确率
- 自我反思(Self-Refine):执行后对结果进行自我检查与修正
- 树状思考(Tree-of-Thought, ToT):探索多条推理路径,择优而行
规划能力是 Agent 从”能用”到”好用”的分水岭:任务拆得越合理,执行质量越高。
记忆机制
Agent 的记忆分为两类:
- 短期记忆(工作记忆):当前任务中的对话上下文,依赖 LLM 的上下文窗口
- 长期记忆(持久记忆):跨会话的知识沉淀,通常借助向量数据库(如 Milvus、pgvector)以向量化 + 相似度检索的方式存取
长期记忆让 Agent 能够”记得用户偏好””积累领域知识”,也是 RAG(检索增强生成)技术的基础。
工具使用与 Function Calling
Agent 通过工具调用突破 LLM 自身的局限:
- Function Calling:LLM 根据用户需求输出结构化调用指令,由程序执行真实函数
- RAG(检索增强生成):先从知识库检索相关内容,再交给 LLM 生成答案,解决幻觉问题
- MCP(Model Context Protocol):标准化 Agent 与外部工具/数据源的连接协议,让一个 Agent 对接多个生态
工具是 Agent 的”手和脚”。没有工具的 LLM 只能回答”怎么做”,有了工具才能真正”做到”。
多智能体协作
单个 Agent 能力有限,复杂任务可由多个分工明确的 Agent 协作完成:
- 分工模式:如 Product Manager Agent 拆需求 → Developer Agent 写代码 → Reviewer Agent 审查
- 对话模式:多个 Agent 相互辩论、互补,提升决策质量
- 典型案例:MetaGPT 模拟软件公司各角色协作产出整个项目
常见 Agent 框架与平台
- LangChain / LangGraph:最流行的 Agent 开发框架,支持编排、记忆、工具
- AutoGPT / MetaGPT:早期多智能体自主任务框架
- CrewAI:轻量级多角色协作框架
- Dify / Coze(扣子)/ FastGPT:低代码 Agent 搭建平台,业务人员也可快速上手
Agent 与传统程序的区别
| 维度 | 传统程序 | AI Agent |
|---|---|---|
| 逻辑来源 | 人工编写的固定规则 | LLM 动态推理生成 |
| 任务适配 | 需求变则代码变 | 自然语言描述即可调整 |
| 容错能力 | 异常即崩溃 | 可自我反思、修正 |
| 扩展能力 | 需重新开发 | 挂接工具即扩展 |
应用场景
- 开发助手:理解需求、生成代码、修复 Bug、执行 CI/CD
- 智能客服:自主查询订单、解答问题、引导售后流程
- 办公自动化:整理文档、汇总邮件、生成报表
- 个人助理:安排日程、管理信息、跨应用操作
局限与挑战
- 幻觉问题:LLM 可能一本正经地输出错误结论,工具与 RAG 只能缓解不能根除
- 稳定性:多步执行链路长,任一环节出错都可能让整个任务跑偏
- 成本与延迟:多轮思考 + 工具调用消耗大量 Token,速度与费用仍需权衡
- 安全与权限:Agent 自主执行外部操作,需要严格的权限控制与审计机制
- 评测困难:开放任务的执行质量难以自动化衡量
小结
AI Agent 的底层逻辑并不神秘:LLM 做大脑、规划做思路、记忆做沉淀、工具做手脚、行动做结果。理解这五个概念,就抓住了 Agent 的骨架。至于它能走多远,取决于工程化能力——毕竟从”能演示”到”能稳定上线”,中间隔着大量工程细节。
技术的演进永远是从”人适应机器”走向”机器适应人”。Agent 正是这条路上关键的一步。