智能体的今生与来世:从 ReAct 到自我进化
AIAI Summary (BLUF)
本文系统梳理了AI Agent从ReAct论文到自我进化Agent的六个演进阶段,对比了OpenAI、Anthropic、Google、微软及开源阵营的路线,并详解了MCP、A2A、Function Call等关键技术。核心观点是AI Agent正从'执行者'变为'系统组件',行业在工具调用标准上已经收敛,但在Agent间通信和自主权边界上仍在竞争。
核心洞察
这篇文章最有意思的地方,是把智能体四年多的演进拆成了六个阶段。看完你会发现,2023 年 AutoGPT2023年开源的目标导向自主Agent实验,虽然当时不够可靠,但证明了Agent概念可行性,推动了可控Agent框架的发展。 摔的那一跤,直接决定了今天所有大厂都在做「可控智能体」。第六阶段说的自我进化一旦真跑起来,智能体就不再是你指挥的工具了。
2026 年,大家聊 AI 的话题已经从「哪个模型更聪明」变成了「哪个智能体更能干活」。但不少人还是分不清智能体和 ChatGPT。这篇文章打算从头捋一遍:智能体是什么、怎么一路走来的、各家在做什么、接下来往哪走。
核心结论
2022 年提出的 ReAct一种代理执行模式,结合推理和行动(Reasoning + Acting),使代理能够在思考后调用工具并观察结果。 循环(观察→思考→行动)是智能体的底层引擎,2022 年至今所有主流智能体框架都建立在该循环的变体和扩展之上。
2023 年 AutoGPT 验证了智能体概念可行,但暴露出纯自主循环不可靠的核心缺陷,这一教训直接催生了后来所有「可控智能体」框架和工程化标准。
OpenAI 于 2023 年 6 月引入函数调用,把工具调用从提示词工程变成可调试、可上生产的工程标准;2024 年 11 月 Anthropic 开源 MCP 协议后,MCP 事实上成为工具连接的统一标准,2025 年官方 MCP 服务器超过 100 个,社区贡献达数千个。
2024 年 10 月 Anthropic 发布电脑操作功能,让智能体无需依赖 API、直接通过截图、鼠标和键盘操作任意有界面的软件,标志着全球软件原则上都成为智能体可操作的工具。
2026 年智能体进入自我维护阶段:Hermes Agent开源AI代理,可执行Shell命令、编写Python脚本、管理长期记忆,并通过Telegram等网关交互。 v0.12.0 的自主管家每 7 天自动对技能库进行评分、整合和清理;Google 主导的 A2A 协议由 Linux 基金会管理、150 多家组织加入,成为智能体间通信的开放标准。
一、智能体是什么
从问答机到行动者
大语言模型说白了就是一台做「下一个词预测」的机器,只是这台机器复杂得吓人。你问一句,它答一句。它活在对话框里,上下文窗口就是它的整个世界,窗口一关,啥都不剩。
智能体干的事不一样。它要的是「代你完成任务」,回答只是捎带的事。
最简洁的定义:智能体 = 大语言模型 + 感知 + 规划 + 记忆 + 行动
| 能力 | 含义 | 类比 |
|---|---|---|
| 感知 | 读取外部信息:文件、网页、截图、接口返回值 | 眼睛和耳朵 |
| 规划 | 把大目标拆解成一步步可执行的动作 | 大脑思考 |
| 记忆 | 跨对话、跨任务保留上下文和知识 | 笔记本 |
| 行动 | 调用工具、写代码、操作界面、发送消息 | 手和脚 |
这四样凑齐了,AI 才从「帮你写一封邮件」变成「每天早上帮你检查邮件、筛出重点、起草回复、等你点头再发出去」。
和普通助手的本质差异
普通 AI 助手的流程是你在前面拉,它在后面跟,每一步都得你下指令。智能体的流程反过来:你给个目标,剩下的事它自己安排。拆任务、调工具、处理报错、交付结果,全是它的事。
这哪是渐进式改进,整个玩法都变了。
二、进化六阶段:智能体的完整历史
第一阶段:ReAct 的诞生(2022)
2022 年,普林斯顿和谷歌研究院发了篇论文,核心思想就一句话:让推理和行动协同起来。论文就是后来人人都在说的 ReAct,作者是姚顺雨等人。
论文里提出一个后来改变一切的简单循环:
观察 → 思考 → 行动 → 观察 → 思考 → 行动 → ...
拆开看是这样:
思考:「用户问的是实时天气,我得先调搜索工具」
行动:调用天气接口
观察:返回「北京 26℃ 晴」
思考:「有答案了,可以回复」
回复:「北京现在 26℃,晴天。」
这个循环看着不起眼,意义很大。它头一回让大语言模型学会了「先想清楚再动手,干完看结果再想下一步」。在这之前,大模型就是直觉机器,只会预测下一个词,谈不上规划。
ReAct 是智能体的底层引擎。从 2022 年到现在,所有智能体框架的核心都是这个循环的变体和扩展。
第二阶段:AutoGPT 的疯狂实验(2023 年初)
2023 年 3 月,一个叫 Toran Bruce Richards 的开发者把 ReAct 框架包了一层「目标导向」的外壳,取名 AutoGPT,推到了 GitHub 上。
两周之内,AutoGPT 成了 GitHub 历史上涨星最快的项目之一。
它的想法很直接:给 AI 一个长期目标,让它自己循环拆解、执行、验证,直到干完。
目标:「帮我建一个能自动发推文的账号」
→ 子任务 1:注册推特开发者账号
→ 子任务 2:研究推特接口限制
→ 子任务 3:写发帖代码
→ 子任务 4:测试
→ ...
大部分时候,AutoGPT 在转圈。
它陷入无限循环、输出无关内容、子任务越拆越碎,永远收不了尾。同期还有个更激进的 BabyAGI,表现也差不多。
为什么失败?当时的 GPT-3.5 和 GPT-4 早期版本,在循环里缺少「判断当前结果够不够好、该不该停」的能力。智能体的瓶颈在控制系统,不在智力,循环里没人做质量把关。
AutoGPT 的历史意义有两层。它证明了智能体这个概念跑得通,也告诉所有人,纯「自主循环」上了真实场景就不够可靠。这个教训直接催生了后面所有「可控智能体」框架。
第三阶段:函数调用让工具调用变成标准(2023 年中)
2023 年 6 月,OpenAI 给 GPT-3.5-turbo 和 GPT-4 加了函数调用能力。
这是智能体发展史上最关键的一个基础设施决策。
在此之前,想让 AI 调工具得靠一堆提示词工程。引导 AI 输出一段格式化文本,再用代码解析,再调用。不稳定、不可靠、不标准。
函数调用让模型直接输出结构化的 JSON:
{
"name": "get_weather",
"arguments": {
"city": "北京",
"unit": "celsius"
}
}
开发者拿到这个 JSON,去调真实的天气接口,把结果塞回模型。整个流程可预测、可调试、能上生产。
Anthropic 随后跟进,Claude 3 系列推出了工具使用。Google 在 Gemini 上也做了类似能力。
函数调用把「AI 调工具」从实验室技巧变成了工程标准。从这一刻起,凡是有接口的软件,原则上都能被智能体操作。
同期爆发的 LangChain 生态正好吃到这波红利。一套链式编排框架,几百个预集成的工具包,开发者能快速搭出智能体原型。到 2023 年底,LangChain 已经是人工智能工程师的默认工具箱。
第四阶段:多智能体协作与 MCP 协议(2024)
单个智能体的上限,是一个啥都会但容易过载的人。多智能体的思路是让不同智能体各管一摊,像团队一样配合。
MetaGPT 来自清华团队,把软件开发流程映射成智能体角色。产品经理智能体写需求文档,架构师智能体设计系统,工程师智能体写代码,测试智能体验收。角色分工之后,复杂任务的成功率提升了不少。
AutoGen 来自微软,用的是更灵活的双智能体架构。用户代理和助手代理来回对话,人可以在任意环节插进去。
CrewAI 上手容易,适合快速搭原型,定制性弱一些。
同年 11 月,Anthropic 开源了 MCP(模型上下文协议)。
MCP 的定位是智能体工具调用的 USB 标准。
在 MCP 之前,每个框架都有自己的工具接入方式。LangChain 一套,OpenAI 一套,互不兼容。MCP 提供了一套标准接口,任何支持 MCP 的智能体,可以直接用任何 MCP 服务器提供的工具,不用重新适配。
2025 年 MCP 生态爆炸式增长。GitHub、Slack、Jira、Notion、数据库,超过 100 个主流工具发布了官方 MCP 服务器,开源社区贡献的更多,有数千个。
MCP 出来之后,智能体的工具边界第一次开始消失。
第五阶段:电脑操作与深度智能体(2024 年末 - 2025)
2024 年 10 月,Anthropic 发布了 Claude 3.5 Sonnet 的电脑操作功能。
这是一次质的跃迁。
之前的工具调用都依赖接口。软件必须有接口,智能体才能操作它。全球绝大多数遗留软件没有接口,智能体根本碰不到。
电脑操作让 Claude 直接看截图、移鼠标、点按钮、敲键盘。任何有界面的软件,不管有没有接口,Claude 都能像人一样操作。
这意味着,全球所有软件,原则上都成了智能体可以操作的工具。
同期上线的 Claude Code,是面向开发者的深度智能体。它能读整个代码库、写代码、跑测试、修 bug、提合并请求。它做的事已经超出「帮你写代码片段」的范畴,更像是作为真实开发者参与你的项目。
OpenAI 在 2025 年初推出了 Operator,一个能自主在浏览器里完成多步任务的智能体。订餐厅、填表单、下订单,不需要用户每一步都介入。
OpenAI 的 Agents SDK 也在同年发布,是 Swarm 实验项目的生产版本,提供四个核心原语:智能体、移交、护栏、追踪。
这一阶段最明显的变化是智能体开始有了全局视野。它已经走出对话框,能在你的电脑和服务器上持续运行、完成真实工作,是个不折不扣的数字员工。
第六阶段:自我进化智能体(2025 - 2026)
2026 年的新主题:智能体开始维护自己。
Hermes Agent(NousResearch 出品)的核心命题就是这样。智能体不只执行任务,每次任务结束后会自动反思,把有价值的经验写成「技能文件」,下次遇到相似问题时直接调用。
Hermes Agent v0.12.0 的自主管家功能把这个逻辑又推了一步。系统后台每 7 天自动跑一次,对技能库做评分、整合、清理。用户不用管,智能体自己保持整洁高效。
同期,Google 推出了 A2A(智能体间通信协议),由 Linux 基金会管理,150 多家组织加入。A2A 解决的是:不同框架的智能体怎么互相发现、委托任务、协作完成。如果说 MCP 是智能体和工具之间的 USB 接口,A2A 就是智能体之间的共同语言。
这一阶段的核心特征:智能体从「执行者」变成了「系统组件」,一个能自我维护、能和其他智能体协作、能持续学习的实体。
三、各家路线:一张全景地图
OpenAI:开发者生态优先
OpenAI 的智能体路线,是从产品出发,往平台进化。
| 时间 | 里程碑 |
|---|---|
| 2023.06 | 函数调用,奠定工具调用标准 |
| 2023.11 | GPTs 商店,把智能体带给普通用户 |
| 2025 Q1 | Agents SDK(Swarm 继任),四原语框架 |
| 2025 Q1 | Operator,浏览器自主智能体产品 |
| 2025 Q4 | AgentKit,全生命周期开发套件 |
| 2026.04 | Agents SDK 大更新:9 个沙箱提供商、Codex 工具集成 |
OpenAI 的策略是先占领开发者的脑子,再建生态护城河。目前它拥有最大的开发者社区和最成熟的应用生态。缺点也明显,Assistants API 代表的旧路线快退役了(2026 年 8 月),给不少开发者添了麻烦,框架变动也频繁。
主打产品:ChatGPT(消费级)、Operator(浏览器智能体)、Agents SDK(开发者)
Anthropic:安全、能力、协议三管齐下
Anthropic 的特点是:每次发布都比同行慢半步,但质量更高,也更强调安全。
| 时间 | 里程碑 |
|---|---|
| 2024.05 | Claude 3 工具使用,高质量工具调用 |
| 2024.10 | 电脑操作,操作任意软件界面 |
| 2024.11 | 开源 MCP,建立工具连接标准 |
| 2025 下半年 | Claude Code SDK 更名为 Claude Agent SDK |
| 2026.04 | Claude 托管智能体公测:沙箱、检查点、凭证隔离 |
Anthropic 最聪明的一步是开源 MCP。用一个开放标准把生态建起来,让工具集成商都朝着它的规格做开发,形成网络效应。MCP 事实上已经是业界标准。
定位:推理质量加安全边界加企业合规。法律、金融、医疗、政府这些行业是它的主场。
Google:企业基础设施加多模型战略
Google 在智能体赛道的独特优势是垂直整合。从模型(Gemini)到开发框架(ADK)到托管运行时(Vertex AI Agent Engine)到企业前台(Gemini Enterprise),一条龙。
| 时间 | 里程碑 |
|---|---|
| 2025.04 | ADK(智能体开发套件)发布 |
| 2025 Q3 | Gemini 2.0 + Astra 多模态感知 |
| 2025.10 | Gemini Enterprise,企业智能体舰队管理 |
| 2025 | A2A 协议,智能体间通信标准 |
| 2026 | Vertex AI Agent Engine,托管智能体运行时 |
ADK 的设计思路和 OpenAI、Anthropic 不一样。它把多智能体系统当第一公民,单个智能体反而排在后面。语言上支持 Python、TypeScript、Go、Java,面向企业多语言团队。
A2A 协议的意义不在眼前。MCP 解决的是「一个智能体怎么用工具」,A2A 解决的是「一群智能体怎么协同工作」。
定位:企业级智能体基础设施,和 Google Workspace 深度整合。
微软:从 AutoGen 到企业 AI 平台
微软通过对 OpenAI 的战略投资(估值 1570 亿美元,占股约 30%),直接在产品层面整合了 GPT 能力。它自己的独立贡献主要有几块:
- AutoGen(2023):双代理对话框架,专注代码生成和软件开发自动化
- Magentic-One(2024):五个预设智能体的通用任务框架
- 微软智能体框架(2025):AutoGen 的生产化继任,和 Azure AI Studio 深度整合
- GitHub Copilot:目前落地最广的编程智能体,月活开发者超过 1500 万
微软的策略很务实:模型那摊它不掺和,专攻场景。把智能体能力嵌进 Office 365、GitHub、Teams、Azure,靠已有的企业客户基础快速落地。
开源阵营:从 LangChain 到自托管智能体
| 框架 | 特点 | 当前地位 |
|---|---|---|
| LangChain(2022) | 链式编排,工具包最丰富 | 原型开发标配,生产中被 LangGraph 取代 |
| LangGraph(2024) | 有向图状态机,生产级可靠 | 企业生产首选之一 |
| CrewAI | 角色驱动多智能体,极易上手 | 快速原型、教学演示 |
| AutoGPT(进化后) | 目标导向自主智能体,更可控 | 社区活跃但非主流生产框架 |
| Hermes Agent | 持久记忆、技能自进化、多消息平台、自托管 | 2026 年自托管首选,12.7 万星标 |
| OpenClaw | 模型无关、多渠道、ClawHub 社区 | 开源社区生态最活跃之一 |
Hermes Agent 和 OpenClaw 的出现,标志着开源智能体进入了「生产可用」阶段。持久记忆、多平台接入、技能系统、数据本地化,都是面向真实长期使用场景设计的,不再是实验框架。
四、技术架构:四个核心问题
记忆系统:智能体的长期脊柱
智能体记忆分四个层次:
- 上下文内记忆:当前对话窗口里的内容。速度最快,但有上限,就算把上下文窗口开到 100 万 token 也会满,关了窗口就没了。
- 外部记忆:向量数据库加检索。能装海量知识,但检索相关性是命门,质量不太稳定。
- 文件系统记忆:结构化存到 SQLite、JSON 或 Markdown 文件里。Hermes Agent 的技能文件就是这一类,可读、可编辑、可移植。
- 模型微调:把知识烧进权重。成本最高、最持久,更新也最慢。
生产级智能体通常用第二层加第三层的组合。向量检索覆盖大量知识,文件系统存放个人偏好和可复用技能。
工具调用:从函数调用到 MCP
工具调用的演进路径:
早期提示词工程(不稳定)
→ 函数调用 JSON(2023,结构化但各家私有)
→ MCP 服务器(2024,开放标准,一次实现到处用)
→ A2A(2025,智能体之间的协作协议)
MCP 之后,工具生态的建设成本下降了一大截。开发者实现一次 MCP 服务器,所有支持 MCP 的智能体都能用。2025 年 MCP 服务器数量从零涨到几千个,就是这个原因。
规划机制:从思维链到行动链
思维链是 2022 年谷歌的论文提出来的,让模型先输出中间推理步骤。o1 系列把它内化成了训练目标。
行动链是 2026 年的新范式。智能体不只思考,还主动探索。不确定某个工具怎么用,先发起低风险的实验去推断接口行为,再执行主任务。
这是一种元认知能力。智能体知道自己不知道,会主动去验证,不瞎猜。
多智能体协调
单个智能体的局限在认知负载。任务复杂到一定程度,一个上下文窗口装不下所有信息,可靠性断崖式下降。
多智能体的核心设计模式有三种:
- 分层架构:编排智能体负责规划和分配,子智能体负责执行具体子任务
- 专家智能体网络:每个智能体专精一个领域,代码、数据、通信、文件管理分开
- 检查点加人工介入:在关键决策点暂停,等人类审批,再继续
2026 年 4 月,Anthropic(Claude 托管智能体)和 OpenAI(Agents SDK 大更新)在同一周发布了几乎相同的多智能体基础设施架构。这是行业收敛的信号。智能体到底该怎么搭,头部厂商已经达成共识。
五、2026 年的现状:哪里还在打架
已经收敛的部分
- 工具调用标准:MCP 事实胜出,OpenAI、Google、微软都已支持
- 单智能体架构:控制面和计算面分离,带检查点的沙箱执行,已成标配
- 记忆系统:短期靠上下文,长期靠向量库或文件,组合方案基本固定
仍在争夺的部分
- 智能体间通信协议:A2A(Google 和 Linux 基金会)对各家私有实现
- 自主权边界:多少自主权算合理?出了问题谁负责?
- 本地还是云端:Hermes、OpenClaw 等自托管路线对 OpenAI、Anthropic 的托管路线
- 智能体操作系统:下一个战场,智能体会不会取代部分操作系统层的调度功能
六、未来方向
智能体操作系统:下一代操作系统的候选
2026 年 4 月,ColaOS 提出了更激进的概念。传统操作系统调度 CPU、内存、输入输出;智能体操作系统调度的是智能体、工具调用和人机交互。
它不替代操作系统。它在操作系统上面多跑一层,你的所有数字任务,都经过这个智能体层来路由和执行。
早期信号已经出现。苹果的智能功能深度整合 Gemini(Google 拿了 10 亿美元的合作),Siri 从「语音助手」往「智能体前台」转型。你和 AI 的交互界面,可能从「应用」变成「智能体」。
分布式主权智能体
当前智能体有个核心矛盾:你希望它越聪明、越能干,但越聪明越能干,意味着更多数据流向云端,更多隐私风险。
未来的方向是决策和执行解耦。
决策层在本地运行,用轻量模型加规则,处理隐私数据,做访问控制。执行层调用云端大模型完成需要强推理的部分,但只传脱敏后的任务描述。
Hermes Agent 的「数据留在你的服务器」路线,就是这个方向的早期形态。
自我进化:从规则到主动
目前 Hermes Agent 的自主管家是规则驱动的技能管理:清理、整合、评分。
下一步是意图驱动的自我进化。智能体根据主人的长期目标,主动识别自己的短板,设计实验,优化自身的技能库和行为模式。
这有点像强化学习,但发生在智能体层,比模型层成本更低、周期更短、也更贴近具体用户的场景。
已经有早期实验把遗传算法用在提示优化上。智能体自动测试不同的提示写法,留下效果最好的。这个过程本身也是一个 ReAct 循环。
结语
从 2022 年的 ReAct 论文,到 2026 年的自主管家,智能体的每一次演进,都是在让那个最基础的循环更完整、更可靠、更自动化:
观察世界 → 思考 → 采取行动 → 看结果 → 调整 → 再观察
这个循环就是智能的本质,人类如此,AI 也如此。
区别只在于,现在的智能体,第一次开始有能力自己维护这个循环了。
参考资料:OpenAI Agents SDK 文档、Anthropic MCP 官方文档、Google ADK 文档、Hermes Agent GitHub 仓库、ReAct 原论文。
常见问题(FAQ)
AI Agent和普通AI助手到底有什么区别?
普通AI助手需逐步指令,你在前面拉它在后面跟;智能体只需给目标,自己拆任务、调工具、处理报错、交付结果,从被动跟随变为主动行动,整个玩法都变了。
AI Agent的六个演进阶段分别是什么?
一、ReAct诞生(2022);二、AutoGPT的疯狂实验(2023初);三、函数调用成为标准(2023中);四、多智能体协作与MCP协议(2024);五、电脑操作与深度智能体(2024末-2025);六、自我进化智能体(2025-2026)。
MCP和A2A协议有什么区别?
MCP是智能体与工具之间的USB标准,解决工具调用一致性问题;A2A是智能体之间的通信协议,解决跨框架智能体互相发现、委托任务、协作。MCP管工具,A2A管智能体间协作,两者互补。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



