GEOZ

智能体的今生与来世:从 ReAct 到自我进化

2026/8/8
智能体的今生与来世:从 ReAct 到自我进化

AIAI Summary (BLUF)

本文系统梳理了AI Agent从ReAct论文到自我进化Agent的六个演进阶段,对比了OpenAI、Anthropic、Google、微软及开源阵营的路线,并详解了MCP、A2A、Function Call等关键技术。核心观点是AI Agent正从'执行者'变为'系统组件',行业在工具调用标准上已经收敛,但在Agent间通信和自主权边界上仍在竞争。

核心洞察

这篇文章最有意思的地方,是把智能体四年多的演进拆成了六个阶段。看完你会发现,2023 年 AutoGPT 摔的那一跤,直接决定了今天所有大厂都在做「可控智能体」。第六阶段说的自我进化一旦真跑起来,智能体就不再是你指挥的工具了。

2026 年,大家聊 AI 的话题已经从「哪个模型更聪明」变成了「哪个智能体更能干活」。但不少人还是分不清智能体和 ChatGPT。这篇文章打算从头捋一遍:智能体是什么、怎么一路走来的、各家在做什么、接下来往哪走。

核心结论

  1. 2022 年提出的 ReAct 循环(观察→思考→行动)是智能体的底层引擎,2022 年至今所有主流智能体框架都建立在该循环的变体和扩展之上。

  2. 2023 年 AutoGPT 验证了智能体概念可行,但暴露出纯自主循环不可靠的核心缺陷,这一教训直接催生了后来所有「可控智能体」框架和工程化标准。

  3. OpenAI 于 2023 年 6 月引入函数调用,把工具调用从提示词工程变成可调试、可上生产的工程标准;2024 年 11 月 Anthropic 开源 MCP 协议后,MCP 事实上成为工具连接的统一标准,2025 年官方 MCP 服务器超过 100 个,社区贡献达数千个。

  4. 2024 年 10 月 Anthropic 发布电脑操作功能,让智能体无需依赖 API、直接通过截图、鼠标和键盘操作任意有界面的软件,标志着全球软件原则上都成为智能体可操作的工具。

  5. 2026 年智能体进入自我维护阶段:Hermes Agent v0.12.0 的自主管家每 7 天自动对技能库进行评分、整合和清理;Google 主导的 A2A 协议由 Linux 基金会管理、150 多家组织加入,成为智能体间通信的开放标准。

一、智能体是什么

从问答机到行动者

大语言模型说白了就是一台做「下一个词预测」的机器,只是这台机器复杂得吓人。你问一句,它答一句。它活在对话框里,上下文窗口就是它的整个世界,窗口一关,啥都不剩。

智能体干的事不一样。它要的是「代你完成任务」,回答只是捎带的事。

最简洁的定义:智能体 = 大语言模型 + 感知 + 规划 + 记忆 + 行动

能力 含义 类比
感知 读取外部信息:文件、网页、截图、接口返回值 眼睛和耳朵
规划 把大目标拆解成一步步可执行的动作 大脑思考
记忆 跨对话、跨任务保留上下文和知识 笔记本
行动 调用工具、写代码、操作界面、发送消息 手和脚

这四样凑齐了,AI 才从「帮你写一封邮件」变成「每天早上帮你检查邮件、筛出重点、起草回复、等你点头再发出去」。

和普通助手的本质差异

普通 AI 助手的流程是你在前面拉,它在后面跟,每一步都得你下指令。智能体的流程反过来:你给个目标,剩下的事它自己安排。拆任务、调工具、处理报错、交付结果,全是它的事。

这哪是渐进式改进,整个玩法都变了。

二、进化六阶段:智能体的完整历史

第一阶段:ReAct 的诞生(2022)

2022 年,普林斯顿和谷歌研究院发了篇论文,核心思想就一句话:让推理和行动协同起来。论文就是后来人人都在说的 ReAct,作者是姚顺雨等人。

论文里提出一个后来改变一切的简单循环:

观察 → 思考 → 行动 → 观察 → 思考 → 行动 → ...

拆开看是这样:

思考:「用户问的是实时天气,我得先调搜索工具」
行动:调用天气接口
观察:返回「北京 26℃ 晴」
思考:「有答案了,可以回复」
回复:「北京现在 26℃,晴天。」

这个循环看着不起眼,意义很大。它头一回让大语言模型学会了「先想清楚再动手,干完看结果再想下一步」。在这之前,大模型就是直觉机器,只会预测下一个词,谈不上规划。

ReAct 是智能体的底层引擎。从 2022 年到现在,所有智能体框架的核心都是这个循环的变体和扩展。

第二阶段:AutoGPT 的疯狂实验(2023 年初)

2023 年 3 月,一个叫 Toran Bruce Richards 的开发者把 ReAct 框架包了一层「目标导向」的外壳,取名 AutoGPT,推到了 GitHub 上。

两周之内,AutoGPT 成了 GitHub 历史上涨星最快的项目之一。

它的想法很直接:给 AI 一个长期目标,让它自己循环拆解、执行、验证,直到干完。

目标:「帮我建一个能自动发推文的账号」
→ 子任务 1:注册推特开发者账号
→ 子任务 2:研究推特接口限制
→ 子任务 3:写发帖代码
→ 子任务 4:测试
→ ...

大部分时候,AutoGPT 在转圈。

它陷入无限循环、输出无关内容、子任务越拆越碎,永远收不了尾。同期还有个更激进的 BabyAGI,表现也差不多。

为什么失败?当时的 GPT-3.5 和 GPT-4 早期版本,在循环里缺少「判断当前结果够不够好、该不该停」的能力。智能体的瓶颈在控制系统,不在智力,循环里没人做质量把关。

AutoGPT 的历史意义有两层。它证明了智能体这个概念跑得通,也告诉所有人,纯「自主循环」上了真实场景就不够可靠。这个教训直接催生了后面所有「可控智能体」框架。

第三阶段:函数调用让工具调用变成标准(2023 年中)

2023 年 6 月,OpenAI 给 GPT-3.5-turbo 和 GPT-4 加了函数调用能力。

这是智能体发展史上最关键的一个基础设施决策。

在此之前,想让 AI 调工具得靠一堆提示词工程。引导 AI 输出一段格式化文本,再用代码解析,再调用。不稳定、不可靠、不标准。

函数调用让模型直接输出结构化的 JSON:

{
  "name": "get_weather",
  "arguments": {
    "city": "北京",
    "unit": "celsius"
  }
}

开发者拿到这个 JSON,去调真实的天气接口,把结果塞回模型。整个流程可预测、可调试、能上生产。

Anthropic 随后跟进,Claude 3 系列推出了工具使用。Google 在 Gemini 上也做了类似能力。

函数调用把「AI 调工具」从实验室技巧变成了工程标准。从这一刻起,凡是有接口的软件,原则上都能被智能体操作。

同期爆发的 LangChain 生态正好吃到这波红利。一套链式编排框架,几百个预集成的工具包,开发者能快速搭出智能体原型。到 2023 年底,LangChain 已经是人工智能工程师的默认工具箱。

第四阶段:多智能体协作与 MCP 协议(2024)

单个智能体的上限,是一个啥都会但容易过载的人。多智能体的思路是让不同智能体各管一摊,像团队一样配合。

MetaGPT 来自清华团队,把软件开发流程映射成智能体角色。产品经理智能体写需求文档,架构师智能体设计系统,工程师智能体写代码,测试智能体验收。角色分工之后,复杂任务的成功率提升了不少。

AutoGen 来自微软,用的是更灵活的双智能体架构。用户代理和助手代理来回对话,人可以在任意环节插进去。

CrewAI 上手容易,适合快速搭原型,定制性弱一些。

同年 11 月,Anthropic 开源了 MCP(模型上下文协议)。

MCP 的定位是智能体工具调用的 USB 标准。

在 MCP 之前,每个框架都有自己的工具接入方式。LangChain 一套,OpenAI 一套,互不兼容。MCP 提供了一套标准接口,任何支持 MCP 的智能体,可以直接用任何 MCP 服务器提供的工具,不用重新适配。

2025 年 MCP 生态爆炸式增长。GitHub、Slack、Jira、Notion、数据库,超过 100 个主流工具发布了官方 MCP 服务器,开源社区贡献的更多,有数千个。

MCP 出来之后,智能体的工具边界第一次开始消失。

第五阶段:电脑操作与深度智能体(2024 年末 - 2025)

2024 年 10 月,Anthropic 发布了 Claude 3.5 Sonnet 的电脑操作功能。

这是一次质的跃迁。

之前的工具调用都依赖接口。软件必须有接口,智能体才能操作它。全球绝大多数遗留软件没有接口,智能体根本碰不到。

电脑操作让 Claude 直接看截图、移鼠标、点按钮、敲键盘。任何有界面的软件,不管有没有接口,Claude 都能像人一样操作。

这意味着,全球所有软件,原则上都成了智能体可以操作的工具。

同期上线的 Claude Code,是面向开发者的深度智能体。它能读整个代码库、写代码、跑测试、修 bug、提合并请求。它做的事已经超出「帮你写代码片段」的范畴,更像是作为真实开发者参与你的项目。

OpenAI 在 2025 年初推出了 Operator,一个能自主在浏览器里完成多步任务的智能体。订餐厅、填表单、下订单,不需要用户每一步都介入。

OpenAI 的 Agents SDK 也在同年发布,是 Swarm 实验项目的生产版本,提供四个核心原语:智能体、移交、护栏、追踪。

这一阶段最明显的变化是智能体开始有了全局视野。它已经走出对话框,能在你的电脑和服务器上持续运行、完成真实工作,是个不折不扣的数字员工。

第六阶段:自我进化智能体(2025 - 2026)

2026 年的新主题:智能体开始维护自己。

Hermes Agent(NousResearch 出品)的核心命题就是这样。智能体不只执行任务,每次任务结束后会自动反思,把有价值的经验写成「技能文件」,下次遇到相似问题时直接调用。

Hermes Agent v0.12.0 的自主管家功能把这个逻辑又推了一步。系统后台每 7 天自动跑一次,对技能库做评分、整合、清理。用户不用管,智能体自己保持整洁高效。

同期,Google 推出了 A2A(智能体间通信协议),由 Linux 基金会管理,150 多家组织加入。A2A 解决的是:不同框架的智能体怎么互相发现、委托任务、协作完成。如果说 MCP 是智能体和工具之间的 USB 接口,A2A 就是智能体之间的共同语言。

这一阶段的核心特征:智能体从「执行者」变成了「系统组件」,一个能自我维护、能和其他智能体协作、能持续学习的实体。

三、各家路线:一张全景地图

OpenAI:开发者生态优先

OpenAI 的智能体路线,是从产品出发,往平台进化。

时间 里程碑
2023.06 函数调用,奠定工具调用标准
2023.11 GPTs 商店,把智能体带给普通用户
2025 Q1 Agents SDK(Swarm 继任),四原语框架
2025 Q1 Operator,浏览器自主智能体产品
2025 Q4 AgentKit,全生命周期开发套件
2026.04 Agents SDK 大更新:9 个沙箱提供商、Codex 工具集成

OpenAI 的策略是先占领开发者的脑子,再建生态护城河。目前它拥有最大的开发者社区和最成熟的应用生态。缺点也明显,Assistants API 代表的旧路线快退役了(2026 年 8 月),给不少开发者添了麻烦,框架变动也频繁。

主打产品:ChatGPT(消费级)、Operator(浏览器智能体)、Agents SDK(开发者)

Anthropic:安全、能力、协议三管齐下

Anthropic 的特点是:每次发布都比同行慢半步,但质量更高,也更强调安全。

时间 里程碑
2024.05 Claude 3 工具使用,高质量工具调用
2024.10 电脑操作,操作任意软件界面
2024.11 开源 MCP,建立工具连接标准
2025 下半年 Claude Code SDK 更名为 Claude Agent SDK
2026.04 Claude 托管智能体公测:沙箱、检查点、凭证隔离

Anthropic 最聪明的一步是开源 MCP。用一个开放标准把生态建起来,让工具集成商都朝着它的规格做开发,形成网络效应。MCP 事实上已经是业界标准。

定位:推理质量加安全边界加企业合规。法律、金融、医疗、政府这些行业是它的主场。

Google:企业基础设施加多模型战略

Google 在智能体赛道的独特优势是垂直整合。从模型(Gemini)到开发框架(ADK)到托管运行时(Vertex AI Agent Engine)到企业前台(Gemini Enterprise),一条龙。

时间 里程碑
2025.04 ADK(智能体开发套件)发布
2025 Q3 Gemini 2.0 + Astra 多模态感知
2025.10 Gemini Enterprise,企业智能体舰队管理
2025 A2A 协议,智能体间通信标准
2026 Vertex AI Agent Engine,托管智能体运行时

ADK 的设计思路和 OpenAI、Anthropic 不一样。它把多智能体系统当第一公民,单个智能体反而排在后面。语言上支持 Python、TypeScript、Go、Java,面向企业多语言团队。

A2A 协议的意义不在眼前。MCP 解决的是「一个智能体怎么用工具」,A2A 解决的是「一群智能体怎么协同工作」。

定位:企业级智能体基础设施,和 Google Workspace 深度整合。

微软:从 AutoGen 到企业 AI 平台

微软通过对 OpenAI 的战略投资(估值 1570 亿美元,占股约 30%),直接在产品层面整合了 GPT 能力。它自己的独立贡献主要有几块:

  • AutoGen(2023):双代理对话框架,专注代码生成和软件开发自动化
  • Magentic-One(2024):五个预设智能体的通用任务框架
  • 微软智能体框架(2025):AutoGen 的生产化继任,和 Azure AI Studio 深度整合
  • GitHub Copilot:目前落地最广的编程智能体,月活开发者超过 1500 万

微软的策略很务实:模型那摊它不掺和,专攻场景。把智能体能力嵌进 Office 365、GitHub、Teams、Azure,靠已有的企业客户基础快速落地。

开源阵营:从 LangChain 到自托管智能体

框架 特点 当前地位
LangChain(2022) 链式编排,工具包最丰富 原型开发标配,生产中被 LangGraph 取代
LangGraph(2024) 有向图状态机,生产级可靠 企业生产首选之一
CrewAI 角色驱动多智能体,极易上手 快速原型、教学演示
AutoGPT(进化后) 目标导向自主智能体,更可控 社区活跃但非主流生产框架
Hermes Agent 持久记忆、技能自进化、多消息平台、自托管 2026 年自托管首选,12.7 万星标
OpenClaw 模型无关、多渠道、ClawHub 社区 开源社区生态最活跃之一

Hermes Agent 和 OpenClaw 的出现,标志着开源智能体进入了「生产可用」阶段。持久记忆、多平台接入、技能系统、数据本地化,都是面向真实长期使用场景设计的,不再是实验框架。

四、技术架构:四个核心问题

记忆系统:智能体的长期脊柱

智能体记忆分四个层次:

  1. 上下文内记忆:当前对话窗口里的内容。速度最快,但有上限,就算把上下文窗口开到 100 万 token 也会满,关了窗口就没了。
  2. 外部记忆:向量数据库加检索。能装海量知识,但检索相关性是命门,质量不太稳定。
  3. 文件系统记忆:结构化存到 SQLite、JSON 或 Markdown 文件里。Hermes Agent 的技能文件就是这一类,可读、可编辑、可移植。
  4. 模型微调:把知识烧进权重。成本最高、最持久,更新也最慢。

生产级智能体通常用第二层加第三层的组合。向量检索覆盖大量知识,文件系统存放个人偏好和可复用技能。

工具调用:从函数调用到 MCP

工具调用的演进路径:

早期提示词工程(不稳定)
→ 函数调用 JSON(2023,结构化但各家私有)
→ MCP 服务器(2024,开放标准,一次实现到处用)
→ A2A(2025,智能体之间的协作协议)

MCP 之后,工具生态的建设成本下降了一大截。开发者实现一次 MCP 服务器,所有支持 MCP 的智能体都能用。2025 年 MCP 服务器数量从零涨到几千个,就是这个原因。

规划机制:从思维链到行动链

思维链是 2022 年谷歌的论文提出来的,让模型先输出中间推理步骤。o1 系列把它内化成了训练目标。

行动链是 2026 年的新范式。智能体不只思考,还主动探索。不确定某个工具怎么用,先发起低风险的实验去推断接口行为,再执行主任务。

这是一种元认知能力。智能体知道自己不知道,会主动去验证,不瞎猜。

多智能体协调

单个智能体的局限在认知负载。任务复杂到一定程度,一个上下文窗口装不下所有信息,可靠性断崖式下降。

多智能体的核心设计模式有三种:

  • 分层架构:编排智能体负责规划和分配,子智能体负责执行具体子任务
  • 专家智能体网络:每个智能体专精一个领域,代码、数据、通信、文件管理分开
  • 检查点加人工介入:在关键决策点暂停,等人类审批,再继续

2026 年 4 月,Anthropic(Claude 托管智能体)和 OpenAI(Agents SDK 大更新)在同一周发布了几乎相同的多智能体基础设施架构。这是行业收敛的信号。智能体到底该怎么搭,头部厂商已经达成共识。

五、2026 年的现状:哪里还在打架

已经收敛的部分

  • 工具调用标准:MCP 事实胜出,OpenAI、Google、微软都已支持
  • 单智能体架构:控制面和计算面分离,带检查点的沙箱执行,已成标配
  • 记忆系统:短期靠上下文,长期靠向量库或文件,组合方案基本固定

仍在争夺的部分

  • 智能体间通信协议:A2A(Google 和 Linux 基金会)对各家私有实现
  • 自主权边界:多少自主权算合理?出了问题谁负责?
  • 本地还是云端:Hermes、OpenClaw 等自托管路线对 OpenAI、Anthropic 的托管路线
  • 智能体操作系统:下一个战场,智能体会不会取代部分操作系统层的调度功能

六、未来方向

智能体操作系统:下一代操作系统的候选

2026 年 4 月,ColaOS 提出了更激进的概念。传统操作系统调度 CPU、内存、输入输出;智能体操作系统调度的是智能体、工具调用和人机交互。

它不替代操作系统。它在操作系统上面多跑一层,你的所有数字任务,都经过这个智能体层来路由和执行。

早期信号已经出现。苹果的智能功能深度整合 Gemini(Google 拿了 10 亿美元的合作),Siri 从「语音助手」往「智能体前台」转型。你和 AI 的交互界面,可能从「应用」变成「智能体」。

分布式主权智能体

当前智能体有个核心矛盾:你希望它越聪明、越能干,但越聪明越能干,意味着更多数据流向云端,更多隐私风险。

未来的方向是决策和执行解耦。

决策层在本地运行,用轻量模型加规则,处理隐私数据,做访问控制。执行层调用云端大模型完成需要强推理的部分,但只传脱敏后的任务描述。

Hermes Agent 的「数据留在你的服务器」路线,就是这个方向的早期形态。

自我进化:从规则到主动

目前 Hermes Agent 的自主管家是规则驱动的技能管理:清理、整合、评分。

下一步是意图驱动的自我进化。智能体根据主人的长期目标,主动识别自己的短板,设计实验,优化自身的技能库和行为模式。

这有点像强化学习,但发生在智能体层,比模型层成本更低、周期更短、也更贴近具体用户的场景。

已经有早期实验把遗传算法用在提示优化上。智能体自动测试不同的提示写法,留下效果最好的。这个过程本身也是一个 ReAct 循环。

结语

从 2022 年的 ReAct 论文,到 2026 年的自主管家,智能体的每一次演进,都是在让那个最基础的循环更完整、更可靠、更自动化:

观察世界 → 思考 → 采取行动 → 看结果 → 调整 → 再观察

这个循环就是智能的本质,人类如此,AI 也如此。

区别只在于,现在的智能体,第一次开始有能力自己维护这个循环了。

参考资料:OpenAI Agents SDK 文档、Anthropic MCP 官方文档、Google ADK 文档、Hermes Agent GitHub 仓库、ReAct 原论文。

常见问题(FAQ)

AI Agent和普通AI助手到底有什么区别?

普通AI助手需逐步指令,你在前面拉它在后面跟;智能体只需给目标,自己拆任务、调工具、处理报错、交付结果,从被动跟随变为主动行动,整个玩法都变了。

AI Agent的六个演进阶段分别是什么?

一、ReAct诞生(2022);二、AutoGPT的疯狂实验(2023初);三、函数调用成为标准(2023中);四、多智能体协作与MCP协议(2024);五、电脑操作与深度智能体(2024末-2025);六、自我进化智能体(2025-2026)。

MCP和A2A协议有什么区别?

MCP是智能体与工具之间的USB标准,解决工具调用一致性问题;A2A是智能体之间的通信协议,解决跨框架智能体互相发现、委托任务、协作。MCP管工具,A2A管智能体间协作,两者互补。

Roger深圳
本文由 Roger 审核,最后更新于 2026年8月8日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。