GPT-3.5 靠工作流反超 GPT-4:吴恩达拆解 Agentic AI 的真实威力
AIAI Summary (BLUF)
吴恩达在Snowflake峰会上提出,Agentic AI(代理式AI)通过迭代式工作流,能让较弱的模型(如GPT-3.5)在代码生成任务上超越GPT-4。文章解释了Agent与Agentic的区别,并展示了Vision Agent如何自动生成代码完成视觉任务。
核心洞察
吴恩达在 Snowflake 峰会上的这场演讲,最让我意外的是那个实验结果:GPT-3.5 配上 Agentic Workflow预先设计的多步骤流程,其中 AI 被用于完成部分环节,步骤顺序由开发者规划。,在代码生成任务上居然能超过 GPT-4。这意味着什么?你手上那个“不够聪明”的模型,可能只是没用对方法。另外一个值得琢磨的点是,吴恩达把 Agent 和 Agentic 这两个词拆开来讲,这个区分看似咬文嚼字,实际上改变了我们讨论 AI 能力的方式。
2024 年 Snowflake 峰会开发者日上,吴恩达做了一场演讲,题目叫“AI 代理工作流及其推动 AI 进展的潜力”。他抛出了一个判断:Agentic Workflow 带来的进步空间,可能比下一代基础模型还要大。
核心结论
吴恩达团队在 HumanEval由OpenAI创建的代码生成评估数据集,包含164个编程问题,用于测试模型根据问题描述生成正确代码的能力。 代码生成基准测试中发现,配备 Agentic Workflow 的 GPT-3.5 性能超过了 GPT-4,表明工作流优化比模型本身的能力提升更为关键。
吴恩达在 2024 年 Snowflake 峰会开发者日上提出判断:Agentic Workflow 带来的进步空间可能比下一代基础模型还要大。
Agentic Workflow 的核心方法是将复杂任务拆解为多个步骤并进行循环迭代优化,采用该方法的模型在 HumanEval 上普遍优于 Zero-shot 方法。
吴恩达区分了 “Agent”(名词,非黑即白)与 “Agentic”(形容词,代表自主性程度),这一区分将讨论焦点从 AI 是否具备智能转向其能表现出多少智能。
吴恩达团队开发的 Vision Agent视觉智能体,根据自然语言指令自动编写代码完成视觉任务。 通过 Coder AgentVision Agent的核心模块,负责将自然语言指令转换为可执行代码。(规划、检索工具、生成代码)与 Tester AgentVision Agent的测试模块,负责对生成的代码进行测试和评估。(执行、检查、反馈错误)协同工作,可根据自然语言指令自动完成目标检测、图像分割、视频分析等视觉任务。
从 Agent 到 Agentic,AI 的玩法变了
GPT-3、GPT-4 这些大语言模型出来之后,大家用 AI 的方式基本是这样的:你输入一个指令,模型给你一个结果。完事。这种方式吴恩达管它叫“非代理型工作流程”,说白了就是零次调用,没有迭代优化的余地。就像一个很有才华的作家,你非让他按固定模板写东西,才能根本施展不开。
Agentic AI能够自主完成复杂任务链的AI代理,是2026年的重要技术趋势。 把这个局面打破了。它不把 AI 系统当成一个被动等指令的 Agent,而是让它能主动思考、规划、执行任务。做到这一点的关键,就是“代理型工作流程”。
吴恩达说,Agentic Workflow 的核心思路是把复杂任务拆成多个步骤,然后循环迭代,一步步优化结果。这个逻辑跟人解决问题的习惯很像:
- 定目标:明确要干什么,比如“写一篇关于 Agentic AI 的文章”。
- 做规划:把任务拆开,比如“确定主题、搜集资料、撰写内容、修改润色”。
- 迭代执行:逐个执行子任务,根据反馈调整优化,直到完成目标。
基于 LLM 的智能体:Agentic Workflow 的主场
吴恩达在演讲里专门拿“基于 LLM 的智能体”举例,展示 Agentic Workflow 怎么提升 AI 系统的表现。
传统的 LLM 交互就是一次性 prompting,你给一个指令,模型出一个结果,没有迭代空间,复杂任务很难搞定。Agentic Workflow 把 LLM 当成一个智能代理,通过多轮对话和反馈机制,引导它逐步完善输出。
为了验证效果,吴恩达的团队在代码生成基准测试集 HumanEval 上做了一组实验。
结果是,性能相对较弱的 GPT-3.5,用了 Agentic Workflow 之后,代码生成性能居然超过了 GPT-4。下图是不同模型在 HumanEval 上的性能对比:
从图中可以看到,采用 Agentic Workflow 的模型(橙色点)普遍比 Zero-shot 方法表现更好。这说明 Agentic AI 在突破性能瓶颈方面确实有很大潜力。
Agentic 和 Agent:一个词的区别,认知上的跃迁
理解 Agentic AI 的时候,有个概念区别需要厘清:Agent 和 Agentic。
吴恩达在他博客里说得很到位。“Agent”是名词,非黑即白,要么是要么不是。而“Agentic”是形容词,代表一种程度。
传统的 AI 系统,比如我们熟悉的机器学习算法,大多可以归为 Agent。它们接收输入,按预设规则处理,输出结果。Agentic AI 则更进一步,它不局限于被动执行指令,而是能主动感知环境、理解目标,自主选择行动方案,表现出不同程度的自主性和智能性。
从 Agent 到 Agentic 的转变不是一夜之间发生的,它是一个渐进式的演化过程。就像机器学习从早期的线性回归走到今天的深度学习,Agentic AI 也需要不断迭代和优化,才能释放全部潜力。
更关键的是,Agentic 这个概念提出来之后,我们不再纠结 AI 系统是否真正具备“智能”,而是关注它能表现出多少“智能”。这是认知上的一个重大转变,也是 Agentic AI 跟传统 AI 的根本区别。
Agentic AI 的应用:从代码生成到视觉任务
除了代码生成,Agentic AI 在其他领域也有很大的应用空间。
Vision Agent:让 AI 看懂世界
在 Snowflake 峰会的演讲中,吴恩达还展示了他团队开发的一款视觉智能体,叫“Vision Agent”。
Vision Agent 能像一位经验丰富的程序员那样,根据用户的自然语言指令编写代码,完成各种视觉任务,比如目标检测、图像分割、视频分析等。
举个例子,用户输入“帮我找到所有带红色帽子的人”,Vision Agent 就会自动写代码,识别图像或视频里所有符合条件的目标。
Vision Agent 的工作流程是这样的:
- 接收指令:用户输入自然语言指令,比如“计算鲨鱼和最近的冲浪板之间的距离”。
- 生成代码:Vision Agent 根据指令自动生成代码,完成图像处理和分析任务。
- 执行代码:代码被执行,输出结果,比如鲨鱼和冲浪板之间的距离。
Vision Agent 的核心是一个叫“Coder Agent”的模块,负责把自然语言指令转成可执行的代码。
Coder Agent 的工作原理:
- 规划:根据指令制定计划,列出完成任务所需的步骤。
- 检索工具:为每个步骤检索所需的工具,比如图像处理函数、目标检测模型等。
- 生成代码:把计划和工具组合成可执行的代码。
为了进一步提高代码质量和可靠性,Vision Agent 还引入了一个叫“Tester Agent”的模块,负责对 Coder Agent 生成的代码进行测试和评估。
Tester Agent 的工作原理:
- 执行代码:执行 Coder Agent 生成的代码。
- 检查结果:检查代码的执行结果是否符合预期。
- 反馈错误:如果发现错误,把错误信息反馈给 Coder Agent,让它修正。
通过 Coder Agent 和 Tester Agent 的协同工作,Vision Agent 能自动生成高质量代码,完成各种视觉任务。
以下是 Vision Agent 的一些应用示例:
- 检测图像中的人脸,并判断是否佩戴口罩:
- 分析视频,识别交通事故:
吴恩达的呼吁:拥抱 Agentic AI
吴恩达认为,Agentic AI 的出现是人工智能领域的一场重大变革,它会从根本上改变我们与 AI 的交互方式,也会给人类社会带来巨大的价值。
他呼吁开发者积极拥抱 Agentic AI,探索它的应用边界,共同推动 AI 技术的发展。同时他也提醒人们关注 Agentic AI 可能带来的伦理和社会影响,比如算法偏见、隐私泄露等问题,并呼吁各界共同努力,确保 AI 技术安全可控地发展。
如何学习大模型 AI?
新岗位的生产效率优于被取代岗位的生产效率,所以整个社会的生产效率是提升的。
但具体到个人,情况是这样的:
最先掌握 AI 的人,会比晚掌握 AI 的人有竞争优势。
这句话放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年,指导过不少同行后辈,帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的 AI 大模型资料包括 AI 大模型入门学习思维导图、精品 AI 大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI 有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得“智能”的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAGRetrieval-Augmented Generation - an AI framework that combines information retrieval with language generation to produce more accurate and contextually relevant responses.
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI 相关的工作,自己也能训练 GPT 了。通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概 2 个月的时间。你已经成为了一名“AI 小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器与损失函数简介
- 小实验 2:手写一个简单的神经网络并训练它
- 什么是训练、预训练、微调、轻量化微调
- Transformer 结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目或创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在 15 天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传 CSDN,朋友们如果需要可以微信扫描下方 CSDN 官方认证二维码免费领取。
常见问题(FAQ)
Agentic AI 和传统 Agent 到底有什么区别?
吴恩达指出,Agent 是名词,非黑即白;Agentic 是形容词,代表自主性程度。传统 AI 被动执行指令,而 Agentic AI 能主动感知、规划、迭代,表现出不同程度的智能。
Agentic Workflow 如何让 GPT-3.5 在代码生成上超越 GPT-4?
Agentic Workflow 将复杂任务拆解为多步骤并循环迭代优化。在 HumanEval 测试中,GPT-3.5 结合该工作流后,代码生成性能超过了零次调用的 GPT-4,证明迭代优化能突破模型能力瓶颈。
Vision Agent 是如何自动完成视觉任务的?
Vision Agent 通过 Coder Agent 将自然语言指令转化为代码,并由 Tester Agent 测试和反馈错误,迭代优化后执行,从而自动完成目标检测、图像分割等视觉任务。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



