GEOZ

如何用Google Skills解决AI提示膨胀?2026年智能体工作流优化方案

2026/4/26
如何用Google Skills解决AI提示膨胀?2026年智能体工作流优化方案
Google Skills通过引入可复用、动态加载的专家知识单元(Skills),有效解决提示膨胀问题,统一Gemini Enterprise、Agents CLI与AI Edge Gallery三大平台的代理工作流,使Skills成为可移植的认知容器(即“提示的Docker”)。

Agent Skills Adoption

提示膨胀有了名字和解决方案。技能(Skills)现已成为谷歌智能体堆栈中的承重构件:从设备端的 Gemma 4 到企业级 Gemini,从编码助手到官方云仓库。

通常,一切都源于良好的初衷。

团队构建了一个智能体。它大致能工作,直到它遗漏了命名约定或忽略了审批流程。于是,你在系统提示中添加了一段话。然后又加了一段处理边缘情况。接着又加了三条用于利益相关者规则。

半年后,提示词变成了一个 4000 词的庞然大物。没人知道哪些内容仍然相关,但每个人都害怕去改动它。智能体现在比只有 200 词指令时更慢、更不可靠。每一次“修复”都可能导致回归。

这就是提示膨胀的现实:企业 AI 中沉默的技术债务。

两年来,这一直是企业智能体的瓶颈。我最近与一位管理着 100 多个生产环境技能(Skills)的从业者交谈过;他们描述了一个营销审计员,每次调用都要加载 15,000 个 token 的指令。这几乎没给实际审计内容留下上下文窗口。智能体“能工作”,但它被自己的指令淹没了。由于推理税过高,输出质量平平。

在 Google Cloud Next ’26 上,谷歌将解决方案产品化:技能(Skills)

核心论点在于,技能是智能体工作流的“已定稿”抽象。它们占据了关键的中间地带:

优于提示词: 因为它们可复用且持久。
轻于微调: 因为它们能以业务逻辑的速度迭代。
比 RAG 更智能: 因为它们是主动的专业知识,而不仅仅是被动检索。
比工具更丰富: 因为它们编码了“如何做”和“为什么做”,而不仅仅是“做”。

技能是小型的、命名的、动态加载的专业知识单元。随着谷歌在三个不同的表面上发布技能,业界关于如何称呼这种模式的争论已经结束。真正的问题开始了:谁负责管理你的技能?

Aspect Description Key Advantage
Better than Prompts Reusable and persistent Eliminates monolithic prompt bloat
Lighter than Fine-tuning Iterates at business logic speed No costly model retraining
Smarter than RAG Active expertise, not passive retrieval Encodes reasoning and process
Richer than Tools Encodes "how" and "why", not just "do" Full instruction context for tasks

The Pattern: How Google Embeds Open Abstractions

模式:谷歌如何嵌入开放抽象

谷歌的发布策略遵循一致的**“采用飞轮”**:观察开发者社区独立构建的抽象,采用开放标准,并将其作为一级原语嵌入整个技术栈。

识别这一模式能准确告诉你该在何处投入时间:

MCP(模型上下文协议)。 Anthropic 发布了模型上下文协议,作为连接智能体与外部工具和数据源的轻量级标准。谷歌的回应不是构建竞争标准。几个月内,托管 MCP 服务器就已在 Cloud Run、BigQuery、AlloyDB、Cloud SQL 以及整个 Workspace 套件中推出。谷歌采用了该标准并围绕其构建了基础设施。

A2A(智能体间协议)。 谷歌共同撰写了用于跨智能体通信的智能体间协议,随后将治理权交给了 Linux 基金会的 Agentic AI Foundation,而非保持专有。目前已有 150 个组织在生产环境中使用。

技能。 生态系统独立发现智能体需要可加载的专业知识。谷歌将其产品化,保留了开放的 agentskills.io 名称,并把它从“边栏功能”提升为“承重”基础设施。

实际含义: 当谷歌采用开放抽象时,格式会稳定下来,但复杂性会发生转移。你可以停止担心文件格式,转而开始担心治理。投资于抽象本身,而非特定供应商的实现。

Three Surfaces Where Skills Have Now Shipped

技能已发布的三个表面

1. Gemini Enterprise: Skills as a First-Class Product Feature

1. Gemini Enterprise:技能作为一级产品特性

Gemini Enterprise 中技能的发布标志着从“线性上下文加载”到“动态技能调度”的转变。

大型系统提示的技术代价是“中间迷失”现象。当无关指令充斥上下文窗口时,推理能力会下降。模型将其“认知开销”中的大部分用于解析提示,以至于几乎没有剩余能力来处理实际任务。

技能通过渐进式披露在三个阶段解决这一问题:

发现: 智能体通过最小的元数据足迹知道该技能的存在。
激活: 只有当任务需要该特定专业知识时,才加载完整的指令。
执行: 智能体按照结构化的 Markdown 和模板完成工作。

通过将推理预算保留给任务而非指令,你可以在每次调用时不付出上下文代价,从而获得深度专业化智能体的广度。

对于企业团队来说,技能不是孤立的功能;它们是一致运营模型的一部分。它们与 Agent Designer、安全执行沙箱以及用于监控活动的中央 Inbox 并列。这是谷歌提供在组织规模上管理智能体的基础设施,而不仅仅是构建更好的聊天机器人。

2. Agents CLI: Skills for Your Coding Assistant

2. Agents CLI:为你的编码助手配备技能

第二个表面是工程实际发生的地方:终端和他们的编码助手。Google ADK 的资深开发者关系经理 Polong Lin 将 Agents CLI 定位为炫酷演示与生产就绪 AI 工作力量之间的桥梁。它处于预发布(pre-GA)阶段,现已可用:

# Preferred: uvx handles an ephemeral environment
uvx google-agents-cli setup 

# Alternative: install specific skills 
npx skills add google/agents-cli

Agents CLI 将 Claude Code 或 Gemini CLI 等助手转变为 ADK 专家。发布时,七个“工作流技能”开箱即用,处理端到端的开发生命周期:

Skill Purpose Key Benefit
Scaffold Generate ADK project structure Standardized conventions
Build Compile and test agent code Fast iteration
Deploy Push to Cloud Run or Vertex AI One-command deployment
Monitor View logs and metrics Real-time observability
Test Run regression suites Confidence in changes
Document Generate documentation from code Living documentation
Configure Manage environment and secrets Secure by default

这在实践中意味着:当你在 Claude Code 中调用 google-agents-cli-scaffold 时,你的编码助手会加载一个技能,该技能携带了谷歌关于 ADK 项目结构、组件命名和集成模式的约定。它不需要猜测或幻觉 ADK 特定的习惯用法。专业知识已编码在技能中。技能立即生效。

更耗时的是纪律:知道何时编写自定义技能,何时扩展系统提示,并在团队中就这一界线达成一致。

然而,真正的突破是官方 Agent Skills 仓库:github.com/google/skills。发布时包含 13 个技能,涵盖最常用的 Google Cloud 产品和架构关注点:

Category Skills Key Focus
Product Skills AlloyDB, BigQuery, Cloud Run, Cloud SQL, Firebase, Gemini API, GKE Direct service integration
Well-Architected Pillar Skills Security, Reliability, Cost Optimisation Architectural best practices
Recipe Skills Authentication, Onboarding, Network Observability Common implementation patterns
npx skills install github.com/google/skills

这些是面向智能体的文档:紧凑、扎实的专业知识,专为智能体阅读而编写,而非人类。准确的终端命令。没有幻觉的 API 调用。没有过时的 SDK 语法。Well-Architected Pillar 技能尤其值得注意:它们将谷歌的架构判断编码为可加载的专业知识,而不是没人读的 200 页 PDF。

第三个表面是最出乎意料的,也是最能揭示未来方向的地方。

Google AI Edge Gallery(可在 iOS 和 Android 上使用)允许你构建和实验完全在设备上运行的 AI 体验。在 Next ’26 上,谷歌宣布推出 Agent Skills:这是首批完全在设备上运行多步骤、自主智能体工作流的应用之一。由 Gemma 4 驱动,Agent Skills 可以增强知识库,使 Gemma 4 能够通过技能访问其初始训练数据之外的信息。

Gemma 4 边缘变体(E2B 和 E4B)在中端到旗舰设备上以低于 1.5GB 的 RAM 运行。LiteRT-LM 运行时在三秒内处理跨越两个 Agent Skills 的 4,000 个 token。模型自主决定调用哪些可用工具、按什么顺序调用,并完全在设备上组合响应。

这里的关键细节是格式。驱动 Gallery 的技能不是谷歌专有文件,而是来自 agentskills.io 的 SKILL.md 格式。

这为企业带来了巨大的架构意义。你可以在手机上构建自定义技能,离线测试,然后将完全相同的文件部署到 Vertex AI 上云端托管的 Gemini 3.1 实例。技能已成为认知的可移植容器:“提示词的 Docker。” 目前没有其他技术栈提供这条路径。

The Convergence: This Is Not Coincidence

汇聚:这不是巧合

三个表面。同一个抽象的三种实现。而底层格式正在收敛于最初源自 Anthropic 的某种东西。当你在 Web 应用、CLI 工具和移动运行时上同时看到相同的抽象发布时,它不再只是一个“功能”。它是一个协议。

第二天的开发者主题演讲演示使用 ADK、MCP 服务器和 Agent Runtime 构建了一个规划智能体,并用三个词描述了智能体所需的东西:指令、技能和工具

Agent Registry 强化了这一点。Agent Registry 维护着一个经过审批的工具中心库,索引每一个内部智能体、工具和技能。这是治理基础设施,而不仅仅是目录。当技能被 Agent Registry 索引时,我之前提出的“哪个技能被加载了?”的问责问题在平台层面有了具体答案。

了解技能在 2026 年智能体技术栈中相对于其他层的位置也有帮助:

Layer Problem Solved Key Component
Tools Mechanical execution MCP servers, APIs
Data Passive retrieval RAG, vector stores
Skills Logic and process Loadable expertise, instructions
Orchestration Agent coordination A2A, Agent Runtime
Governance Compliance and oversight Agent Registry, Inbox

每一层解决不同的问题。大多数企业团队犯的错误是试图用更多的 RAG(更多数据)来解决技能(逻辑和流程)问题。谷歌在这三个表面上的实现迫使形成一种急需的纪律:保持工具机械化、数据可访问、专业知识模块化。

这就是正式标准存在之前协议收敛的样子。生态系统找到了正确的形态。然后规范随之而来。MCP 在 2024 年经历了这一过程。A2A 在 2025 年经历了这一过程。技能现在正在经历。

实际要点:无论你首先在哪个供应商表面上构建,都要投资于抽象。格式会稳定下来。今年你构建的技能目录在规范落地时不会过时。

在谷歌正式命名之前,我在《技能爆炸已至,企业治理尚未跟上》一文中写到过这一挑战的治理方面。我描述的那个时刻——开发者丢出一个 100 多个社区技能的 GitHub 链接,Slack 里冒出四十个反应表情符号——当谷歌技术栈的三个表面同时发布技能时,来得更快。

The Enterprise Reality

企业现实

过去一年,我们的核心挑战不是选择模型或框架。而是:如何使个人实验与组织标准兼容?

技术已经就绪。抽象已经确定。治理是下一个前沿。

常见问题(FAQ)

什么是 Google Skills?它解决了什么问题?

Google Skills 是可复用、动态加载的专家知识单元,解决了企业 AI 中“提示膨胀”问题,即提示词过长导致性能下降和维护困难。

Google Skills 相比传统提示词、微调和 RAG 有什么优势?

Skills 优于提示词(可复用持久),轻于微调(无需重训练),比 RAG 更智能(主动专业知识),比工具更丰富(编码“如何”和“为什么”)。

Google Skills 已在哪些产品中落地?

Skills 已集成到 Gemini Enterprise、Agents CLI 和 AI Edge Gallery 三大平台,统一了代理工作流,成为可移植的认知容器。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年7月2日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。