GEOZ

Claude Opus 4和Sonnet 4发布:2026年AI编码与推理新标杆

2026/3/3
Claude Opus 4和Sonnet 4发布:2026年AI编码与推理新标杆
Anthropic推出Claude Opus 4与Claude Sonnet 4,凭借扩展思考、并行工具调用及记忆功能,在编码、高级推理与AI智能体领域树立新标杆。

今天,Anthropic 发布了其旗舰 AI 模型的新一代产品:Claude Opus 4Claude Sonnet 4。这些模型为编码能力、高级推理和 AI 智能体能力树立了新的标杆。

Claude Opus 4 被定位为全球顶级的编码模型,在复杂、长期运行的任务和智能体工作流中展现出持续的高性能。Claude Sonnet 4 是其前代 Claude Sonnet 3.7 的重大升级,在提供卓越编码和推理能力的同时,对用户指令的响应也更加精确。

Key Announcements and Capabilities

除了新模型,Anthropic 还宣布了几项关键的增强功能和特性。

Extended Thinking with Tool Use (Beta)

两款新模型现在都可以在扩展思考阶段使用外部工具——例如网络搜索。这使得 Claude 能够在深度推理和实际工具使用之间交替进行,显著提高了其响应的质量和准确性。

New Model Capabilities

Claude 4 模型引入了多项高级能力:

  • 并行工具执行:两款模型可以同时使用多个工具。
  • 增强的指令遵循:在遵循复杂用户指令方面精度更高。
  • 具备本地文件访问的高级记忆:当开发者授予本地文件访问权限时,模型展现出显著改进的记忆能力。它们可以提取并保存关键信息以维持上下文,并随时间积累隐性知识,从而实现更好的长期任务感知和连贯性。

Claude Code is Now Generally Available

经过成功的研究预览,Claude Code 现已全面上市。它通过以下方式扩展了开发者与 Claude 协作的方式:

  • 通过 GitHub Actions 支持后台任务。
  • 与 VS Code 和 JetBrains IDE 的原生集成,将建议的编辑直接显示在代码文件中,实现无缝结对编程。

New API Capabilities for Agent Development

  • Code Execution Tool
  • Files API

Anthropic 在其 API 上发布了四项新功能,以赋能开发者构建更强大的 AI 智能体:

  • 代码执行工具
  • MCP(模型上下文协议)连接器
  • 文件 API
  • 提示词缓存(最长一小时)

Model Availability and Pricing

Claude Opus 4 和 Sonnet 4 是混合模型,提供两种操作模式:近即时响应和用于深度推理的扩展思考。它们可通过以下方式获取:

  • Claude.ai:包含在 Pro、Max、Team 和 Enterprise 计划中。Sonnet 4 也对免费用户开放。
  • API:通过 Anthropic 的 API 直接访问。
  • 云平台:Amazon Bedrock 和 Google Cloud 的 Vertex AI。
    定价与之前的 Opus 和 Sonnet 模型保持一致:
  • Opus 4:每百万令牌 15 美元(输入)/ 每百万令牌 75 美元(输出)
  • Sonnet 4:每百万令牌 3 美元(输入)/ 每百万令牌 15 美元(输出)

Deep Dive: Claude Opus 4

  • Terminal-bench: 43.2%

Claude Opus 4 是 Anthropic 迄今为止最强大的模型,并宣称是全球最佳编码模型。它在关键基准测试中领先:

该模型专为需要集中精力、经过数千个步骤的长期运行任务而设计,能够持续工作数小时。这显著超越了所有之前的 Sonnet 模型,并极大地扩展了 AI 智能体的潜力。

Industry Validation

领先的公司已验证了 Opus 4 的能力:

  • Cursor:称其为编码领域的尖端技术,在理解复杂代码库方面实现了飞跃。
  • Replit:报告称其在跨多个文件进行复杂更改时精度更高,进步显著。
  • Block:指出这是首个在其智能体(代号 goose)的编辑和调试过程中能提升代码质量,同时保持完全性能和可靠性的模型。
  • Rakuten:通过一项要求苛刻的开源重构任务验证了其能力,该任务独立运行了 7 小时且性能稳定。
  • Cognition:强调 Opus 4 擅长解决其他模型无法应对的复杂挑战,成功处理了先前模型遗漏的关键操作。

Deep Dive: Claude Sonnet 4

Claude Sonnet 4 相比行业领先的 Sonnet 3.7 有显著改进。它在编码方面表现出色,在 SWE-bench 上达到了顶尖的 72.7%。该模型旨在为广泛的内部和外部用例平衡高性能与效率,并具有增强的可操控性,以便更好地控制实现。虽然它在大多数领域不及 Opus 4,但它提供了能力与实用性的最佳组合。

Industry Validation

主要合作伙伴报告了 Sonnet 4 的出色成果:

  • GitHub:表示 Claude Sonnet 4 在智能体场景中表现出色,将把它作为为 GitHub Copilot 中新编码智能体提供动力的模型引入。
  • Manus:强调了其在遵循复杂指令、清晰推理和美观输出方面的改进。
  • iGent:报告称 Sonnet 4 擅长自主的多功能应用开发,问题解决和代码库导航能力大幅提升——将导航错误率从 20% 降低到接近零。
  • Sourcegraph:称该模型有望实现软件开发的重大飞跃——能更长时间地保持正轨、更深入地理解问题并提供更优雅的代码质量。
  • Augment Code:报告了更高的成功率、更精准的代码编辑以及在复杂任务中更细致的工作,使其成为他们主要模型的首选。

Core Model Improvements

除了主要特性,Claude 4 系列还包括几项根本性的改进。

Reduced Shortcutting Behavior

与 Sonnet 3.7 相比,两款模型使用捷径或漏洞完成任务的可能性降低了 65%,尤其是在容易发生此类行为的智能体任务上。

Advanced Memory Capabilities

Claude Opus 4 在记忆能力方面显示出巨大改进。当应用程序提供本地文件访问权限时,Opus 4 能够熟练地创建和维护“记忆文件”来存储关键信息。这带来了更好的长期任务感知、连贯性和性能。引用的一个例子是 Opus 4 在玩《宝可梦》时创建了一个“导航指南”,以随着时间的推移改进其游戏玩法。

Thinking Summaries

对于使用扩展思考的 Claude 4 模型,Anthropic 引入了思考摘要功能。一个较小的模型会压缩冗长的思维过程,不过这种摘要仅在大约 5% 的情况下需要——大多数思维过程都足够短,可以完整显示。需要原始思维链进行高级提示词工程的用户可以联系销售部门,了解新的开发者模式以保留完全访问权限。

Getting Started with Claude 4

这些模型朝着将 AI 视为虚拟协作者的愿景迈出了重要一步——能够保持完整的上下文、持续专注于长期项目并推动变革性影响。它们经过了广泛的测试和评估,以最小化风险并最大化安全性,包括为更高级别的 AI 安全等级(如 ASL-3)实施措施。

开发者和用户今天就可以通过 Claude.aiClaude Code 或他们选择的平台开始使用。

Roger深圳
本文由 Roger 审核,最后更新于 2026年7月2日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。