GEOZ

本页面汇总了各大AI模型在ARC-AGI-2、AIME 20

2026/8/21
本页面汇总了各大AI模型在ARC-AGI-2、AIME 20

AIAI Summary (BLUF)

本页面汇总了各大AI模型在ARC-AGI-2、AIME 2025、SWE-bench Verified等主流评测上的实时排名,支持按综合、数学、编程、Agent维度筛选。其中综合排名参考AA Intelligence Index与LMArena两个榜单,兼顾客观基准与用户偏好;近期排名变化板块展示了代码与Agent能力的升降趋势,并附有可对比多个模型的详细表格。

核心洞察

先说结论:翻完整个榜单,最扎眼的是 Anthropic 的 Claude 系列在前二十名里占了七席。Claude Opus 5 在 ARC-AGI-2 上直接干到 90.4%,是目前唯一一个冲破 90 的模型。开源这边 Kimi K2.6 排到第 15,GLM-5 和 Qwen3.5 也都在榜,但一看 FrontierMath 的分数,GLM-5 只有 2.1,Kimi K2.5 是 4.2,跟闭源头部差得还远。

这个页面聚合了 ARC-AGI-2、AIME 2025SWE-bench Verified 等主流评测的实时排名,可以按综合、数学、编程、Agent 等维度筛选。数据更新于 2026 年 8 月 16 日。

核心结论

  1. Anthropic Claude 系列在 HLE 排序的前 20 名中占 7 席;AA 智能指数前十名中 Anthropic 占 4 席,其中 Claude Opus 5(max)与 Claude Opus 5(xhigh)同以 63 分并列第一,Claude Fable 5 以 62 分排第三。

  2. 在 ARC-AGI-2 上,Claude Opus 5 得分 90.4%,是目前唯一超过 90 分的模型;第二高的 GPT-5.5 为 85.0%,差距达 5.4 个百分点。

  3. FrontierMath Tier 4 最高分为 GPT-5.5 Pro 的 39.6%,大部分模型不到 20;开源模型中 Kimi K2.5(4.2)和 GLM-5(2.1)与闭源头部差距明显。

  4. LMArena 文本生成榜前十名中,非 Anthropic 的模型只有 Meta(muse-spark-1.2,第 4)、阿里(第 8)和 Google(gemini-3.7-flash-high,第 9)三家;榜首是 Claude Fable 5,Elo 1506。

  5. Agent 能力榜近 30 天排名变化中,Kimi K3 新上榜即排第 3(84.8 分),Qwen3.8-27B 新上榜排第 4(84.3 分),GPT-5 升至第 5(84 分)。

综合排名

AI 模型现在没有一个公认的"综合排名"。各家评测口径差太多,硬凑一个总分反而误导人。这里选了两种角度不同的榜单并列着看。

AA 智能指数把编程、数学、推理等 10 项标准评测的成绩汇总成一个分数,衡量客观能力。LMArena(原来的 Chatbot Arena)靠全球用户匿名盲测 A/B 投票算 Elo,反映的是真实使用体感。

AA Intelligence Index

这个榜汇总了编程、数学、科学、推理、智能体等 10 项标准化评测,数据更新到 2026 年 8 月 18 日。

前三名全是 Anthropic:Claude Opus 5(max)和 Claude Opus 5(xhigh)同分 63,Claude Fable 5 拿 62 排在第三。61 分这档有三家,OpenAI、xAI 和 Anthropic 各占一个位置。Moonshot 的模型 60 分排第七,第八到第十名落在 59 到 58 分,分别来自 OpenAI、Anthropic 和阿里。

整个前十名,Anthropic 一家占了四席。

LMArena Text Generation

这个榜的分数来自真人匿名 A/B 投票,数据更新到 8 月 12 日。

第一名是 Claude Fable 5,Elo 1506。claude-opus-4-6-high 和 claude-opus-4-7-high 以 1505、1502 跟在后面。Meta 的 muse-spark-1.2(xHigh)排第四,1498,是前十名里唯一非 Anthropic 的模型。第五到第七名又是 Claude 系列,分数从 1497 到 1493。第八是阿里系的模型,1491。gemini-3.7-flash-high 排第九,1490。第十还是 Anthropic,1489。

前十名里,只有 Meta、阿里和 Google 三家非 Anthropic 的模型挤了进来。

近期排名变化

代码和 Agent 榜单近 30 天的排名上升、下降与新上榜模型。

代码能力

Google 的 Gemma 4 系列这波数据更新很猛,四款模型集体进了榜单。Gemma 4 31B 排第 6,分数 1115,是这波里最高的。26B A4B 排第 8,897.55。E4B 和 E2B 分别排第 13 和第 15。

OpenAI o3-mini 上升 1 位到第 7,1056.9。Qwen3-32B 和 Qwen3.5-27B 各升 2 位,排第 9 和第 10。DeepSeek V3.2 正式版也在上升,排第 11,530.7。

Agent 能力

Kimi K3 新上榜直接排到第 3,84.8 分。Qwen3.8-27B 也是新上榜,84.3 排第 4。GPT-5 升两位到第 5,84 分。Claude Opus 4.8、Gemini 3.6 Flash、Grok 4.1 Fast 都是升两位,分别排第 6 到第 8。Qwen3-Max-Thinking 和 OpenAI GPT-5.2 也各升两位,排第 9 和第 10。

想看完整动态可以去大模型动态页面。

单项评测排名

这里按 HLE 排序,列出各基准的最高得分。HLE 是现在难度最高的推理基准之一,ARC-AGI-2 测的是抽象推理,FrontierMath Tier 4 是数学硬核题,SWE-bench Verified 是真实 GitHub issue 的代码修补,τ²-Bench 测的是 Agent 工具调用。分数来自 DataLearnerAI,表中是各评测模式中的最高得分。点击任意行可以查看模型详情,勾选左侧能对比最多 4 个模型。

排名 模型 HLE ARC-AGI-2 FrontierMath SWE-bench τ²-Bench 开源
1 Claude Mythos Preview 64.70 93.90 闭源
2 Claude Opus 5 64.70 90.40 96.00 闭源
3 GLM-5.3 62.50
4 Muse Spark 1.1 62.10 闭源
5 Claude Fable 5 59.00 95.00 闭源
6 GPT-5.4 Pro 58.70 83.30 38.00 闭源
7 Muse Spark 58.00 42.50 14.60 77.40 闭源
8 Claude Opus 4.8 57.90 88.60 闭源
9 Claude Sonnet 5 57.40 85.20 闭源
10 GPT-5.5 Pro 57.20 84.60 39.60 闭源
11 Qwen3.8-Max 56.20 免费商用
12 Kimi K3 56.00 免费商用
13 Opus 4.7 54.70 75.80 22.90 87.60 闭源
14 GLM-5.2 54.70 免费商用
15 Kimi K2.6 54.00 80.20 免费商用
16 Qwen3.7 Max 53.50 80.40 闭源
17 Hy3 53.20 78.00 免费商用
18 Claude Opus 4.6 53.00 66.30 22.90 80.84 91.89 闭源
19 GLM 5.1 52.30 免费商用
20 GPT-5.5 52.20 85.00 35.40 闭源

几个值得留意的点。ARC-AGI-2 上 Claude Opus 5 的 90.40 是独一档,排第二的 GPT-5.5 是 85.00,差距有 5 个多点。另一头,GLM-5 在这项上只有 4.90,说明这个基准对某些模型的推理方式特别不友好。

FrontierMath Tier 4 全场最高是 GPT-5.5 Pro 的 39.60,大部分模型连 20 都上不去。开源模型里 Kimi K2.5 的 4.20 和 GLM-5 的 2.10 算比较能看的,但跟闭源头部差距明显。

τ²-Bench 已收录的数据里,最高分是 Claude Opus 4.6 的 91.89,后面跟着 Gemini 3.1 Pro 的 90.80、Gemini 3.0 Flash 的 90.20。GLM-5 以 89.70 排在开源第一。

完整榜单可以按数学、编程、Agent 等分类查看,也可以直接进分类排行榜。

排行榜常见问题

数据从哪来?

所有得分都来自一手出处。官方模型卡、技术报告、论文、厂商博客,还有可复现的第三方评测。每一行都链回了对应的模型详情页,原始引用可以逐个点开查。

为什么同一模型在不同基准上分数差异很大?

每个基准测的能力不一样。HLE 和 ARC-AGI-2 偏推理,AIME 和 FrontierMath 考数学,SWE-bench Verified 是改代码,τ²-Bench 是 Agent 工具调用。模型在某一项上专门优化过,别的能力就会让路。所以排行榜按基准分开展示,不合并成一个分。

多久更新一次?

数据每 5 分钟自动重新校验一次,新模型或新评测结果公开后同步收录。页面顶部的"数据更新于"就是最近一次刷新时间。

综合排名怎么解读?

综合榜聚合了模型在多个核心基准上的位次,拿来初筛还行。真要落地选型,去翻跟业务最相关的单项基准。比如代码智能体看 SWE-bench Verified,工具调用场景看 τ²-Bench。

开源和闭源怎么对比?

用"许可"筛选切到"全部",开源和闭源模型就能在同一列里直接比。除了分数还要算总持有成本。闭源按 API 用量计费,开源得自己掂量硬件和运维。


截至 2026 年 8 月,AA 智能指数前列是 Claude Opus 5(max)、Claude Opus 5(xhigh)、Claude Fable 5,这个指数汇总了编程、推理、科学等 10 项标准化评测。LMArena 文本生成榜靠前的是 Claude Fable 5、claude-opus-4-6-high、claude-opus-4-7-high,排名基于真人匿名 A/B 投票。数据口径说明可以查看数据方法论,延伸阅读可以看大模型分析博客。

知名模型开发商

页面收录了 100 家模型开发商,每家都有自己的主页,可以查看其全部模型、系列和产品线。今日推荐每天轮换,用来发现更多机构。

探索更多

排行榜只覆盖参与评测的模型。如果想看更全的内容,可以按模型、机构或评测基准浏览。

常见问题(FAQ)

哪个模型在ARC-AGI-2上得分最高?

Claude Opus 5以90.4%的得分排名第一,是唯一突破90分的模型。第二名的GPT-5.5得分85.0,差距明显。数据来自DataLearnerAI。

为什么同一模型在不同基准评测中分数差异很大?

因为各基准考察的能力不同。HLE和ARC-AGI-2偏推理,AIME和FrontierMath考数学,SWE-bench验证代码修复,τ²-Bench评估Agent工具调用。模型常针对特定任务优化,导致其他项分数偏低。

开源模型和闭源模型差距有多大?

在FrontierMath Tier 4上,开源最强的Kimi K2.5仅得4.2,而闭源的GPT-5.5 Pro高达39.6。但在τ²-Bench上,开源GLM-5以89.7分排在开源第一,接近闭源头部。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年8月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。