GEOZ

本页面汇总了各大AI模型在ARC-AGI-2、AIME 20

2026/8/21
本页面汇总了各大AI模型在ARC-AGI-2、AIME 20

AIAI Summary (BLUF)

本页面汇总了各大AI模型在ARC-AGI-2、AIME 2025、SWE-bench Verified等主流评测上的实时排名,支持按综合、数学、编程、Agent维度筛选。其中综合排名参考AA Intelligence Index与LMArena两个榜单,兼顾客观基准与用户偏好;近期排名变化板块展示了代码与Agent能力的升降趋势,并附有可对比多个模型的详细表格。

核心洞察

先说结论:翻完整个榜单,最扎眼的是 Anthropic 的 Claude 系列在前二十名里占了七席。Claude Opus 5 在 ARC-AGI-2 上直接干到 90.4%,是目前唯一一个冲破 90 的模型。开源这边 Kimi K2.6 排到第 15,GLM-5 和 Qwen3.5 也都在榜,但一看 FrontierMath 的分数,GLM-5 只有 2.1,Kimi K2.5 是 4.2,跟闭源头部差得还远。

这个页面聚合了 ARC-AGI-2、AIME 2025、SWE-bench Verified 等主流评测的实时排名,可以按综合、数学、编程、Agent 等维度筛选。数据更新于 2026 年 8 月 16 日。

核心结论

  1. Anthropic Claude 系列在 HLE 排序的前 20 名中占 7 席;AA 智能指数前十名中 Anthropic 占 4 席,其中 Claude Opus 5(max)与 Claude Opus 5(xhigh)同以 63 分并列第一,Claude Fable 5 以 62 分排第三。

  2. 在 ARC-AGI-2 上,Claude Opus 5 得分 90.4%,是目前唯一超过 90 分的模型;第二高的 GPT-5.5 为 85.0%,差距达 5.4 个百分点。

  3. FrontierMath Tier 4 最高分为 GPT-5.5 Pro 的 39.6%,大部分模型不到 20;开源模型中 Kimi K2.5(4.2)和 GLM-5(2.1)与闭源头部差距明显。

  4. LMArena 文本生成榜前十名中,非 Anthropic 的模型只有 Meta(muse-spark-1.2,第 4)、阿里(第 8)和 Google(gemini-3.7-flash-high,第 9)三家;榜首是 Claude Fable 5,Elo 1506。

  5. Agent 能力榜近 30 天排名变化中,Kimi K3 新上榜即排第 3(84.8 分),Qwen3.8-27B 新上榜排第 4(84.3 分),GPT-5 升至第 5(84 分)。

综合排名

AI 模型现在没有一个公认的"综合排名"。各家评测口径差太多,硬凑一个总分反而误导人。这里选了两种角度不同的榜单并列着看。

AA 智能指数把编程、数学、推理等 10 项标准评测的成绩汇总成一个分数,衡量客观能力。LMArena(原来的 Chatbot Arena)靠全球用户匿名盲测 A/B 投票算 Elo,反映的是真实使用体感。

AA Intelligence Index

这个榜汇总了编程、数学、科学、推理、智能体等 10 项标准化评测,数据更新到 2026 年 8 月 18 日。

前三名全是 Anthropic:Claude Opus 5(max)和 Claude Opus 5(xhigh)同分 63,Claude Fable 5 拿 62 排在第三。61 分这档有三家,OpenAI、xAI 和 Anthropic 各占一个位置。Moonshot 的模型 60 分排第七,第八到第十名落在 59 到 58 分,分别来自 OpenAI、Anthropic 和阿里。

整个前十名,Anthropic 一家占了四席。

LMArena Text Generation

这个榜的分数来自真人匿名 A/B 投票,数据更新到 8 月 12 日。

第一名是 Claude Fable 5,Elo 1506。claude-opus-4-6-high 和 claude-opus-4-7-high 以 1505、1502 跟在后面。Meta 的 muse-spark-1.2(xHigh)排第四,1498,是前十名里唯一非 Anthropic 的模型。第五到第七名又是 Claude 系列,分数从 1497 到 1493。第八是阿里系的模型,1491。gemini-3.7-flash-high 排第九,1490。第十还是 Anthropic,1489。

前十名里,只有 Meta、阿里和 Google 三家非 Anthropic 的模型挤了进来。

近期排名变化

代码和 Agent 榜单近 30 天的排名上升、下降与新上榜模型。

代码能力

Google 的 Gemma 4 系列这波数据更新很猛,四款模型集体进了榜单。Gemma 4 31B 排第 6,分数 1115,是这波里最高的。26B A4B 排第 8,897.55。E4B 和 E2B 分别排第 13 和第 15。

OpenAI o3-mini 上升 1 位到第 7,1056.9。Qwen3-32B 和 Qwen3.5-27B 各升 2 位,排第 9 和第 10。DeepSeek V3.2 正式版也在上升,排第 11,530.7。

Agent 能力

Kimi K3 新上榜直接排到第 3,84.8 分。Qwen3.8-27B 也是新上榜,84.3 排第 4。GPT-5 升两位到第 5,84 分。Claude Opus 4.8、Gemini 3.6 Flash、Grok 4.1 Fast 都是升两位,分别排第 6 到第 8。Qwen3-Max-Thinking 和 OpenAI GPT-5.2 也各升两位,排第 9 和第 10。

想看完整动态可以去大模型动态页面。

单项评测排名

这里按 HLE 排序,列出各基准的最高得分。HLE 是现在难度最高的推理基准之一,ARC-AGI-2 测的是抽象推理,FrontierMath Tier 4 是数学硬核题,SWE-bench Verified 是真实 GitHub issue 的代码修补,τ²-Bench 测的是 Agent 工具调用。分数来自 DataLearnerAI,表中是各评测模式中的最高得分。点击任意行可以查看模型详情,勾选左侧能对比最多 4 个模型。

排名 模型 HLE ARC-AGI-2 FrontierMath SWE-bench τ²-Bench 开源
1 Claude Mythos Preview 64.70 — — 93.90 — 闭源
2 Claude Opus 5 64.70 90.40 — 96.00 — 闭源
3 GLM-5.3 62.50 — — — — —
4 Muse Spark 1.1 62.10 — — — — 闭源
5 Claude Fable 5 59.00 — — 95.00 — 闭源
6 GPT-5.4 Pro 58.70 83.30 38.00 — — 闭源
7 Muse Spark 58.00 42.50 14.60 77.40 — 闭源
8 Claude Opus 4.8 57.90 — — 88.60 — 闭源
9 Claude Sonnet 5 57.40 — — 85.20 — 闭源
10 GPT-5.5 Pro 57.20 84.60 39.60 — — 闭源
11 Qwen3.8-Max 56.20 — — — — 免费商用
12 Kimi K3 56.00 — — — — 免费商用
13 Opus 4.7 54.70 75.80 22.90 87.60 — 闭源
14 GLM-5.2 54.70 — — — — 免费商用
15 Kimi K2.6 54.00 — — 80.20 — 免费商用
16 Qwen3.7 Max 53.50 — — 80.40 — 闭源
17 Hy3 53.20 — — 78.00 — 免费商用
18 Claude Opus 4.6 53.00 66.30 22.90 80.84 91.89 闭源
19 GLM 5.1 52.30 — — — — 免费商用
20 GPT-5.5 52.20 85.00 35.40 — — 闭源

几个值得留意的点。ARC-AGI-2 上 Claude Opus 5 的 90.40 是独一档,排第二的 GPT-5.5 是 85.00,差距有 5 个多点。另一头,GLM-5 在这项上只有 4.90,说明这个基准对某些模型的推理方式特别不友好。

FrontierMath Tier 4 全场最高是 GPT-5.5 Pro 的 39.60,大部分模型连 20 都上不去。开源模型里 Kimi K2.5 的 4.20 和 GLM-5 的 2.10 算比较能看的,但跟闭源头部差距明显。

τ²-Bench 已收录的数据里,最高分是 Claude Opus 4.6 的 91.89,后面跟着 Gemini 3.1 Pro 的 90.80、Gemini 3.0 Flash 的 90.20。GLM-5 以 89.70 排在开源第一。

完整榜单可以按数学、编程、Agent 等分类查看,也可以直接进分类排行榜。

排行榜常见问题

数据从哪来?

所有得分都来自一手出处。官方模型卡、技术报告、论文、厂商博客,还有可复现的第三方评测。每一行都链回了对应的模型详情页,原始引用可以逐个点开查。

为什么同一模型在不同基准上分数差异很大?

每个基准测的能力不一样。HLE 和 ARC-AGI-2 偏推理,AIME 和 FrontierMath 考数学,SWE-bench Verified 是改代码,τ²-Bench 是 Agent 工具调用。模型在某一项上专门优化过,别的能力就会让路。所以排行榜按基准分开展示,不合并成一个分。

多久更新一次?

数据每 5 分钟自动重新校验一次,新模型或新评测结果公开后同步收录。页面顶部的"数据更新于"就是最近一次刷新时间。

综合排名怎么解读?

综合榜聚合了模型在多个核心基准上的位次,拿来初筛还行。真要落地选型,去翻跟业务最相关的单项基准。比如代码智能体看 SWE-bench Verified,工具调用场景看 τ²-Bench。

开源和闭源怎么对比?

用"许可"筛选切到"全部",开源和闭源模型就能在同一列里直接比。除了分数还要算总持有成本。闭源按 API 用量计费,开源得自己掂量硬件和运维。


截至 2026 年 8 月,AA 智能指数前列是 Claude Opus 5(max)、Claude Opus 5(xhigh)、Claude Fable 5,这个指数汇总了编程、推理、科学等 10 项标准化评测。LMArena 文本生成榜靠前的是 Claude Fable 5、claude-opus-4-6-high、claude-opus-4-7-high,排名基于真人匿名 A/B 投票。数据口径说明可以查看数据方法论,延伸阅读可以看大模型分析博客。

知名模型开发商

页面收录了 100 家模型开发商,每家都有自己的主页,可以查看其全部模型、系列和产品线。今日推荐每天轮换,用来发现更多机构。

探索更多

排行榜只覆盖参与评测的模型。如果想看更全的内容,可以按模型、机构或评测基准浏览。

常见问题(FAQ)

哪个模型在ARC-AGI-2上得分最高?

Claude Opus 5以90.4%的得分排名第一,是唯一突破90分的模型。第二名的GPT-5.5得分85.0,差距明显。数据来自DataLearnerAI。

为什么同一模型在不同基准评测中分数差异很大?

因为各基准考察的能力不同。HLE和ARC-AGI-2偏推理,AIME和FrontierMath考数学,SWE-bench验证代码修复,τ²-Bench评估Agent工具调用。模型常针对特定任务优化,导致其他项分数偏低。

开源模型和闭源模型差距有多大?

在FrontierMath Tier 4上,开源最强的Kimi K2.5仅得4.2,而闭源的GPT-5.5 Pro高达39.6。但在τ²-Bench上,开源GLM-5以89.7分排在开源第一,接近闭源头部。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年9月29日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。