本页面汇总了各大AI模型在ARC-AGI-2、AIME 20
AIAI Summary (BLUF)
本页面汇总了各大AI模型在ARC-AGI-2、AIME 2025、SWE-bench Verified等主流评测上的实时排名,支持按综合、数学、编程、Agent维度筛选。其中综合排名参考AA Intelligence Index与LMArena两个榜单,兼顾客观基准与用户偏好;近期排名变化板块展示了代码与Agent能力的升降趋势,并附有可对比多个模型的详细表格。
核心洞察
先说结论:翻完整个榜单,最扎眼的是 Anthropic 的 Claude 系列在前二十名里占了七席。Claude Opus 5 在 ARC-AGI-2人工智能推理能力基准测试,Deep Think得分84.6%,由ARC Prize Foundation验证。 上直接干到 90.4%,是目前唯一一个冲破 90 的模型。开源这边 Kimi K2.6 排到第 15,GLM-5 和 Qwen3.5 也都在榜,但一看 FrontierMath 的分数,GLM-5 只有 2.1,Kimi K2.5 是 4.2,跟闭源头部差得还远。
这个页面聚合了 ARC-AGI-2、AIME 2025The 2025 American Invitational Mathematics Examination, where Gemini 2.5 Deep Think achieved an 88% accuracy rate.、SWE-bench Verified软件工程基准测试,Gemini 3在该测试中获得76.2%的成绩,是目前最强的编程AI模型之一。 等主流评测的实时排名,可以按综合、数学、编程、Agent 等维度筛选。数据更新于 2026 年 8 月 16 日。
核心结论
Anthropic Claude 系列在 HLE 排序的前 20 名中占 7 席;AA 智能指数前十名中 Anthropic 占 4 席,其中 Claude Opus 5(max)与 Claude Opus 5(xhigh)同以 63 分并列第一,Claude Fable 5 以 62 分排第三。
在 ARC-AGI-2 上,Claude Opus 5 得分 90.4%,是目前唯一超过 90 分的模型;第二高的 GPT-5.5 为 85.0%,差距达 5.4 个百分点。
FrontierMath Tier 4 最高分为 GPT-5.5 Pro 的 39.6%,大部分模型不到 20;开源模型中 Kimi K2.5(4.2)和 GLM-5(2.1)与闭源头部差距明显。
LMArenaA benchmark test for reasoning ability, where Gemini 3.0 achieved an Elo rating of 1501. 文本生成榜前十名中,非 Anthropic 的模型只有 Meta(muse-spark-1.2,第 4)、阿里(第 8)和 Google(gemini-3.7-flash-high,第 9)三家;榜首是 Claude Fable 5,Elo 1506。
Agent 能力榜近 30 天排名变化中,Kimi K3 新上榜即排第 3(84.8 分),Qwen3.8-27B 新上榜排第 4(84.3 分),GPT-5 升至第 5(84 分)。
综合排名
AI 模型现在没有一个公认的"综合排名"。各家评测口径差太多,硬凑一个总分反而误导人。这里选了两种角度不同的榜单并列着看。
AA 智能指数把编程、数学、推理等 10 项标准评测的成绩汇总成一个分数,衡量客观能力。LMArena(原来的 Chatbot Arena)靠全球用户匿名盲测 A/B 投票算 Elo,反映的是真实使用体感。
AA Intelligence IndexArtificial Analysis推出的智能指数,汇总10项标准化评测的综合分数,衡量AI模型的客观能力。
这个榜汇总了编程、数学、科学、推理、智能体等 10 项标准化评测,数据更新到 2026 年 8 月 18 日。
前三名全是 Anthropic:Claude Opus 5(max)和 Claude Opus 5(xhigh)同分 63,Claude Fable 5 拿 62 排在第三。61 分这档有三家,OpenAI、xAI 和 Anthropic 各占一个位置。Moonshot 的模型 60 分排第七,第八到第十名落在 59 到 58 分,分别来自 OpenAI、Anthropic 和阿里。
整个前十名,Anthropic 一家占了四席。
LMArena Text Generation
这个榜的分数来自真人匿名 A/B 投票,数据更新到 8 月 12 日。
第一名是 Claude Fable 5,Elo 1506。claude-opus-4-6-high 和 claude-opus-4-7-high 以 1505、1502 跟在后面。Meta 的 muse-spark-1.2(xHigh)排第四,1498,是前十名里唯一非 Anthropic 的模型。第五到第七名又是 Claude 系列,分数从 1497 到 1493。第八是阿里系的模型,1491。gemini-3.7-flash-high 排第九,1490。第十还是 Anthropic,1489。
前十名里,只有 Meta、阿里和 Google 三家非 Anthropic 的模型挤了进来。
近期排名变化
代码和 Agent 榜单近 30 天的排名上升、下降与新上榜模型。
代码能力
Google 的 Gemma 4 系列这波数据更新很猛,四款模型集体进了榜单。Gemma 4 31B 排第 6,分数 1115,是这波里最高的。26B A4B 排第 8,897.55。E4B 和 E2B 分别排第 13 和第 15。
OpenAI o3-mini 上升 1 位到第 7,1056.9。Qwen3-32B 和 Qwen3.5-27B 各升 2 位,排第 9 和第 10。DeepSeek V3.2 正式版也在上升,排第 11,530.7。
Agent 能力
Kimi K3 新上榜直接排到第 3,84.8 分。Qwen3.8-27B 也是新上榜,84.3 排第 4。GPT-5 升两位到第 5,84 分。Claude Opus 4.8、Gemini 3.6 Flash、Grok 4.1 Fast 都是升两位,分别排第 6 到第 8。Qwen3-Max-Thinking 和 OpenAI GPT-5.2 也各升两位,排第 9 和第 10。
想看完整动态可以去大模型动态页面。
单项评测排名
这里按 HLE 排序,列出各基准的最高得分。HLE 是现在难度最高的推理基准之一,ARC-AGI-2 测的是抽象推理,FrontierMath Tier 4 是数学硬核题,SWE-bench Verified 是真实 GitHub issue 的代码修补,τ²-Bench 测的是 Agent 工具调用。分数来自 DataLearnerAI,表中是各评测模式中的最高得分。点击任意行可以查看模型详情,勾选左侧能对比最多 4 个模型。
| 排名 | 模型 | HLE | ARC-AGI-2 | FrontierMath | SWE-bench | τ²-Bench | 开源 |
|---|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | 64.70 | — | — | 93.90 | — | 闭源 |
| 2 | Claude Opus 5 | 64.70 | 90.40 | — | 96.00 | — | 闭源 |
| 3 | GLM-5.3 | 62.50 | — | — | — | — | — |
| 4 | Muse Spark 1.1 | 62.10 | — | — | — | — | 闭源 |
| 5 | Claude Fable 5 | 59.00 | — | — | 95.00 | — | 闭源 |
| 6 | GPT-5.4 Pro | 58.70 | 83.30 | 38.00 | — | — | 闭源 |
| 7 | Muse Spark | 58.00 | 42.50 | 14.60 | 77.40 | — | 闭源 |
| 8 | Claude Opus 4.8 | 57.90 | — | — | 88.60 | — | 闭源 |
| 9 | Claude Sonnet 5 | 57.40 | — | — | 85.20 | — | 闭源 |
| 10 | GPT-5.5 Pro | 57.20 | 84.60 | 39.60 | — | — | 闭源 |
| 11 | Qwen3.8-Max | 56.20 | — | — | — | — | 免费商用 |
| 12 | Kimi K3 | 56.00 | — | — | — | — | 免费商用 |
| 13 | Opus 4.7 | 54.70 | 75.80 | 22.90 | 87.60 | — | 闭源 |
| 14 | GLM-5.2 | 54.70 | — | — | — | — | 免费商用 |
| 15 | Kimi K2.6 | 54.00 | — | — | 80.20 | — | 免费商用 |
| 16 | Qwen3.7 Max | 53.50 | — | — | 80.40 | — | 闭源 |
| 17 | Hy3 | 53.20 | — | — | 78.00 | — | 免费商用 |
| 18 | Claude Opus 4.6 | 53.00 | 66.30 | 22.90 | 80.84 | 91.89 | 闭源 |
| 19 | GLM 5.1 | 52.30 | — | — | — | — | 免费商用 |
| 20 | GPT-5.5 | 52.20 | 85.00 | 35.40 | — | — | 闭源 |
几个值得留意的点。ARC-AGI-2 上 Claude Opus 5 的 90.40 是独一档,排第二的 GPT-5.5 是 85.00,差距有 5 个多点。另一头,GLM-5 在这项上只有 4.90,说明这个基准对某些模型的推理方式特别不友好。
FrontierMath Tier 4 全场最高是 GPT-5.5 Pro 的 39.60,大部分模型连 20 都上不去。开源模型里 Kimi K2.5 的 4.20 和 GLM-5 的 2.10 算比较能看的,但跟闭源头部差距明显。
τ²-Bench 已收录的数据里,最高分是 Claude Opus 4.6 的 91.89,后面跟着 Gemini 3.1 Pro 的 90.80、Gemini 3.0 Flash 的 90.20。GLM-5 以 89.70 排在开源第一。
完整榜单可以按数学、编程、Agent 等分类查看,也可以直接进分类排行榜。
排行榜常见问题
数据从哪来?
所有得分都来自一手出处。官方模型卡、技术报告、论文、厂商博客,还有可复现的第三方评测。每一行都链回了对应的模型详情页,原始引用可以逐个点开查。
为什么同一模型在不同基准上分数差异很大?
每个基准测的能力不一样。HLE 和 ARC-AGI-2 偏推理,AIME 和 FrontierMath 考数学,SWE-bench Verified 是改代码,τ²-Bench 是 Agent 工具调用。模型在某一项上专门优化过,别的能力就会让路。所以排行榜按基准分开展示,不合并成一个分。
多久更新一次?
数据每 5 分钟自动重新校验一次,新模型或新评测结果公开后同步收录。页面顶部的"数据更新于"就是最近一次刷新时间。
综合排名怎么解读?
综合榜聚合了模型在多个核心基准上的位次,拿来初筛还行。真要落地选型,去翻跟业务最相关的单项基准。比如代码智能体看 SWE-bench Verified,工具调用场景看 τ²-Bench。
开源和闭源怎么对比?
用"许可"筛选切到"全部",开源和闭源模型就能在同一列里直接比。除了分数还要算总持有成本。闭源按 API 用量计费,开源得自己掂量硬件和运维。
截至 2026 年 8 月,AA 智能指数前列是 Claude Opus 5(max)、Claude Opus 5(xhigh)、Claude Fable 5,这个指数汇总了编程、推理、科学等 10 项标准化评测。LMArena 文本生成榜靠前的是 Claude Fable 5、claude-opus-4-6-high、claude-opus-4-7-high,排名基于真人匿名 A/B 投票。数据口径说明可以查看数据方法论,延伸阅读可以看大模型分析博客。
知名模型开发商
页面收录了 100 家模型开发商,每家都有自己的主页,可以查看其全部模型、系列和产品线。今日推荐每天轮换,用来发现更多机构。
探索更多
排行榜只覆盖参与评测的模型。如果想看更全的内容,可以按模型、机构或评测基准浏览。
常见问题(FAQ)
哪个模型在ARC-AGI-2上得分最高?
Claude Opus 5以90.4%的得分排名第一,是唯一突破90分的模型。第二名的GPT-5.5得分85.0,差距明显。数据来自DataLearnerAI。
为什么同一模型在不同基准评测中分数差异很大?
因为各基准考察的能力不同。HLE和ARC-AGI-2偏推理,AIME和FrontierMath考数学,SWE-bench验证代码修复,τ²-Bench评估Agent工具调用。模型常针对特定任务优化,导致其他项分数偏低。
开源模型和闭源模型差距有多大?
在FrontierMath Tier 4上,开源最强的Kimi K2.5仅得4.2,而闭源的GPT-5.5 Pro高达39.6。但在τ²-Bench上,开源GLM-5以89.7分排在开源第一,接近闭源头部。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



