OnlySOTA

Epoch AI Benchmarking Hub

按 Epoch AI 发布的原样呈现,指标和模型都以它为准。点模型名查看本站详情,点箭头回到原榜单。

发布方
Epoch AI
许可协议
CC-BY-4.0
更新频率
持续更新
本站抓取时间
2026-10-07
条目数
148 · 10 条未识别
按 FrontierMath Tiers 1–3 排名前 12 的模型
  1. GPT 6 Astra 93.7%
  2. GPT 6.1 Sol 93.7%
  3. Claude Opus 5.5 91.2%
  4. Claude Fable 5.1 90.2%
  5. GPT 6 Sol 89.8%
  6. GPT 5.6 Sol 89.1%
  7. Claude Sonnet 5.5 88.8%
  8. GPT 5.5 Pro 87.7%
  9. Claude Fable 5 87.0%
  10. GPT 5.6 Terra 86.0%
  11. Claude Opus 5 85.6%
  12. GPT 5.5 85.3%

114 个有分数 · 34 个未测

#模型
1GPT 6 AstramaxOpenAI93.7%97.6%75.6%
2GPT 6.1 SolmaxOpenAI93.7%100.0%73.9%
3Claude Opus 5.5maxAnthropic91.2%95.0%72.2%
4Claude Fable 5.1maxAnthropic90.2%87.8%70.8%
5GPT 6 SolmaxOpenAI89.8%90.0%60.7%
6GPT 5.6 SolmaxOpenAI89.1%82.9%69.7%
7Claude Sonnet 5.5maxAnthropic88.8%80.5%46.5%
8GPT 5.5 ProxhighOpenAI87.7%78.0%—
9Claude Fable 5maxAnthropic87.0%90.2%—
10GPT 5.6 TerramaxOpenAI86.0%70.7%43.2%
11Claude Opus 5maxAnthropic85.6%73.2%59.9%
12GPT 5.5xhighOpenAI85.3%72.5%63.0%
13GPT 5.4 Pro2026-03-05 · xhighOpenAI82.5%58.5%46.3%
14GPT 5.6 LunamaxOpenAI82.1%61.0%41.0%
15Claude Opus 4.8maxAnthropic80.0%56.1%53.0%
16GPT 6 LunamaxOpenAI78.9%56.1%41.4%
17GPT 5.42026-03-05 · xhighOpenAI78.6%49.0%45.1%
18Qwen 3.8 MaxxhighAlibaba74.7%46.3%45.8%
19Muse Spark 1.3xhighMeta74.4%41.5%—
20Muse Spark 1.3maxMeta74.0%46.3%—
21Unknown developerUDgpt-5.2-pro-2025-12-11_xhigh2025-12-11 · xhigh未识别74.0%46.0%—
22Kimi K3maxKimi72.2%39.0%50.6%
23Gemini 3.7 FlashhighGoogle71.6%36.6%69.2%
24Claude Opus 4.7maxAnthropic70.2%31.7%—
25GLM 5.3maxZ AI68.8%29.3%41.0%
26Gemini 3.8 FlashhighGoogle68.4%22.0%69.7%
27GPT 5.22025-12-11 · xhighOpenAI67.4%31.7%37.1%
28Claude Opus 4.6maxAnthropic66.0%26.8%47.0%
29Grok 4.6xhighSpaceXAI66.0%31.7%48.9%
30Claude Sonnet 5maxAnthropic65.6%29.3%33.7%
31Qwen 3.8 Max0902 · xhighAlibaba65.6%34.1%47.3%
32DeepSeek V4 Pro0813 · maxDeepSeek64.6%26.8%52.9%
33Qwen 3.7 MaxAlibaba64.6%34.1%55.8%
34Gemini 3.5 FlashhighGoogle62.8%26.8%66.2%
35Gemini 3.1 PropreviewGoogle59.6%26.8%—
36GLM 5.2maxZ AI59.2%29.3%34.2%
37Gemini 3.6 FlashhighGoogle58.9%22.0%66.2%
38DeepSeek V4 Flash0731 · maxDeepSeek57.5%24.4%33.6%
39Grok 4.5highSpaceXAI57.2%24.4%48.3%
40Kimi K2.6Kimi57.2%25.6%34.9%
41GLM 5.3 FlashmaxZ AI55.8%17.1%—
42Unknown developerUDgpt-5-pro-2025-10-06_high2025-10-06 · high未识别55.8%19.5%—
43GPT 52025-08-07 · highOpenAI55.4%22.0%50.1%
44GLM 5.2lowZ AI54.7%——
45Kimi K2.7 CodeKimi54.0%12.2%36.5%
46Grok 4.7xhighSpaceXAI53.0%17.1%56.0%
47Gemini 3 FlashpreviewGoogle51.2%17.1%—
48GPT 5.4 mini2026-03-17 · xhighOpenAI51.2%9.8%—
49GPT 5 mini2025-08-07 · highOpenAI46.7%12.2%21.6%
50Inkling SmallxhighThinking Machines46.3%17.1%19.1%
51DeepSeek V4 PromaxDeepSeek45.3%2.4%47.0%
52GPT 5.4 nano2026-03-17 · highOpenAI44.9%12.2%11.7%
53Grok 4.200309 · onSpaceXAI44.9%17.1%30.2%
54Grok 4.3highSpaceXAI42.8%14.6%33.2%
55GLM 5.2offZ AI42.5%——
56GPT 5.6 LunalowOpenAI41.4%——
57GPT 5.6 LunaoffOpenAI39.6%——
58Qwen 3.6 PlusAlibaba38.2%—44.1%
59GPT 52025-08-07 · lowOpenAI37.2%——
60GLM 5.1Z AI36.8%—34.0%
61o4 mini2025-04-16 · highOpenAI36.1%4.9%18.8%
62Qwen 3.627BAlibaba35.1%——
63Claude Opus 4.520251101 · on · 32000Anthropic34.4%4.9%45.7%
64Qwen 3.7 PlusoffAlibaba34.4%——
65Qwen 3.627B · offAlibaba34.0%——
66InklingxhighThinking Machines33.3%4.9%40.3%
67o32025-04-16 · highOpenAI33.3%—49.4%
68Qwen 3.6 PlusoffAlibaba32.3%——
69Qwen 3.5397B A17B · offAlibaba31.2%——
70o32025-04-16 · mediumOpenAI29.8%——
71Qwen 3.5397B A17BAlibaba29.5%——
72o4 mini2025-04-16 · mediumOpenAI28.8%——
73Gemini 3.1 Flash LitehighGoogle27.7%——
74GPT 5.5 InstantOpenAI26.3%2.4%—
75Gemini 3.5 Flash LitehighGoogle26.0%0.0%—
76GLM 5.1offZ AI24.9%——
77Gemini 2.5 ProGoogle24.6%0.0%—
78GPT 5.4 mini2026-03-17 · lowOpenAI24.6%——
79Claude Sonnet 4.520250929 · on · 32000Anthropic23.9%2.4%—
80Gemini 3.1 Flash LitelowGoogle22.5%——
81Unknown developerUDqwen3.6-flash_noneoff未识别22.5%——
82Gemini 3.1 Flash LiteminimalGoogle21.4%——
83GPT 5.4 nano2026-03-17 · lowOpenAI20.4%——
84Qwen 3.635B A3B · offAlibaba20.4%——
85GPT 5 nano2025-08-07 · highOpenAI20.0%2.4%11.7%
86o32025-04-16 · lowOpenAI19.3%——
87Unknown developerUDqwen3.7-flash未识别19.3%——
88Unknown developerUDqwen3.7-flash_noneoff未识别19.3%——
89Qwen 3 Max2025-09-23Alibaba18.9%—48.7%
90o3 mini2025-01-31 · highOpenAI18.6%0.0%15.3%
91GPT 52025-08-07 · minimalOpenAI18.2%——
92GPT 5 mini2025-08-07 · lowOpenAI18.2%——
93Qwen 3.5 FlashoffAlibaba18.2%——
94Qwen 3.635B A3BAlibaba17.5%——
95GPT 5.4 mini2026-03-17 · offOpenAI17.2%——
96Unknown developerUDqwen3.6-flash未识别17.2%—15.9%
97o4 mini2025-04-16 · lowOpenAI16.1%—19.6%
98o12024-12-17 · highOpenAI14.7%—41.1%
99Claude Opus 4.120250805 · on · 32000Anthropic12.6%2.4%—
100o3 mini2025-01-31 · mediumOpenAI10.5%——

每一列测的是什么

FrontierMath Tiers 1–3
越高越好 · 推理与知识
FrontierMath Tier 4
越高越好 · 推理与知识
SimpleQA Verified
越高越好 · 事实性