OnlySOTA

Artificial Analysis LLM Leaderboard

Shown as Artificial Analysis publishes it — their metrics, their models. A model name opens its page here; the arrow opens the original board.

Published by
Artificial Analysis
Licence
not stated
Updates
continuous
Fetched
2026-10-02
Entries
688 · 1 unmatched
Top 12 by Artificial Analysis Intelligence Index
  1. Claude Opus 5.5 57.6
  2. Claude Sonnet 5.5 56.0
  3. Claude Fable 5.1 53.4
  4. GPT 6 Astra 52.7
  5. Gemini 4 Argon 52.6
  6. GPT 6.1 Sol 51.8
  7. Claude Opus 5 50.8
  8. Claude Fable 5 49.6
  9. Muse Spark 1.3 48.1
  10. GPT 6 Sol 47.6
  11. GPT 5.6 Sol 47.0
  12. Grok 4.7 46.4

679 scored · 9 not tested

#Model
1Claude Opus 5.5↗Default · adaptive · maxAnthropic57.6—61.4%66.9%31.7%——67.3%84.7%46.459.6%41.4%—87.7%$8.0093/s679.56s
2Claude Sonnet 5.5↗Default · adaptive · maxAnthropic56.0—55.0%61.0%31.4%——67.0%82.7%32.363.6%53.0%——$4.00139/s441.14s
3Claude Opus 5.5↗Default · adaptive · xhighAnthropic56.0—57.5%65.0%31.7%——66.0%84.7%42.659.6%34.3%—86.6%$8.0079/s137.34s
4Claude Opus 5.5↗Default · adaptive · highAnthropic53.6—55.6%60.4%30.9%——59.6%82.7%40.656.6%32.4%—85.8%$8.0074/s37.37s
5Claude Fable 5.1↗Default · adaptive · maxAnthropic53.493.7%59.1%63.1%29.7%47.2%91.4%61.7%85.3%43.552.0%27.4%——$20.0068/s214.52s
6Claude Fable 5.1↗Default · adaptive · xhighAnthropic53.293.4%58.7%60.9%31.1%45.8%91.0%61.0%83.0%42.455.1%29.5%——$20.0066/s111.92s
7GPT 6 Astra↗maxOpenAI52.796.1%54.7%56.5%31.7%41.4%88.4%52.1%80.7%43.459.1%48.7%—86.9%$20.0054/s341.88s
8Gemini 4 Argon↗highGoogle52.6—57.1%61.8%27.1%——55.6%79.7%42.457.1%84.9%——$4.00——
9GPT 6 Astra↗xhighOpenAI52.496.3%54.6%55.7%31.4%43.1%89.1%50.8%80.0%43.459.6%51.7%—86.2%$20.0049/s181.00s
10Claude Sonnet 5.5↗Default · adaptive · xhighAnthropic51.9—50.0%57.3%31.1%——61.4%79.7%23.557.1%37.1%——$4.00105/s32.46s
11GPT 6.1 Sol↗maxOpenAI51.8—52.9%54.2%31.7%——53.8%83.0%41.556.1%45.7%—86.0%$4.0063/s291.08s
12Claude Opus 5.5↗Default · adaptive · mediumAnthropic51.2—54.7%59.3%27.7%——53.8%84.3%40.352.5%31.6%—85.7%$8.0072/s22.18s
13Claude Fable 5.1↗Default · adaptive · highAnthropic51.290.6%55.9%58.7%30.3%43.1%89.9%55.9%83.7%40.852.0%31.2%——$20.0054/s27.13s
14GPT 6.1 Sol↗xhighOpenAI51.0—52.6%55.7%31.7%——50.5%79.7%40.954.0%49.1%—85.1%$4.0053/s110.28s
15GPT 6 Astra↗highOpenAI50.994.9%53.1%55.4%28.9%40.0%89.9%49.2%80.0%43.754.0%55.2%—86.4%$20.0045/s58.39s
16Claude Opus 5↗adaptive · maxAnthropic50.893.2%54.9%56.4%29.1%42.1%89.1%60.4%79.3%37.149.0%39.2%—84.7%$10.0058/s68.35s
17GPT 6.1 Sol↗highOpenAI50.2—51.4%55.8%30.0%——49.3%82.3%41.551.5%50.6%—84.9%$4.0058/s57.61s
18Claude Opus 5↗adaptive · xhighAnthropic49.793.7%54.4%55.7%27.7%43.3%88.0%58.8%80.3%35.446.5%40.5%—84.0%$10.0056/s44.82s
19Claude Fable 5↗Opus 4.8 · adaptive · maxAnthropic49.692.6%55.5%61.0%28.6%38.1%84.6%54.8%82.3%43.342.4%36.4%63.5%—$20.0066/s97.24s
20GPT 6 Astra↗mediumOpenAI49.693.9%52.7%54.2%29.1%35.5%89.5%48.4%79.7%42.249.5%53.5%—85.1%$20.0045/s6.07s
21Claude Fable 5.1↗Default · adaptive · mediumAnthropic48.988.6%53.8%56.4%29.1%41.0%88.0%51.8%84.7%37.644.9%30.9%——$20.0054/s9.11s
22Claude Opus 5↗adaptive · highAnthropic48.193.7%52.8%55.4%28.3%44.7%87.6%54.0%79.0%33.746.0%38.8%—82.4%$10.0054/s19.82s
23Muse Spark 1.3↗maxMeta48.193.5%48.7%58.8%24.9%50.5%84.3%58.6%83.0%25.033.3%67.1%——$2.00152/s51.47s
24GPT 6.1 Sol↗mediumOpenAI47.8—49.9%53.2%27.7%——46.6%83.3%40.048.0%48.4%—83.9%$4.0053/s5.50s
25GPT 6 Sol↗maxOpenAI47.6—47.9%57.6%30.9%——50.3%83.7%27.143.9%39.9%—82.9%$4.0093/s140.78s
26GPT 5.6 Sol↗maxOpenAI47.094.1%49.5%57.1%32.3%44.3%88.0%54.4%84.0%22.039.9%7.8%72.7%83.4%$8.0080/s112.99s
27Claude Fable 5.1↗Default · adaptive · lowAnthropic46.888.1%48.9%56.7%27.7%39.0%85.0%47.5%82.3%34.140.4%34.4%——$20.0053/s4.71s
28Claude Sonnet 5.5↗Default · adaptive · highAnthropic46.8—45.8%53.7%24.6%——52.6%78.0%20.943.9%35.4%——$4.00102/s12.20s
29Grok 4.7↗xhighSpaceXAI46.4—43.1%57.4%17.7%——59.8%76.7%32.025.8%70.7%——$3.0081/s49.32s
30Grok 4.7↗highSpaceXAI46.3—42.3%57.8%18.0%——60.5%77.0%30.924.7%67.6%——$3.0078/s33.12s
31MiMo V2.6 Pro↗Xiaomi46.3—49.4%60.9%26.6%——59.3%86.3%8.434.8%59.4%——$0.5446/s4.08s
32GPT 6 Astra↗lowOpenAI45.893.1%49.2%54.1%26.3%32.0%88.0%43.3%80.0%40.541.9%53.1%—84.6%$20.0046/s2.82s
33Qwen 3.8 Max↗0902Alibaba45.492.8%43.1%52.1%17.7%47.8%88.8%58.6%80.3%12.038.9%71.2%—82.8%$3.0039/s2.69s
34Muse Spark 1.3↗xhighMeta45.194.1%47.5%59.7%26.0%47.2%85.4%55.9%83.0%23.116.7%68.5%—82.0%$2.00140/s39.81s
35Claude Opus 5↗adaptive · mediumAnthropic44.891.9%51.3%51.5%26.9%38.6%86.1%48.8%82.0%31.034.3%39.3%—81.6%$10.0052/s5.27s
36GLM 5.3↗maxZ AI44.891.7%42.3%59.0%19.1%50.3%83.9%57.8%79.7%14.341.9%70.4%——$2.1571/s3.42s
37Grok 4.6↗highSpaceXAI44.394.9%42.9%56.5%17.1%50.7%88.4%55.5%80.3%30.521.2%65.7%——$3.0077/s29.97s
38GPT 6 Sol↗xhighOpenAI44.2—46.3%55.1%28.0%——47.8%81.3%26.730.3%41.1%—82.5%$4.0090/s50.76s
39Grok 4.6↗xhighSpaceXAI44.293.5%44.1%53.0%19.7%43.3%88.0%56.6%81.0%29.317.2%76.0%——$3.0072/s30.32s
40GPT 5.6 Sol↗xhighOpenAI44.093.1%47.3%57.1%28.6%38.1%89.5%52.4%82.3%21.024.7%8.1%71.0%82.7%$8.0078/s50.35s
41Step 5↗previewStepFun43.7—46.5%58.9%20.9%——53.3%88.3%16.433.3%57.0%—76.4%$1.4386/s3.07s
42Kimi K3↗maxKimi43.693.5%46.9%59.5%23.4%46.0%85.0%52.0%88.7%19.712.6%46.8%—80.5%$6.0034/s4.53s
43Grok 4.6↗mediumSpaceXAI42.893.5%42.1%55.9%17.7%44.3%84.3%55.2%81.0%28.013.1%76.0%——$3.0076/s24.09s
44GPT 6 Sol↗highOpenAI42.4—44.1%54.9%25.4%——44.8%83.7%26.826.3%41.9%—82.0%$4.0087/s17.74s
45GPT 5.6 Sol↗highOpenAI42.392.8%46.0%57.8%25.7%36.7%87.3%49.0%81.7%20.420.7%8.8%69.2%81.8%$8.0076/s13.29s
46Claude Opus 5.5↗Default · adaptive · lowAnthropic42.3—48.3%58.6%17.7%——36.2%80.7%38.931.3%32.4%—84.7%$8.0076/s12.39s
47Grok 4.7↗lowSpaceXAI42.2—39.2%54.9%13.4%——53.7%80.0%29.616.2%60.1%—78.2%$3.0078/s8.92s
48GPT 6.1 Sol↗lowOpenAI42.1—47.4%53.2%24.9%——39.9%84.0%37.630.8%48.4%—83.1%$4.0060/s2.61s
49GPT 5.6 Terra↗maxOpenAI42.192.5%42.9%55.0%30.0%40.2%88.0%47.7%83.0%0.135.4%12.1%71.2%80.7%$4.50100/s176.80s
50GLM 5.3 Flash↗Z AI41.891.2%39.9%51.6%15.4%47.2%84.3%57.3%80.0%7.532.8%72.4%——$0.2454/s3.21s
51Claude Opus 4.8↗adaptive · maxAnthropic41.892.0%48.7%54.4%20.9%34.2%84.6%46.9%77.7%28.821.7%60.7%62.2%—$10.0061/s63.28s
52Gemini 3.8 Flash↗highGoogle40.995.3%47.8%56.6%18.3%44.9%87.6%45.6%81.3%29.619.7%44.8%—85.6%$1.50249/s18.95s
53Claude Sonnet 5.5↗Default · adaptive · mediumAnthropic40.8—39.8%52.9%16.9%——41.2%76.3%20.129.8%48.8%——$4.0099/s1.23s
54Claude Opus 4.7↗adaptive · maxAnthropic40.7est91.4%42.3%—12.0%34.6%83.1%41.9%78.7%27.3—57.7%58.6%78.8%$10.0047/s25.34s
55Qwen 3.8 Max↗Alibaba40.292.7%43.0%53.2%20.0%51.3%81.3%55.4%78.3%3.418.7%58.3%—82.3%$3.0039/s2.53s
56Qwen 3.8 Max↗Alibaba39.993.5%42.4%54.1%20.0%49.1%82.0%54.9%80.3%4.311.1%60.8%——$3.0040/s2.81s
57Qwen 3.8 Flash Next↗Alibaba39.892.3%38.0%50.6%11.1%45.4%86.1%55.6%79.7%-9.725.3%54.7%—79.8%$0.2354/s2.46s
58GPT 6 Sol↗mediumOpenAI39.8—41.0%53.8%24.6%——42.4%82.3%27.018.7%43.2%—80.4%$4.00——
59Gemini 3.8 Flash↗mediumGoogle39.893.5%42.1%55.1%12.3%45.8%83.9%45.4%84.0%28.619.7%48.1%—84.2%$1.50——
60Gemini 3.7 Flash↗mediumGoogle39.6est92.1%39.0%59.8%9.4%35.5%78.3%42.0%83.0%23.7—34.1%—84.7%$1.50283/s5.62s
61Muse Spark 1.2↗xhighMeta39.690.4%45.5%57.4%17.7%34.8%80.1%49.1%79.0%27.27.1%66.7%——$2.00242/s14.10s
62DeepSeek V4.1 Flash↗maxDeepSeek39.5—39.2%51.9%14.3%——55.0%84.0%-5.326.8%3.5%—77.0%$0.52209/s0.95s
63Claude Opus 5↗adaptive · lowAnthropic39.488.9%43.4%49.2%23.1%30.3%76.4%39.7%81.3%28.626.3%37.8%—79.8%$10.0055/s2.87s
64GPT 5.6 Sol↗mediumOpenAI39.292.6%42.2%57.4%22.9%36.5%86.1%45.1%80.3%19.414.6%9.2%69.6%81.4%$8.0073/s5.46s
65Gemini 3.7 Flash↗highGoogle39.194.5%47.9%57.2%14.3%32.8%85.8%43.6%81.7%26.513.6%35.5%—85.5%$1.50303/s11.67s
66GPT 5.4↗xhighOpenAI39.0est92.0%43.7%—23.4%39.6%78.3%36.6%82.0%5.8—8.3%73.9%78.4%$5.6389/s192.94s
67Grok 4.5↗highSpaceXAI38.893.1%42.7%55.0%15.4%42.1%81.6%43.5%79.3%25.310.6%45.9%—80.4%$3.0055/s9.83s
68GPT 5.5↗xhighOpenAI38.493.5%45.8%55.8%27.1%39.0%84.3%41.8%84.3%20.514.6%11.0%75.9%79.9%$11.2585/s52.31s
69Claude Sonnet 5↗adaptive · maxAnthropic38.291.1%41.3%54.3%16.9%37.3%80.5%47.5%82.0%16.414.1%60.6%—77.3%$4.0086/s173.83s
70GPT 6 Luna↗maxOpenAI38.1—38.5%54.6%19.4%——46.9%83.3%0.712.6%23.3%—79.7%$0.20131/s128.78s
71GPT 5.6 Terra↗xhighOpenAI38.090.8%41.9%52.3%27.1%29.7%80.1%46.4%79.0%-3.010.1%11.0%66.3%79.5%$4.5091/s28.50s
72MiMo V2.6 Flash↗Xiaomi37.9—35.1%51.3%12.0%——55.0%74.3%-12.722.7%45.6%—73.1%$0.1851/s3.70s
73GPT 5.6 Luna↗maxOpenAI37.391.1%39.5%53.6%20.6%31.1%80.9%48.2%83.7%-10.311.6%7.4%—78.6%$0.45125/s107.35s
74GPT 5.5↗highOpenAI37.093.2%45.0%56.1%25.4%36.7%79.4%41.5%84.3%18.89.1%10.9%71.6%81.1%$11.2587/s21.23s
75Gemini 3.7 Flash↗lowGoogle36.9est90.1%35.1%55.7%5.7%29.5%79.8%40.3%78.7%22.1—32.3%—84.9%$1.50290/s1.18s
76DeepSeek V4 Pro↗0813 · maxDeepSeek36.092.8%41.0%51.0%18.0%39.6%78.7%47.1%80.3%0.814.1%5.2%——$1.98107/s1.75s
77Claude Sonnet 5.5↗Default · adaptive · lowAnthropic35.9—36.2%49.1%11.4%——33.9%76.0%19.420.7%49.8%——$4.0091/s1.31s
78Grok 4.6↗lowSpaceXAI35.187.9%27.6%49.4%5.7%38.1%75.3%45.1%80.7%25.93.0%69.4%——$3.0068/s7.44s
79DeepSeek V4 Flash Vision↗maxDeepSeek34.891.3%34.5%49.7%10.9%41.0%74.2%51.7%81.3%-17.612.1%8.5%—74.8%$0.66215/s0.93s
80GPT 6 Luna↗xhighOpenAI34.6—34.3%51.7%17.4%——43.3%80.0%-1.88.1%17.6%—79.7%$0.20138/s22.85s
81GPT 5.6 Luna↗xhighOpenAI34.689.5%37.0%50.5%20.6%28.7%77.9%44.2%81.7%-10.83.5%7.5%—78.6%$0.45113/s53.97s
82Claude Sonnet 5↗adaptive · xhighAnthropic34.4—39.0%54.1%15.4%——42.2%76.7%3.27.1%41.4%——$4.0073/s25.45s
83DeepSeek V4 Flash↗0731 · maxDeepSeek34.390.8%38.6%50.3%16.6%39.4%78.7%46.3%79.7%-14.312.1%8.3%——$0.66216/s0.97s
84GLM 5.3↗lowZ AI34.3—36.6%42.0%14.6%——40.2%72.7%-8.434.8%36.0%——$2.1567/s3.13s
85GPT 5.6 Terra↗highOpenAI34.289.6%38.5%52.4%22.9%28.7%75.7%43.1%77.7%-3.51.5%10.2%64.4%79.1%$4.5085/s3.47s
86GPT 6 Sol↗lowOpenAI34.2—34.9%50.2%16.3%——35.3%79.3%26.59.1%49.3%—80.2%$4.0078/s1.91s
87Gemini 3.6 Flash↗highGoogle34.092.8%40.8%53.4%10.6%29.9%77.5%38.2%80.0%22.17.1%44.4%—83.2%$1.50189/s18.39s
88JT 4.1 Flash↗236B A21B · onChina Mobile33.9—43.6%52.0%14.0%——40.8%78.3%20.63.0%43.0%—————
89GPT 5.5↗mediumOpenAI33.892.6%42.4%54.5%18.6%29.9%80.5%35.9%83.0%18.15.1%10.4%71.0%81.2%$11.2583/s7.03s
90Muse Spark 1.1↗xhighMeta33.789.8%46.2%58.8%15.1%31.8%77.9%35.4%77.7%28.16.1%50.0%——$2.00124/s30.18s
91GLM 5.2↗maxZ AI33.789.5%41.1%51.2%20.9%34.6%77.9%42.9%78.3%4.41.0%73.7%73.3%—$2.1584/s3.10s
92Qwen 3.8↗27B · xhighAlibaba33.790.5%33.9%46.6%5.4%48.0%79.8%46.2%82.0%-10.05.6%69.7%—76.3%$1.1346/s3.92s
93Gemini 3.5 Flash↗mediumGoogle33.6est92.1%41.3%—10.9%———74.3%20.8—38.2%74.6%83.9%$3.38211/s14.17s
94Motif 3↗Motif Technologies33.6est83.4%37.0%42.2%6.6%35.3%74.9%30.9%76.0%10.2—71.6%—————
95GPT 5.6 Sol↗lowOpenAI33.589.8%39.4%56.4%14.9%29.1%76.8%39.5%78.0%18.91.0%10.6%66.5%81.0%$8.0072/s2.72s
96Gemini 3.8 Flash↗lowGoogle33.592.0%37.1%55.0%4.0%33.2%83.1%39.7%80.7%21.410.1%35.4%—84.5%$1.50——
97GPT 6 Luna↗highOpenAI32.9—32.9%50.3%15.4%——42.3%79.3%-5.54.5%15.6%—77.5%$0.20135/s12.42s
98Gemini 3.5 Flash↗highGoogle32.692.2%42.7%53.9%13.1%32.2%78.7%34.2%73.3%21.26.6%37.8%76.3%84.3%$3.38216/s16.19s
99GPT 5.3 Codex↗xhighOpenAI32.5est91.5%42.5%—16.9%———83.3%10.9—10.8%75.4%78.5%$4.8195/s68.50s
100Motif 3↗betaMotif Technologies32.3est86.9%40.4%—6.0%—70.8%29.3%74.7%-17.8—50.9%—————

What each column measures

Artificial Analysis Intelligence Index
Higher is better
GPQA Diamond
Higher is better · Reasoning and knowledge
Humanity's Last Exam
Higher is better · Reasoning and knowledge
SciCode
Higher is better · Coding
CritPt
Higher is better · Reasoning and knowledge
τ³-Banking
Higher is better · Agentic work
Terminal-Bench 2.1
Higher is better · Agentic coding
GDPval-AA
Higher is better · Agentic work
AA-LCR
Higher is better · Long context
AA-Omniscience Index
Higher is better · Factuality
Terminal-Bench 4.0
Higher is better
AA-Omniscience Non-Hallucination Rate
Higher is better · Factuality
IFBench
Higher is better · Instruction following
MMMU-Pro
Higher is better · Multimodal
Blended Price, USD per 1M tokens (3:1 input:output)
Lower is better · Cost
Output Speed
Higher is better · Speed
Time To First Token
Lower is better · Speed