OnlySOTA

綜合偏好

真人在自己提出的問題上更喜歡哪個模型的回答,由兩兩投票彙總而成。它反映的是使用者偏好,與能力相關但不等同;回答長度、排版和語氣也會影響結果,所以這裡採用排除了風格影響的分數。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Arena — Text Overall (style control)
Gemini 4 Argon Google 1/1 #1 1525
Claude Opus 4.6 Anthropic 1/1 #2 1505
Claude Fable 5 Anthropic 1/1 #3 1504
Claude Opus 5.5 Anthropic 1/1 #4 1504
Claude Opus 4.7 Anthropic 1/1 #5 1501
Claude Fable 5.1 Anthropic 1/1 #6 1501
Gemini 3.8 Flash Google 1/1 #7 1495
Muse Spark 1.3 Meta 1/1 #8 1494
Muse Spark 1.2 Meta 1/1 #9 1494
Muse Spark 1.1 Meta 1/1 #10 1491

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。