OnlySOTA

OnlySOTA 如何讀一份榜單

這些數字從哪裡來,到達本站之前經過了哪些處理,以及本站堅決不對它們做的四件事。

OnlySOTA 不評測模型。本站的每一個數字都由別人發布,也都與發布者的名字並列顯示。本站做的只有一件事:對齊。同一個模型,無論各家榜單把它的名字寫成什麼樣,都會被識別出來、歸到一處。

這件事比聽起來難得多。單看一張榜很容易,難在把兩張榜放在一起比較:難點從來不是排名本身,而是確認這張榜上的某一行,和另一張榜上的某一行,究竟是不是同一個模型。

數字從哪裡來

每個資料來源按計劃定時抓取,並作為快照提交到儲存庫。抓取和建置是兩個獨立的步驟:網站只用已經存檔的檔案重新建置,建置過程從不即時呼叫任何外部介面。這樣做有兩個刻意追求的結果。一是上游服務中斷不會導致部署失敗;二是數字旁邊的日期是它被抓取的日期,而不是頁面重新建置的日期,所以一個沒有變化的頁面,會如實顯示它沒有變化。

每個資料來源自己的榜單都在 /leaderboards 下按原作者發布的形式呈現,並附有出處欄:發布方、授權條款(如有註明)以及更新頻率。

這裡的「正規化」指什麼

只有三件事,沒有更多。

把名字解析到模型。 claude-opus-4-5、Claude Opus 4.5 和 anthropic/claude-opus-4.5 是同一個模型。比對依據一份人工維護的別名表,只做精確比對,沒有模糊比對作為後備。原因在於,一次錯誤的模糊比對是看不出來的;一個悄悄把兩個不同模型合併在一起的聚合站,比一個坦承「分辨不出」的聚合站更糟。

把執行配置與模型身份分開。 Claude Opus 5 (Max Effort) 是一個模型加一項設定,而不是第二個模型。規模、發布階段、帶日期的建置也一樣:同一次發布的十一種規模,是同一個模型的十一個檔位。

比對不上的名字照常顯示。 它會被標記為「未識別」,留在原始榜單上,而不是被丟棄。悄無聲息地丟棄資料,正是聚合站在不知不覺中失真的方式:榜單看起來依然合理,卻已經不再完整。

絕不做的事:不合成綜合分

本站不會把不同資料來源的分數做平均、加權,或以任何方式合成單一排名。首頁不會,結構化資料裡不會,任何地方都不會。

之所以要特別說明這一點,是因為它恰恰是每個聚合站都會被要求提供的功能。兩張榜一平均,看起來就像是一張意見一致的榜,但這份一致是人為製造的。不同基準在不同條件下衡量不同的東西:一場有標準答案的考試,和一輪「人們更喜歡哪個回答」的投票,加在一起並不會更接近真相。兩個資料來源意見不一時,分歧本身就是值得讀的資訊,而且就各自衡量的內容而言,兩者都沒有錯。

所以各欄並排放置,各自保持自己的排序,列與列之間從不合併。

斬殺線

這是本站唯一一個由推導得出、而非照搬原榜的圖形。它只取同一個資料來源自己的兩個軸——能力和價格——來推導,絕不把兩個資料來源的資料拼在一起。

斬殺者是斬殺同類最多的模型,「斬殺」指至少一樣便宜、且至少一樣強。以它為中心的十字把榜單分成三塊:得分更高的是 SOTA,更便宜、得分也更低的是低成本,價格不低於它、得分又不高於它的被斬殺。一次調價就可能讓斬殺者易主,不必等到新模型發布,所以每次更新都會重新計算。

上一代模型會被放到這個十字上定位,但絕不參與畫線:斬殺線只在資料來源仍列為當前的模型之間計算。

「新上榜」是什麼意思

上游沒有任何一家公佈模型的「上榜日期」,本站也不會編造一個。「新上榜」標記只表示一件事:在一張我們已經持續追蹤的榜單上,最近七天內出現了一行新記錄。

一個資料來源的第一份快照只作為基線,不產生任何標記,否則一張榜單納入的當天,上面每個模型看起來都是新的。如果某次快照一口氣帶來了五分之一的榜單,就會被視為換了一批模型,而不是新聞。記錄按資料來源、按每一行最終對應的模型來登記,所以無論是資料來源改寫了模型名稱,還是本站新增了一個別名,都不會被算作新上榜。

「上一代」是什麼意思

有一個資料來源把超過一半的行藏在「當前」篩選之後。本站保留這些行並加上標記,而不是把它們隱藏:「我現在該用什麼」用不上它們,但「這個領域進步了多少」離不開它們。

這個標記是資料來源打的,不是廠商打的。標為「上一代」只說明它已不在該榜的當前列表裡,通常是被更新的型號取代了;廠商很可能仍在提供它。Claude Opus 5 在那個榜上就是上一代,但依然可以透過官方 API 呼叫。

上一代模型保留它在榜上的位置,成績取該榜仍列為當前的最好配置,不出現在價格圖和斬殺線上,因為這兩處只比較資料來源仍在追蹤的模型。

本站不做什麼

不重跑評測。不合成綜合分。不對各資料來源做主觀排名。不展示任何一個脫離發布者名字的數字。