榜單上的詞有三個來源:這個領域通用的說法、各家資料來源的叫法,以及本站自己定義的概念。分清來源很重要,因為只有第三類由我們來下定義。
SOTA
State of the art,當前最佳。在本站,它不是一句褒獎,而是一個位置:模型位於斬殺者的十字之上,也就是得分高於那個斬殺同類最多的模型,它就是 SOTA,與價格無關。
基準(Benchmark)
一項已發布的測量,名稱沿用發布者的叫法。基準屬於實際跑它的那一方:同名基準由兩家機構分別跑出,在本站算作兩項,因為測試框架、提示詞和判分方式都是這個數字的一部分。
能力(Capability)
多項基準共同反映的一個維度,比如程式設計、代理式工作、成本。能力頁把相關基準並排列出,但不合併,所以它回答的是「各資料來源在這個維度上分歧在哪」,而不是「綜合得分是多少」。
場景(Board)
訪客帶著來的那個問題,比如「這類工作該用哪個模型」,由所有能回答它的資料來源共同作答。場景還會再分出幾個小節,對應這個領域真正存在的子問題:比模型還是比框架,看自動評分的程式設計成績還是看人工偏好的程式設計成績。
Elo
一種來自兩兩比較的評分:給人看兩個回答,讓人選出更好的一個。Elo 沒有零點,它的起點只是一個任意設定的錨點,並不代表「毫無能力」。所以本站從不把 Elo 畫成從左邊緣長出的長條:有意義的是兩行之間的距離,而不是到左邊緣的距離。
斬殺線與斬殺者
斬殺者是斬殺同類最多的模型,「斬殺」指至少一樣便宜、且至少一樣強。斬殺線是以它為中心的十字,把榜單分成 SOTA、低成本和被斬殺三塊。兩個軸必須來自同一個資料來源:拿一個源的價格去配另一個源的分數,畫出來的是一條沒有人測過的線。完整講解見斬殺線。
圖上那條更淺的折線連起的,是沒有哪個模型能在價格和得分上同時勝過的模型,叫作前沿。它在點與點之間連線,所以從斜線上讀出的分數落在兩個模型之間,並不對應任何一個真能買到的模型。
變體(Variant)
執行配置,與模型本身相區分。推理強度、測試框架、上下文視窗、服務供應商、規模、發布階段、帶日期的建置,都是同一個模型上的設定,而不是另一個模型。哪些詞算作設定,由一份封閉、逐條人工核對的清單決定,因為 Max 在一家廠商那裡是設定,在另一家那裡卻是型號名稱的一部分。
檢查點(Checkpoint)
帶日期的建置,例如 20260813。檢查點只是同一模型下的一個檔位,而不是一個新模型,所以永遠不會有自己的 id。
產品線(Line / Family)
模型所屬的系列,由人工指定,而不是從名字裡解析出來。Claude Opus 是一條產品線,涵蓋 Opus 3 到 Opus 5;GPT 5.6 帶有版本號,所以不算產品線,而是其下若干模型的一個分組。靠名字推導行不通:兩個 id 的最長公共字首會把一條產品線按版本拆開,而改名之前的 id(比如 claude-4-opus)與它所屬的產品線根本沒有共同字首。
混合價格(Blended price)
按固定比例混合輸入和輸出價格後得到的每百萬 token 單價,由資料來源自行公佈。它是用來橫向比較的費率,不是報價:本站的任何價格都不構成要約,實際帳單取決於你自己的用量結構。
未識別(Unmatched)
上游的某一行,名稱暫時對應不到本站收錄的任何模型。它會照常顯示、加上標記,並留在原始榜單上。它不出現在跨榜檢視中只有一個原因:在有人確認它究竟是哪個模型之前,無法把它和其他榜對應起來。
上一代(Legacy)
發布它的資料來源已不再把它列為當前模型。這是資料來源的判斷,不是廠商的:上一代模型可能仍在提供服務。它保留在榜上並加上標記,成績取仍列為當前的最好配置,不出現在價格圖和斬殺線上。這個標記按配置計算:同一個模型的高強度檔位可能已是上一代,而另一個檔位仍是當前的。
估算(Estimated)
資料來源標明為推算、而非實測的數字。本站原樣保留這個標記並顯示出來,即使它落在斬殺線上最關鍵的那個點上。