看大模型的「價格—得分」散佈圖,人人都在做同一件事:眯著眼找左上方那幾個點,其餘的一概略過。斬殺線替你把這一眼看完,每次都用同一把尺子,答案直接畫在圖上。
斬殺者
先立一條規則:如果模型 A 至少一樣便宜,又至少一樣強——同樣的價錢分更高,或者同樣的分數更便宜——就說 A 斬殺了 B。把榜上每個模型斬殺的數量數一遍,斬得最多的那個就是斬殺者。平手時取更便宜的,再平取更強的。
斬殺者不是最強的模型,也不是最便宜的。它標出的是一個價位:過了這個價,多花的錢在這張榜上不再換來更高的分。在多數榜上,它都不是人們看圖之前會想到的那個模型。
一個十字,三個區域
在斬殺者的價格處畫一條豎線,在它的得分處畫一條橫線,這個十字就是斬殺線。榜上每個模型都恰好落進三塊之一:
- SOTA,橫線以上:得分高過斬殺者。它可能貴得多,斬殺線不因此扣它的分。過了斬殺者這個價位,多花的錢唯一還能買到的,就是更高的分數。
- 低成本,左下方:更便宜,也更弱。這是取捨,不是失誤,預算說了算的時候就選它。
- 被斬殺,右下方:價格不低於斬殺者,得分卻不比它高。選它,就是多花錢買斬殺者已經給得起的東西。
剩下那個角註定是空的。一個比斬殺者更便宜又更強的當前模型,能斬殺斬殺者斬殺的全部,外加斬殺者本身,那它才該是斬殺者。
首頁畫的是綜合榜的斬殺線。程式設計和AI 代理兩個場景各畫各的,用的是該場景最倚重的那項基準,所以寫程式碼最划算的模型,不一定是綜合最划算的那個。
這條線不做的事
兩個軸來自同一個資料來源。價格和得分由同一家機構發布、用同一種方式測量。把一個榜的價格和另一個榜的分數拼在一起,畫出來的點沒有人真正測過;所以不公佈價格的榜只排名次,不畫斬殺線。
每次更新都重算。斬殺者易主,可能因為新模型發布,也可能只因為一次調價:某個模型每百萬 token 的價格翻了四倍,十字就會挪動,換另一個模型接手。我們不為了讓線看起來穩定而做平滑;每張榜都寫明資料來源和抓取時間,任何一次變動都能追溯。
上一代模型不參與畫線。資料來源已不再列為當前的模型,會被放到十字上定位,但不能當斬殺者,不計入斬殺數,也不計入任何一檔的統計。斬殺線只在資料來源仍在追蹤的模型之間畫:移出當前列表的模型也許還在賣,但已經不是這張榜拿來衡量全場的那一批。
它沒告訴你的
斬殺線只看價格和一項測出來的能力,別的一概不管。被斬殺的模型仍可能是你的正確選擇:權重開放、可以自行部署,上下文視窗更長,授權條款能過法務這一關,延遲滿足要求。它說的只是:按這個資料來源的測量,就這一項能力而言,你多付的錢買的不是分數。
圖上那條淺色折線連起的,是沒有哪個模型能在價格和得分上同時勝過的模型,叫作前沿。它回答的是另一個問題:「我這點預算,最好能買到什麼」。它在點與點之間連線,所以從斜線上讀出的分數落在兩個模型之間,並不對應任何一個真能買到的模型。
接著看
- 家族榜和廠商榜:同一張榜,按產品線或公司摺疊,各由最強的一款出戰。
- Harness 榜:Claude Code、Codex、Pi 等程式設計代理工具,按各自最好的一組成績排名,寫明每任務花費。
- 術語表解釋其餘的詞,OnlySOTA 如何讀一份榜單講每個數字從哪裡來。