OnlySOTA

斬殺線:哪些大模型配得上它的價格

每個榜上,總有一個模型在價格和得分上同時壓過最多對手。以它為十字,其餘模型分成 SOTA、低成本、被斬殺三檔。這條線怎麼畫、怎麼讀。

看大模型的「價格—得分」散佈圖,人人都在做同一件事:眯著眼找左上方那幾個點,其餘的一概略過。斬殺線替你把這一眼看完,每次都用同一把尺子,答案直接畫在圖上。

斬殺者

先立一條規則:如果模型 A 至少一樣便宜,又至少一樣強——同樣的價錢分更高,或者同樣的分數更便宜——就說 A 斬殺了 B。把榜上每個模型斬殺的數量數一遍,斬得最多的那個就是斬殺者。平手時取更便宜的,再平取更強的。

斬殺者不是最強的模型,也不是最便宜的。它標出的是一個價位:過了這個價,多花的錢在這張榜上不再換來更高的分。在多數榜上,它都不是人們看圖之前會想到的那個模型。

一個十字,三個區域

在斬殺者的價格處畫一條豎線,在它的得分處畫一條橫線,這個十字就是斬殺線。榜上每個模型都恰好落進三塊之一:

剩下那個角註定是空的。一個比斬殺者更便宜又更強的當前模型,能斬殺斬殺者斬殺的全部,外加斬殺者本身,那它才該是斬殺者。

首頁畫的是綜合榜的斬殺線。程式設計和AI 代理兩個場景各畫各的,用的是該場景最倚重的那項基準,所以寫程式碼最划算的模型,不一定是綜合最划算的那個。

這條線不做的事

兩個軸來自同一個資料來源。價格和得分由同一家機構發布、用同一種方式測量。把一個榜的價格和另一個榜的分數拼在一起,畫出來的點沒有人真正測過;所以不公佈價格的榜只排名次,不畫斬殺線。

每次更新都重算。斬殺者易主,可能因為新模型發布,也可能只因為一次調價:某個模型每百萬 token 的價格翻了四倍,十字就會挪動,換另一個模型接手。我們不為了讓線看起來穩定而做平滑;每張榜都寫明資料來源和抓取時間,任何一次變動都能追溯。

上一代模型不參與畫線。資料來源已不再列為當前的模型,會被放到十字上定位,但不能當斬殺者,不計入斬殺數,也不計入任何一檔的統計。斬殺線只在資料來源仍在追蹤的模型之間畫:移出當前列表的模型也許還在賣,但已經不是這張榜拿來衡量全場的那一批。

它沒告訴你的

斬殺線只看價格和一項測出來的能力,別的一概不管。被斬殺的模型仍可能是你的正確選擇:權重開放、可以自行部署,上下文視窗更長,授權條款能過法務這一關,延遲滿足要求。它說的只是:按這個資料來源的測量,就這一項能力而言,你多付的錢買的不是分數。

圖上那條淺色折線連起的,是沒有哪個模型能在價格和得分上同時勝過的模型,叫作前沿。它回答的是另一個問題:「我這點預算,最好能買到什麼」。它在點與點之間連線,所以從斜線上讀出的分數落在兩個模型之間,並不對應任何一個真能買到的模型。

接著看