OnlySOTA

OnlySOTA 如何读一份榜单

这些数字从哪里来,在抵达这里的路上被做了什么,以及本站坚决不对它们做的四件事。

OnlySOTA 不评测模型。本站的每一个数字都由别人发布,并且每一个都紧挨着发布者的名字呈现。本站做的是”对齐”:同一个模型,不管每个数据源怎么拼写它的名字,都被放到自己旁边。

这件事听起来比实际小。榜单容易读,却难以互相比较——难点从来不在排名,而在于判断你在这份榜上看到的那一行,和你在另一份榜上看到的那一行,究竟是不是同一个东西。

数字从哪里来

每个数据源按各自的节奏抓取,并作为快照提交入库。抓取和构建是两件分开的事:站点是从已经落盘的文件重新构建的,构建过程从不实时调用任何人的接口。由此有两个刻意的后果。上游宕机不会让一次部署失败。以及,数字旁边的日期是它被抓取的日期,而不是页面被重新构建的日期——所以一个没有变化的页面会诚实地这么说。

每个数据源自己的榜单都在 /leaderboards 下按其作者发布的形态复现,并配有出处栏:发布方、有声明时的许可协议,以及刷新频率。

这里所说的”归一化”是什么

三件事,仅此而已。

把名字解析到模型。 claude-opus-4-5Claude Opus 4.5anthropic/claude-opus-4.5 是同一个模型。匹配是针对人工维护的别名表做精确匹配,没有模糊回退——因为一次错误的模糊匹配是看不见的,而一个悄悄把两个不同模型并成一个的聚合站,比一个承认自己分辨不出来的更糟。

把运行配置从身份里分离出来。 Claude Opus 5 (Max Effort) 是一个模型加一项设置,不是第二个模型。尺寸、发布阶段、带日期的构建同理:一次发布的十一种规模是一个模型的十一级。

匹配不上的名字照样显示。 它会被标记为”未匹配”,留在它自己数据源的榜上,而不是被丢掉。悄悄丢弃是让一个聚合站在无人察觉中腐烂的失效方式——榜看起来仍然合理,却已经不再完整。

绝不做的事:没有综合分

本站不会把跨数据源的分数做平均、加权或以任何方式融合成单一排名。首页不会,结构化数据里不会,任何地方都不会。

这是唯一值得明说的拒绝,因为它恰恰是每个聚合站都会被要求做的功能。两份榜一平均,读起来就成了一份意见一致的榜——而这份一致是被制造出来的。不同基准在不同条件下衡量不同的东西:一场评分考试和一次”人们更喜欢哪个回答”的投票,并不会因为被加在一起就变得更真。两个数据源意见不同时,分歧本身就是要读的东西,而且就各自衡量的对象而言,两者都是对的。

所以各栏并排放置,各自保持各自的顺序,列与列从不合并。

斩杀线

本站唯一一个推导出来(而非复现)的图形,而且它只从单一数据源自己的两个轴——能力与价格——推导,绝不把两个源的数据互相拼接。

斩杀者是斩掉最多同类的那个模型,“斩杀”的含义是:至少同样便宜,且至少同样强。它的十字把榜面切成三块:更强的是 SOTA,更便宜但更弱的是低成本,更贵且更弱的则被斩杀。它易主可能只是因为一次调价,而不必等到新模型发布,所以每次刷新都会重算。

已下线的模型会被放到这个十字上定位,但绝不用来画线:一个没人买得到的斩杀者,不会让任何东西变得不值得买。

“新”是什么意思

上游没有任何一家发布”到达日期”,本站也不编造一个。NEW 标记只表示一件事:在我们已经在盯着的榜上,最近七天内出现了一行新记录

一个数据源的第一份快照是基线,不产生任何标记——否则一份榜单接入的当天,上面每个模型看起来都是新的。某次快照一口气带来五分之一的榜面时,会被当作换了一批总体而非新闻来处理。台账按数据源、按该源自己的拼写记录,所以适配器改写名字不算一次到达。

“已下线”是什么意思

数据源会撤下模型——其中一家把超过一半的行藏在”当前”筛选之后。那些行被保留并标记,而不是被隐藏,因为”我该用什么”希望它们消失,而”这件事做到了多好”不希望。

已下线的模型保留它在榜上的位置,读数取的是你现在还买得到的最好配置,并且不出现在价格图上——那里已经没有价格可付。

这里没有的东西

不重跑评测。没有综合分。不对数据源之间做主观排序。没有任何一个数字会脱离发布者的名字单独出现。