这些榜单上的词汇来自三处:这个领域、各数据源,以及本站自己。分清是哪一种很重要,因为只有第三种才轮得到我们来定义。
SOTA
State of the art,当前最佳。在本站它不是一句褒奖,而是一个位置:当一个模型位于斩杀者的十字之上——即不逊于那个斩掉最多同类的模型——它就是 SOTA,无论它多贵。
基准(Benchmark)
一项已发布的测量,名称按其发布者的叫法。基准属于跑它的那一方;同名而由两家机构分别跑出的结果,在本站算作两项基准,因为测试框架、题目和判分方式都是这个数字的一部分。
能力(Capability)
多个基准共同指向的一个维度——编程、智能体作业、成本。能力页把相关基准并排放置而不合并,所以它回答的是”各数据源在这一维度上哪里意见不同”,而不是”分数是多少”。
看板(Board)
访客带着来的那个问题——这类活我该用什么——由所有能回答它的数据源共同作答。看板额外提供的是分区,也就是一个领域真正存在的子问题:模型对比框架,评分判定的编程对比偏好判定的编程。
Elo
来自两两比较的评分:给人看两个回答,让人选一个。Elo 没有零点。它的起点是一个任意锚点,而不是”毫无能力”,所以本站从不把 Elo 画成从左边缘生长的条形——两行之间的距离才是读数,到左边缘的距离不是。
斩杀线与斩杀者
斩杀者是斩掉最多同类的那个模型,“斩杀”意为至少同样便宜且至少同样强。斩杀线是它的十字,把榜面切成 SOTA、低成本和被斩杀三块。两个轴必须来自同一个数据源;拿一个源的价格去配另一个源的分数,画出的是一条没有人测量过的线。
把”没有任何模型能在两个维度上同时胜过”的那些点连起来的那条更淡的线,叫前沿。它是点对点连接的,所以从斜段上读到的分数落在两个模型之间,而不是某个你真能买到的模型。
变体(Variant)
运行配置,与模型身份相区分。推理强度、测试框架、上下文窗口、供应商、尺寸、发布阶段、带日期的构建——这些都是模型上的设置,而不是另外的模型。哪些词算作设置是一份封闭且逐条人工核对过的清单,因为 Max 在一家开发商那里是设置,在另一家那里却是名字的一部分。
检查点(Checkpoint)
带日期的构建,例如 20260813。检查点是一级,不是一个模型:它永远不会有自己的 id。
产品线(Line / Family)
模型所属的层级,是声明出来的,而不是从名字里解析出来的。Claude Opus 是一条线,横跨 Opus 3 到 Opus 5;GPT 5.6 带了版本号,因此不是线,而是它内部若干模型之上的一个分组。从名字推导行不通——两个 id 的最长公共前缀会把一条线按版本切开,而一次改名发生在它自己之前。
混合价格(Blended price)
按固定比例混合输入与输出后得到的每百万 token 单一价格,由发布它的数据源发布。它是一个用于比较的费率,不是报价:本站没有任何东西构成要约,而真实账单取决于你自己的流量结构。
未匹配(Unmatched)
上游的某一行,其名称目前匹配不到名录里的任何模型。它会被显示、被标记,并留在它自己数据源的榜上。它不出现在跨源视图中只有一个原因:在有人确认它到底是什么之前,它无法与任何东西对齐。
已下线(Retired)
被发布它的数据源撤下。保留在榜上并加标记,读数取你现在还买得到的最好配置,并且不出现在价格图上——那里已经没有价格可付。下线是按配置计的:一个模型可以有一个已下线的高强度档位和一个仍在售的档位。
估算(Estimated)
被数据源标注为推算而非实测。这个标注会被一路带过来并显示出来,包括标在斩杀线上最吃重的那个点上。