编程
按规格写代码和改代码,在没有智能体循环的条件下衡量。与智能体编程不同:这些基准直接对模型的输出打分,而不是对“模型 + 执行框架”这个系统打分。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard SciCode | Artificial Analysis LLM Leaderboard Coding Index | Arena — Code Overall |
|---|---|---|---|---|
| | 3/3 | #1 60.2% | #5 76.5 | #4 1626 |
| | 3/3 | #5 56.9% | #1 78.3 | #5 1619 |
| | 3/3 | #8 55.7% | #2 78.0 | #1 1691 |
| | 3/3 | #3 58.7% | #6 76.2 | #2 1674 |
| | 3/3 | #9 54.6% | #3 76.8 | #3 1629 |
| | 3/3 | #4 57.9% | #7 76.1 | #7 1587 |
| | 3/3 | #6 56.5% | #8 74.8 | #6 1599 |
| | 2/3 | #7 56.4% | #10 72.2 | #16 1534 |
| | 2/3 | #10 54.1% | #9 72.4 | #11 1556 |
| | 1/3 | #2 58.9% | #18 68.8 | #31 1446 |
| | 1/3 | #11 53.9% | #4 76.7 | #18 1520 |
| | 1/3 | #19 50.5% | #19 68.8 | #8 1582 |
| | 1/3 | — | — | #9 1563 |
| | 1/3 | — | — | #10 1558 |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。