编程
按要求写代码、改代码,不借助智能体循环,直接给模型的输出打分。和“智能体编程”不同,后者评的是“模型 + 框架”整体。
按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard SciCode | Arena — Code Overall |
|---|---|---|---|
| | 2/2 | #1 66.9% | #1 1815 |
| | 2/2 | #2 63.1% | #5 1749 |
| | 2/2 | #3 61.8% | #8 1680 |
| | 2/2 | #5 61.0% | #3 1786 |
| | 2/2 | #9 59.5% | #10 1658 |
| | 1/2 | #19 56.5% | #2 1788 |
| | 1/2 | #4 61.0% | #15 1625 |
| | 1/2 | #23 55.8% | #4 1758 |
| | 1/2 | #6 60.9% | #20 1618 |
| | 1/2 | #21 56.4% | #6 1695 |
| | 1/2 | #7 59.8% | #23 1592 |
| | 1/2 | #16 57.6% | #7 1689 |
| | 1/2 | #8 59.7% | #11 1657 |
| | 1/2 | #29 54.1% | #9 1671 |
| | 1/2 | #10 59.0% | #16 1623 |
“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。