智能体编程
通过一个用工具的循环,解决真实的仓库任务和终端任务。此处每一个分数衡量的都是“模型 + 执行框架”,所以条目会把执行框架作为变体带上,同一个模型出现两行是预期之内,而不是重复。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard Terminal-Bench 2.1 | Artificial Analysis LLM Leaderboard Agentic Index | Artificial Analysis Coding Agents Artificial Analysis Coding Agent Index | Artificial Analysis Coding Agents Terminal-Bench v2 |
|---|---|---|---|---|---|
| | 4/4 | #1 89.5% | #5 57.8 | #2 0.666 | #1 87.7% |
| | 4/4 | #2 89.1% | #1 59.2 | #1 0.667 | #5 84.9% |
| | 4/4 | #4 88.0% | #10 50.2 | #4 0.623 | #7 84.1% |
| | 4/4 | #6 85.0% | #8 54.3 | #6 0.613 | #8 83.7% |
| | 3/4 | #10 81.6% | #14 48.9 | #3 0.644 | #3 85.3% |
| | 2/4 | #5 85.8% | #18 45.1 | #11 0.571 | #2 86.1% |
| | 2/4 | #8 83.9% | #2 59.1 | — | — |
| | 2/4 | #3 88.4% | #3 58.7 | — | — |
| | 2/4 | #11 81.3% | #4 58.4 | #9 0.598 | #11 79.4% |
| | 2/4 | — | — | #5 0.615 | #6 84.1% |
| | 2/4 | #9 82.0% | #6 57.1 | — | — |
| | 2/4 | #7 84.6% | #7 56.6 | — | — |
| | 2/4 | — | — | #7 0.606 | #9 81.3% |
| | 2/4 | #12 80.9% | #16 46.9 | #10 0.587 | #10 79.8% |
| | 1/4 | — | — | #12 0.555 | #4 84.9% |
| | 1/4 | #14 80.1% | #13 49.3 | #8 0.605 | #12 78.6% |
| | 1/4 | #15 79.8% | #9 50.9 | — | — |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。