代理式程式設計
藉助工具迴圈解決真實程式碼儲存庫和終端機任務。這裡每個分數衡量的都是「模型 + 框架」的整體,所以同一個模型可能佔兩行,分別對應不同框架,這不是重複。
按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。
| 模型 | 進入前 10 | Artificial Analysis LLM Leaderboard Terminal-Bench 2.1 | Artificial Analysis Coding Agents Artificial Analysis Coding Agent Index | Artificial Analysis Coding Agents Terminal-Bench v4 | HarnessTax — SWE-bench Lite SWE-bench Lite | HarnessTax — Terminal-Bench 2.0 Terminal-Bench 2.0 |
|---|---|---|---|---|---|---|
| | 5/5 | #3 89.5% | #10 0.546 | #10 37.4% | #3 77.8% | #1 83.3% |
| | 3/5 | #1 91.4% | #5 0.622 | #3 57.6% | — | — |
| | 3/5 | #2 89.9% | #6 0.616 | #5 55.6% | — | — |
| | 3/5 | #4 89.1% | #7 0.597 | #7 54.5% | — | — |
| | 2/5 | #13 84.6% | — | — | #1 97.8% | #3 75.6% |
| | 2/5 | — | #1 0.684 | #1 66.2% | — | — |
| | 2/5 | #14 84.6% | — | — | #2 88.9% | #5 72.2% |
| | 2/5 | #20 80.9% | #16 0.432 | #17 14.6% | #7 55.6% | #2 76.7% |
| | 2/5 | — | #2 0.660 | #2 63.1% | — | — |
| | 2/5 | — | #3 0.638 | #4 56.1% | — | — |
| | 2/5 | #12 85.0% | #13 0.519 | #13 21.2% | #4 76.7% | #4 73.3% |
| | 2/5 | — | #4 0.629 | #6 54.5% | — | — |
| | 2/5 | #36 71.2% | — | — | #5 68.9% | #6 65.6% |
| | 2/5 | #77 44.2% | — | — | #6 60.0% | #7 47.8% |
| | 2/5 | — | #8 0.567 | #8 43.4% | — | — |
| | 1/5 | #5 88.8% | #15 0.433 | #15 16.7% | — | — |
| | 1/5 | #6 88.4% | #14 0.470 | #14 17.7% | — | — |
| | 1/5 | #7 88.0% | — | — | — | — |
| | 1/5 | #8 87.6% | #18 0.419 | #18 14.6% | — | — |
| | 1/5 | #9 86.1% | — | — | — | — |
| | 1/5 | #17 83.9% | #12 0.536 | #9 39.9% | — | — |
| | 1/5 | — | #9 0.563 | #11 33.3% | — | — |
| | 1/5 | #10 85.8% | — | — | — | — |
「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。