智能体工作
取自真实职业而非软件工程的多步任务——表格、文档、面向客户的流程——通过一个用工具的循环来完成。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard τ³-Banking | Artificial Analysis LLM Leaderboard GDPval-AA | Arena — Agent Overall |
|---|---|---|---|---|
| | 3/3 | #1 51.3% | #5 61.8% | #9 0.062 |
| | 3/3 | #7 44.7% | #1 67.2% | #1 0.125 |
| | 3/3 | #6 46.0% | #8 58.9% | #2 0.104 |
| | 3/3 | #8 44.3% | #6 61.1% | #3 0.097 |
| | 2/3 | #2 50.7% | #3 63.3% | — |
| | 2/3 | #3 50.3% | #2 63.4% | — |
| | 2/3 | #4 49.1% | #7 61.0% | — |
| | 2/3 | #14 37.3% | #10 54.8% | #7 0.066 |
| | 2/3 | #9 42.1% | #17 51.2% | #10 0.062 |
| | 1/3 | #13 38.1% | #4 61.9% | — |
| | 1/3 | — | — | #4 0.095 |
| | 1/3 | #5 48.0% | #15 52.3% | — |
| | 1/3 | — | — | #5 0.085 |
| | 1/3 | — | — | #6 0.081 |
| | 1/3 | — | — | #8 0.066 |
| | 1/3 | #17 34.8% | #9 56.4% | #17 0.021 |
| | 1/3 | #10 40.2% | #13 53.8% | #15 0.032 |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。