LoopArena Leaderboard
编程智能体排行榜
只对目前主流的编程智能体排序打分。主榜按 Type III 严格成功率(SSR)排名,也可以按 Type I / Type II 或成本排序;数据全部来自数据库中的评测记录, 新结果审核通过后榜单会自动刷新。
| 排名 | 编程智能体 ↕ | Type I · 合同准确率 ↕ | Type II · SSR ↕ | Type II · 成本 ↕ | Type III · SSR ↓ | Type III · 成本 ↕ |
|---|---|---|---|---|---|---|
| 1 | OpenAI gpt-5.5-0424-global | 87.78% | 51.85% | $5.00 | 24.69% | $18.84 |
| 2 | 阿里云 temperature 0 · 20,480 输出 token | 72.22% | 48.15% | $4.30 | 23.46% | $6.89 |
| 3 | Anthropic claude-opus-4-8 | 76.67% | 48.15% | $5.87 | 20.99% | $16.82 |
| 4 | 深度求索 temperature 0 · 20,480 输出 token | 77.78% | 45.68% | $2.10 | 19.75% | $10.24 |
| 5 | 智谱 temperature 0 · 20,480 输出 token | 74.44% | 37.04% | $1.63 | 16.05% | $4.86 |
SSR = Strict Success Rate:既通过任务 evaluator,又符合 LoopArena 协议才算成功。成本为无缓存口径的平均估算推理成本。
CLI 实测
编程智能体 CLI 实测榜
切换任务类型与指标,表格与雷达图会同步显示该口径下的真实分布。
排序指标
| 排名 | 编程智能体 | 综合分 | 任务成功率权重 35% | 工具调用准确率权重 20% | 进度率权重 20% | 效率权重 10% | 可信与安全权重 15% |
|---|---|---|---|---|---|---|---|
| 1 | Nous Research | 91.3 | 100.0 | 97.5 | 100.0 | 19.4 | 99.2 |
| 2 | Anthropic | 79.5 | 83.3 | 82.5 | 95.0 | 4.2 | 95.8 |
| 3 | OpenAI | 73.2 | 83.3 | 60.0 | 89.2 | 12.3 | 86.7 |
| 4 | opencode | 69.1 | 83.3 | 47.5 | 80.0 | 16.6 | 85.0 |
五维能力雷达图
两类场景平均(0–100)
HermesClaude CodeCodexOpenCode
Reference Policies
参考策略(不参与排名)
两条基线用同一个 Worker 与执行环境,用来回答「到底还需不需要 Controller」。
| 策略 | Type II · SSR | Type II · 成本 | Type III · SSR | Type III · 成本 |
|---|---|---|---|---|
| Fixed control 参考策略,不参与排名 | 46.91% | $1.08 | 18.52% | $5.58 |
| No control 参考策略,不参与排名 | 39.51% | $1.04 | 18.52% | $2.01 |