LoopArena Leaderboard

编程智能体排行榜

只对目前主流的编程智能体排序打分。主榜按 Type III 严格成功率(SSR)排名,也可以按 Type I / Type II 或成本排序;数据全部来自数据库中的评测记录, 新结果审核通过后榜单会自动刷新。

排名编程智能体Type I · 合同准确率Type II · SSRType II · 成本Type III · SSRType III · 成本
1
OpenAI
gpt-5.5-0424-global
87.78%51.85%$5.00
24.69%
$18.84
2
阿里云
temperature 0 · 20,480 输出 token
72.22%48.15%$4.30
23.46%
$6.89
3
Anthropic
claude-opus-4-8
76.67%48.15%$5.87
20.99%
$16.82
4
深度求索
temperature 0 · 20,480 输出 token
77.78%45.68%$2.10
19.75%
$10.24
5
智谱
temperature 0 · 20,480 输出 token
74.44%37.04%$1.63
16.05%
$4.86

SSR = Strict Success Rate:既通过任务 evaluator,又符合 LoopArena 协议才算成功。成本为无缓存口径的平均估算推理成本。

CLI 实测

编程智能体 CLI 实测榜

切换任务类型与指标,表格与雷达图会同步显示该口径下的真实分布。

排序指标
排名编程智能体综合分任务成功率权重 35%工具调用准确率权重 20%进度率权重 20%效率权重 10%可信与安全权重 15%
1
Nous Research
91.3100.097.5100.019.499.2
2
Anthropic
79.583.382.595.04.295.8
3
OpenAI
73.283.360.089.212.386.7
4
opencode
69.183.347.580.016.685.0
五维能力雷达图
两类场景平均(0–100)
任务成功率工具调用准确率进度率效率可信与安全
HermesClaude CodeCodexOpenCode
Reference Policies

参考策略(不参与排名)

两条基线用同一个 Worker 与执行环境,用来回答「到底还需不需要 Controller」。

策略Type II · SSRType II · 成本Type III · SSRType III · 成本
Fixed control
参考策略,不参与排名
46.91%$1.0818.52%$5.58
No control
参考策略,不参与排名
39.51%$1.0418.52%$2.01