基准对比LoopArena × SWE-bench
SWE-bench 测「整体行不行」,
LoopArena 把「控制能力」单独拆出来测
SWE-bench 是编程智能体领域使用最广的基准:给 Agent 一个真实 GitHub issue 和仓库快照, 让它产出补丁,然后跑仓库测试看问题是否被解决。它回答的是「整套系统端到端行不行」, 但无法区分功劳属于模型、还是属于外围 scaffold。 LoopArena 的核心差异在于把 Controller(决策)与 Worker(执行)分开: 固定同一个 Worker 后,不同 Controller 之间的分数差只反映控制能力的差异。 两个基准并不矛盾——SWE-bench 适合验收系统整体,LoopArena 适合定位「控制」这一层的强弱。
逐项对比
两个基准,两种测量目标
下表按双方公开论文的口径整理:左列为对比维度,中列为 SWE-bench(含 Verified 子集),右列为 LoopArena。
| 维度 | SWE-bench | LoopArena |
|---|---|---|
| 提出方 / 时间 | 普林斯顿大学团队,2023 年 10 月(arXiv 2310.06770) | LoopArena 论文(arXiv 2608.28281) |
| 任务来源 | 12 个流行 Python 开源仓库的 2,294 个真实 GitHub issue;Verified 版为 OpenAI 人工筛选的 500 条子集(2024 年 8 月) | 编程任务经任务切片器拆解,以 Loop Contract 分片下发给 Worker 执行 |
| 被评测对象 | Agent 系统整体(模型 + scaffold 混合,不区分谁在做决策、谁在执行) | Controller 只决策、Worker 只动手;固定 Worker(Qwen3.7-Plus)后分数差只反映控制能力 |
| 任务接口 | issue 描述 + 代码仓库快照,Agent 自由探索并产出补丁 | Evidence Packet(证据包)+ Loop Contract(循环合同):Controller 必须显式选择合同并给出验收条件 |
| 评测方式 | 应用补丁后运行仓库测试(FAIL_TO_PASS + PASS_TO_PASS),二值判定 | Type I 合同选择 / Type II 任务切片 / Type III 完整任务三级评测,成本递减逼近同一结论 |
| 核心指标 | % Resolved(解决率) | 严格成功率(SSR)+ 估算推理成本($/run),排名一致性 Spearman ρ 0.9747 |
| 对 scaffold 的敏感度 | 高:同一模型换 scaffold(Agent 框架)后排名可能明显变化,难以归因 | 低:Worker 与执行环境统一固定,差异可归因到 Controller 的决策能力 |
| 回答的问题 | 这套 Agent 系统整体能不能把真实 issue 修好? | Agent 的「控制能力」(拆解、选合同、验收、纠偏)本身有多强? |
能力隔离
为什么「拆开测」重要
在端到端基准里,一次失败可能是模型判断力不行,也可能只是工具封装或提示词脚手架的问题—— 分数本身不会告诉你。LoopArena 用 Evidence Packet(证据包)统一信息输入、用 Loop Contract(循环合同)统一任务下发与验收, 再把 Worker 固定为同一模型,让「控制」成为唯一变量。 三级评测让预算不同的团队都能参与:从秒级的合同选择,到完整任务的严格成功率。
Type I
合同选择
给 Evidence Packet,Controller 从候选 Loop Contract 中选正确的一份。秒级出分,成本最低。
Type II
任务切片
Controller 按选定的 Loop Contract 指挥固定 Worker 完成单个任务切片,测单步控制质量。
Type III
完整任务
从零跑完整个编码任务,按严格成功率(SSR)计分——本站主榜即按 Type III SSR 排名。
怎么选
两个基准各自的适用场景
选 SWE-bench,当你要——
- · 验收一套完整 Agent 系统(模型 + scaffold + 工具链)在真实 issue 上的端到端表现;
- · 与社区已有的大量公开结果横向对照(SWE-bench 已积累多个公开榜单与复现数据);
- · 在 12 个流行 Python 仓库的真实维护场景中做发布前回归。
选 LoopArena,当你要——
- · 单独比较不同模型的控制与决策能力,排除 scaffold 差异的干扰;
- · 用 Type I / II 低成本档位快速初筛,再用 Type III 严格成功率定榜;
- · 同时关注「做不做得完」和「花多少钱做完」(估算推理成本 $/run)。
!
口径提醒:SWE-bench 的 % Resolved 与 LoopArena 的 SSR 测量目标不同,分数不可直接互换或合并排名; 同一模型在两个基准上的名次差异,往往反映的是评测口径而非能力矛盾。
参考来源
- · SWE-bench 论文:SWE-bench: Can Language Models Resolve Real-World GitHub Issues?(arXiv 2310.06770)
- · SWE-bench Verified(OpenAI,500 条人工验证子集):Introducing SWE-bench Verified
- · LoopArena 论文:LoopArena(arXiv 2608.28281),本站榜单数据来自其 Table 2 公开快照。