← 返回排行榜
Qwen3.7-Plus
已评测阿里云被评测模型
temperature 0 · 20,480 输出 token
数据来源LoopArena Table 2Type III 完整任务,严格成功率口径 · arXiv 2608.28281 · 2026-08
LoopArena Results
三级评测结果
Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。
Type I · 合同选择
四选一 · 构建时已执行验证 · 零 Worker 运行
该档位无分数(不适用)。
90 题响应成本$0.70
Type II · 任务切片
从准备好的中间工作区开始
SSR(严格成功率)
48.15%
95% CI:30.86% – 65.43%
平均估算推理成本$4.30
来源拆分(成功 / 样本)
BeyondSWE
18/4837.50%
SCBench
21/3363.64%
Type III · 完整任务
从原始状态开始 · 最终标准
SSR(严格成功率)
23.46%
95% CI:9.88% – 38.27%
平均估算推理成本$6.89
来源拆分(成功 / 样本)
BeyondSWE
14/4829.17%
SCBench
5/3315.15%
关键发现
官网 findings · v0.1.0 · 校验于 2026-08-28Type II ↔ Type III 一致性
Spearman ρ = 0.9747
任务切片与完整任务的 Controller 排名高度一致。
Type II 相对 Type III
成本 -64.4%
切片评估显著降低推理成本,仍是有效代理指标。
核心策略发现
Core checks
跟踪进度、指导下一步、要求验证是 Controller 的关键能力。