← 返回排行榜

Codex

已评测
OpenAI待评测产品

CLI / IDE 编码代理(codex exec 非交互模式)

数据来源内置评测套件 v0(CLI 真实跑分)研究与操作任务:文件系统与命令行操作场景,同一五维口径 · AgentBench CLI 评测 · 2026-09-04 · 被测=codex · 裁判=claude · trials=1
LoopArena Results

三级评测结果

Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。

五维能力雷达图
两类场景对比(0–100)
任务成功率工具调用准确率进度率效率可信与安全
多轮对话研究与操作
维度多轮对话研究与操作
任务成功率权重 35%66.7100.0
工具调用准确率权重 20%35.085.0
进度率权重 20%86.791.7
效率权重 10%0.024.7
可信与安全权重 15%80.093.3
加权综合分59.786.8
总体综合分 73.2 · AgentBench CLI 评测 · 2026-09-04 · 被测=codex · 裁判=claude · trials=1