跳到正文
评测来源

Terminal-Bench 4 · 系统参考

Harbor / Terminal-Bench / 编程 · 保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。

官方评测
在 小意 AI 热榜 中仅供参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

固定 Terminal-Bench 4.0,分别保留模型、Agent 版本、推理档位和运行次数;不把不同工具系统解释为统一模型条件。

如何使用这份证据

原始成绩参考:锁定官方提交清单与数据版本后自动采集,逐条保留不同系统配置,不选模型代表分。只供交叉核对,不进入综合或编程排名。

评测局限与数据署名

不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次计入综合票权。

数据许可:Apache 2.0 · 官方 harbor-framework/terminal-bench 仓库内的成绩提交;保留署名、协议与修改说明。

成绩由 Harbor / Terminal-Bench 发布,原始分数与 小意 AI 热榜 共识分使用不同尺度,不能直接相加。