Terminal Bench 任务工坊

智能体基准,按需锻造。

我们为 AI 智能体打造 Terminal-Bench 格式的基准任务,配备参考解、Docker 环境、判分测试和任务验证检查。您可以选择任务类别,或定制所需任务集。

任务交付包示意 · 非实时运行
01 参考 Oracle02 Docker 测试套件03 验证套件
Terminal-Bench 格式参考解Docker 环境判分测试
我们锻造什么

每个任务都完整交付

基准任务的价值取决于其标准答案与评测框架。我们端到端交付全部三件套,并逐项验证。

参考 Oracle

参考解展示一种有效完成任务的方法。判分测试检查任务结果,而不要求智能体复刻 Oracle 的实现。

Docker 测试套件

为重复运行设计的容器化环境与测试套件。每次交付都会约定运行依赖和资源要求。

验证套件

检查任务说明、参考解执行和判分测试的行为,帮助在交付前发现含糊或有缺陷的任务。

任务格式

Terminal Bench:从提示到判定

任务由说明、运行环境和判分测试组成。Oracle 是用于验证任务的参考解;判分测试检查智能体的执行结果。每个订单都会约定目标 Terminal-Bench 或 Harbor 格式版本。

1

提示

带明确目标与约束的自然语言任务。

2

智能体

您的智能体在隔离容器中工作。

3

终端

智能体使用工具并修改环境。

4

判分测试

测试检查生成的文件与行为。

5

结果

评测框架记录判分测试的结果。

订单如何变成基准

从需求到交付

01

需求

告诉我们您需要评测的类别与约束。

02

锻造

我们编写任务及其运行环境。

03

Oracle

我们构建并验证参考解。

04

验证

Docker 与验证套件证明任务可解。

05

交付

打包、附文档,可直接接入您的框架。

需要我们没有的基准?

我们按您的规格定制类别——参考 Oracle、Docker 套件、验证,整套闭环。

联系销售