> ## Documentation Index
> Fetch the complete documentation index at: https://opencompass-docs-preview-pr-335-0.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Terminal-Bench 2.1

Terminal-Bench 2.1 是 AgentCompass 对 Terminal-Bench 2.1 任务集的入口。它与 [Terminal-Bench 2](/zh/user_guide/modules/benchmarks/terminal_bench_2) 使用相同的容器执行和验证流程，通常搭配 [`terminus2`](/zh/user_guide/modules/harnesses/terminus2) Harness。

## 工作原理

1. **加载任务。** 使用默认数据集地址时，AgentCompass 通过 Harbor CLI 下载 Terminal-Bench 2.1；若显式配置为常规 Git 数据源，则改为浅克隆。
2. **运行 agent。** Environment Recipe 选择每个任务声明的镜像，并在准备好的终端工作区中启动 agent。
3. **验证结果。** 任务的 `tests/test.sh` 通过 Harbor 验证器执行；奖励为 `1` 时记录为 `correct`。

## 参数

使用默认数据集运行全部任务时，无需传入 `--benchmark-params`。需要筛选任务或调整指标聚合时，使用 [Benchmark 共享参数](/zh/user_guide/modules/benchmarks/overview)。运行和评测的超时与倍率通过 `--execution-params` 配置，见[超时设置](/zh/user_guide/using_agentcompass/timeouts)。

## 运行示例

`agentcompass run` 的三个位置参数依次为 Benchmark、Harness 和 Model。以下命令使用 `terminal_bench_2_1`，Harness 的选择见下文。

运行前请确认本地 [Docker](/zh/user_guide/modules/environments/providers/docker) 可用，并设置 `MODEL_NAME`、`MODEL_BASE_URL` 和 `MODEL_API_KEY`，分别指定被测 Model、API 地址和密钥。

### 推荐 Harness

推荐使用终端 agent [`terminus2`](/zh/user_guide/modules/harnesses/terminus2)。

<Tabs>
  <Tab title="冒烟测试（单条跑通）">
    运行 `filter-js-from-html` 一条任务，验证容器准备、推理和评分的完整链路，其余参数使用默认值。

    ```bash wrap theme={"system"}
    agentcompass run \
      terminal_bench_2_1 \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --benchmark-params '{
        "sample_ids": ["filter-js-from-html"]
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>

  <Tab title="自定义参数">
    评测默认数据集的全部任务，并提高推理和评测超时倍率，适用于 Model 响应较慢或工具执行耗时较长的环境。

    ```bash wrap theme={"system"}
    agentcompass run \
      terminal_bench_2_1 \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --execution-params '{
        "evaluation_timeout_multiplier": 8,
        "run_timeout_multiplier": 16
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>

  <Tab title="AgentCompass 推荐配置">
    AgentCompass 推荐配置进行完整评测。model 服务状况、部署实例数、任务并发数或 model 能力等导致任务耗时增加时，可通过 `--execution-params` 设置 `evaluation_timeout_multiplier` 和 `run_timeout_multiplier`。

    ```bash wrap theme={"system"}
    agentcompass run \
      terminal_bench_2_1 \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{
        "max_turns": 300
      }' \
      --execution-params '{
        "run_timeout_seconds": 14400
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>
</Tabs>

### 其他可选 Harness

[`codex`](/zh/user_guide/modules/harnesses/codex) 和 [`claude_code`](/zh/user_guide/modules/harnesses/claude_code) 是其他两个可选 Harness。运行时传入 `--recipe terminalbench2_1_docker_ac` 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖，方便运行 Codex、Claude Code 等需要这些依赖的 Harness。以下命令均评测完整数据集；运行 Codex 时，模型接入信息须对应 OpenAI Responses API，运行 Claude Code 时须对应 Anthropic Messages API。

<Tabs>
  <Tab title="使用官方镜像运行">
    不传 `--recipe` 即使用官方任务镜像。它不包含节点环境引导依赖，因此需显式传入对应安装命令。

    ```bash wrap theme={"system"}
    # Codex
    agentcompass run \
      terminal_bench_2_1 \
      codex \
      "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{
        "install_command": "apt-get update && apt-get install -y curl ca-certificates && curl -fsSL https://deb.nodesource.com/setup_20.x | bash - && apt-get install -y nodejs && npm install -g @openai/codex"
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol openai-responses

    # Claude Code
    agentcompass run \
      terminal_bench_2_1 \
      claude_code \
      "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{
        "install_command": "apt-get update && apt-get install -y curl ca-certificates && curl -fsSL https://deb.nodesource.com/setup_20.x | bash - && apt-get install -y nodejs && npm install -g @anthropic-ai/claude-code"
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol anthropic
    ```
  </Tab>

  <Tab title="使用 AgentCompass 镜像">
    传入 `--recipe terminalbench2_1_docker_ac` 即可指定 AgentCompass 的专用镜像，无需显式传入对应安装命令。

    ```bash wrap theme={"system"}
    # Codex
    agentcompass run \
      terminal_bench_2_1 \
      codex \
      "$MODEL_NAME" \
      --env docker \
      --recipe terminalbench2_1_docker_ac \
      --task-concurrency 16 \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol openai-responses

    # Claude Code
    agentcompass run \
      terminal_bench_2_1 \
      claude_code \
      "$MODEL_NAME" \
      --env docker \
      --recipe terminalbench2_1_docker_ac \
      --task-concurrency 16 \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol anthropic
    ```
  </Tab>
</Tabs>

<a id="输出" />

## 评测结果

通用结果说明见[运行目录](/zh/user_guide/other_features/results/overview#目录布局)、[汇总成绩](/zh/user_guide/other_features/results/summary_analysis)和[单题文件与公共字段](/zh/user_guide/other_features/results/task_results)。

<a id="聚合指标summarymd" />

### 评分指标

Terminal-Bench 2.1 的主指标是二元 `correct`，记录前文[验证流程](#工作原理)的通过判定；验证器奖励恰好为 `1` 时记为 `true`，其他有效奖励值记为 `false`，不提供部分分。

默认配置下，每题尝试一次，总体成绩为有效计分任务的通过率，取值为 0–1，越高越好。

多次尝试、分类聚合和计分异常的处理见[指标与聚合](/zh/user_guide/other_features/results/metrics_aggregation)。

<a id="单任务详情details" />

### 单题结果与评分依据

`meta.benchmark` 下的 `eval_raw_data` 保存 Harbor 验证器的判分依据：

| 字段 | 内容 |
| - | - |
| `verify_result` | 验证器原始结果；其中 `rewards` 的 `reward` 是生成通过判定的数值依据，有结果时才提供。 |
| `testcase_output` | 验证器的 `test-stdout.txt` 内容，包含测试输出。 |
| `verifier` | 验证阶段的开始与结束时间。 |
| `error` | 验证器发生异常时的诊断信息。 |


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.