后两个字段放在
execution 下,下面的示例展示各个入口的传入方式。
设置执行与评测预算
下面的示例给 agent 3,600 秒、评分 600 秒,并为整次评测设置 7,200 秒的总时限。任务、Model 环境变量和 Docker 配置与快速开始一致。- CLI
- YAML
- Python SDK
launch 时,通过 --timeout-seconds 设置总时限;公共任务预算放在 defaults.execution 下,单个请求的覆盖值放在 requests[].execution 下。
总时限从组件预检完成后开始,覆盖任务加载、准备、执行、评分、分析和汇总。默认值为 360000 秒(100 小时),显式设置为 0 可取消总时限。到期后,未完成的工作会被取消,并开始资源清理;清理可能在总时限之后继续进行。
任务预算不会延长总时限。估算总时长时,要给调度、全部任务及重试、结果收集和评测留出时间。总时限可能在这些阶段中的任意一个阶段到期。
理解默认值
所有时间值的单位都是秒。execution 中的时间设置接受有限正数,0 不能用于禁用任务超时。
未填写字段或将其设为
null 时,依次继承 Benchmark 计划预算、task 预算;执行阶段还可回退到 Harness 默认值。所有来源都没有提供预算时,该阶段不设时限。设置 null 不会清除已继承的预算。
每次 attempt 和重试都会重新开始阶段计时。执行和评分独立计时;执行阶段未用完的时间不会累加到评分阶段。
如果任务已经有合适的相对预算,而你想统一延长它们,可以设置倍率。例如,下面的配置将 agent 执行预算加倍,评分预算保持原值:
最终预算为
基础秒数 × 有效倍率。阶段专属倍率替换公共倍率,两者不会相乘;显式设置的预算也会应用倍率。没有基础预算时,倍率不会产生时限。收集预算和执行补偿不受倍率影响。
查看各阶段的超时范围
下图展示包含 Harness 和独立评测 Environment 的一次 attempt。从左向右阅读,列宽不代表实际耗时。部分 Benchmark 会跳过产物传输,或在执行 Environment 中评分。run_timeout_seconds。
单次请求与命令时限
run_timeout_seconds 和 evaluation_timeout_seconds 限制整个阶段;阶段中的模型请求、工具命令或评委请求还可能有自己的时限。延长阶段预算不会同步延长这些时限。单次操作超时后是否重试、继续执行或终止,由对应组件决定。
下面列出常见设置,链接指向对应组件的参数说明。字段及默认值由所选组件决定,并非所有 Harness 或 Benchmark 都支持这些字段。
例如,下面的
mini_swe_agent 命令将整个 agent 执行预算设为 3,600 秒,每次模型请求的时限为 120 秒,每条工具命令的时限为 300 秒:
model_params、harness_params 和 benchmark_params。使用 --config 时,Harness 和 Benchmark 字段直接写在 harnesses、benchmarks 下的对应组件 ID 中;Model 参数通过运行命令、编排请求或 SDK 提供。完整写法见配置文件结构。
查询所选 Harness 或 Benchmark 的完整字段和默认值:
进阶参数
没有对应操作的失败时,可以保留默认值。这些字段都放在execution 下,通过 CLI 的 --execution-params、YAML 或 SDK 的 execution_params 设置。
补偿、结果收集、单条准备命令和传输预算必须是有限正数。准备与传输限制的使用示例见保存与准备产物。
给 Harness 留出超时收尾时间
部分 Harness 会在准备 agent 后才启动内部执行计时器。runtime 默认为 Harness 执行额外预留 120 秒,让内部准备和停止收尾有时间完成,避免立即打断内部超时处理。将最终执行预算记为T 秒,Harness 获得 T 秒,runtime 的外层执行预算为 T + 120 秒。
如果 agent 准备异常缓慢,或日志显示 runtime 超时时 Harness 尚未完成停止收尾,可增大补偿值。例如:
延长结果收集时间
如果执行已结束,但收集答案、日志或轨迹超过 60 秒,可以增大结果收集预算:排查超时
先查看任务的 issues 和run.log,确认哪一步超时,再调整对应参数。需要检查的文件见排查运行失败。
