agentcompass run 使用所选 Benchmark、Harness、Model 和 Environment 创建并执行一个评测请求。BENCHMARK HARNESS MODEL 是顺序固定的位置参数,Environment 通过 --env 选择。
运行最小评测
下面通过--benchmark-params 中的 sample_ids,按稳定任务 ID 选择一个 Benchmark 任务,用于快速验证组件和端点配置:
run 命令对应一个评测请求。需要协调多个显式评测请求时,请使用 agentcompass launch。
参数参考
本节说明agentcompass run 的参数用法,并列出完整签名、默认值和作用对象;并发、超时、重试、输出与调试参数的使用建议见运行控制。“内置默认值”指用户级、项目级或显式配置文件覆盖前使用的值。“按需”参数仅在所选组件或端点需要时必填。
组件选择与参数
配置与 Recipe
执行控制
设置多次尝试
例如,下面的参数会为每个任务计划 3 次独立 attempt,并采用
avg 策略汇总:
k=1 和 avg:每个任务只执行一次,指标按 native@1 输出。k>1 时,各 attempt 是独立的执行单元,并共同受 --task-concurrency 限制;两种策略的差异如下:
需要注意:
- 标量主指标使用
pass会在任务开始前报错。 k表示逻辑 attempt 数量,不包含 attempt 内部由--max-retries产生的 retry。avg@k、pass@k的精确定义以及缺失 attempt 的处理见指标与聚合。
launch 时,每个请求可以单独设置 k 和策略,详见为每个请求设置 k 和策略。
输出与复用
进程级设置
分析
组件专属 JSON 参数
四个 JSON 参数并不共享同一个结构。可用字段和默认值取决于所选组件:sample_ids 属于 --benchmark-params;多次尝试使用上述执行参数。provider 的 CPU、内存、镜像和网络设置属于 --env-params。评测各部分的概念分工见配置评测。