SkillTV-Bench
收藏资源简介:
SkillTV-Bench是一个基准测试,用于评估判断器能否确定长时间代理执行是否真正满足其任务。每个案例包含原始指令、标准化轨迹、任务时间技能和可直接检查的工件,并且提供可运行的代理环境。
SkillTV-Bench is a benchmark designed to evaluate whether a judge can determine whether a long-running agent execution truly fulfills its assigned task. Each case includes the original instruction, standardized trajectories, task-timed skills, and directly inspectable artifacts, and provides a runnable agent environment.
SkillTV-Bench 数据集详情
数据集概述
SkillTV-Bench 是一个用于评估“裁判”(Judge)在技能增强型智能体执行(Skill-Augmented Agentic Execution)中判断能力的基准测试数据集。其核心目标是测试一个裁判模型能否判断一个长时程智能体执行过程是否真正满足了任务要求。
该数据集包含 681 条执行轨迹,来源于 50 个源任务,覆盖 11 个领域,每条轨迹附带 1–6 个技能,验证准确率提升可达 +14.8 个百分点。
数据组成与划分
| 划分 | Harbor 案例数 | 源任务数 | 领域数 | 标签(通过/失败) | 预期用途 |
|---|---|---|---|---|---|
| data/evaluation/ | 203 | 14 | 9 | 47 / 156 | 固定基准评估与候选筛选 |
| data/evolution/ | 478 | 36 | 11 | 284 / 194 | 独立的 JudgeSkill 进化信号 |
| 总计 | 681 | 50 | 11 | 331 / 350 | 任务无关的基准数据集 |
每个独立案例包含:
- 原始任务指令与标准化智能体轨迹
- 任务智能体可用的 1–6 个技能
- 最终产物与可检查的执行环境
- 带有隐藏源标签的 Harbor 验证器
- 用于确定性验证的逻辑溯源元数据
数据格式
每个案例是一个完整的 Harbor 任务,目录结构如下:
text <task-name>__<trial-id>/ ├── instruction.md ├── task.toml ├── metadata.json ├── environment/ │ ├── Dockerfile │ ├── original_task_instruction.md │ ├── trajectory.json │ ├── available_skills/ │ └── artifacts/ ├── solution/ │ └── solve.sh └── tests/ ├── test.sh └── test_outputs.py
推理过程中,真实标签仅由验证器持有,不对裁判暴露。
方法概述
- 构建基准:筛选 SkillsBench 执行记录,标准化事件流,附加任务时的技能与产物,并通过 Harbor 验证器封装标签。
- 进化 JudgeSkill:在独立的开发集上分析错误,提出针对性修订,通过固定加权门控提升候选方案。
- 推理时验证:构建检查计划,执行产物与过程检查,记录检查日志,输出基于证据的 PASS 或 FAIL 判断。
主要结果
| 对比项 | 无精细 JudgeSkill | 有精细 JudgeSkill | 变化 |
|---|---|---|---|
| 智能体裁判准确率 | 43.8% | 58.6% | +14.8 pp |
| 智能体裁判平衡准确率 | 56.8% | 63.4% | +6.6 pp |
| 10 次 rollout 的轨迹选中成功率 | 33.9% | 45.5% | +11.6 pp |
在 10 次 rollout 时,SkillTV-Evolve 相比常见的单次 rollout 成功率(22.9%)提升 22.6 个百分点,并超过最强的非技能 rollout 基线(38.4%)7.1 个百分点。完整评估集上的准确率从 JudgeSkill v1 到 v4 单调上升。
数据来源与处理
源轨迹来自 benchflow-ai/skillsbench-trajectories 仓库中 xiangyi-completed/withskills-claude-code 归档集合。SkillTV-Bench 在此基础上增加了自身的过滤、标准化、任务无关划分、产物选择、匿名化和 Harbor 裁判任务封装。
可复现性与数据卫生
data/MANIFEST.json记录了确定性划分哈希、字节数、文件数、标签数和最大文件校验值。- 评估集与进化集在源任务层面完全不相交。
- 标签仅在预测结果生成后才被加载。
- 常见工作站路径和 Office 作者元数据在任务构建时已被脱敏。
- 凭据、私有端点、生成任务、模型输出和本地配置均不纳入版本控制。
使用方式
- 环境要求:Python 3.12 或更高版本,建议安装
uv、Docker 及所配置裁判智能体的 CLI。 - 安装:
git clone https://github.com/HanZhi306/SkillTV-Bench.git后执行uv sync --frozen。 - 可通过 Harbor 运行智能体裁判(
uv run harbor run -c configs/harbor.example.yaml),或通过脚本运行直接 LLM 裁判和基于验证器的 rollout 选择。
许可证
- 代码与文档:Apache-2.0
- 基准数据:CC BY 4.0
- 第三方材料遵循其相邻或上游许可证管理




