遇见数据集

SkillTV-Bench

收藏
github2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

SkillTV-Bench是一个基准测试,用于评估判断器能否确定长时间代理执行是否真正满足其任务。每个案例包含原始指令、标准化轨迹、任务时间技能和可直接检查的工件,并且提供可运行的代理环境。

SkillTV-Bench is a benchmark designed to evaluate whether a judge can determine whether a long-running agent execution truly fulfills its assigned task. Each case includes the original instruction, standardized trajectories, task-timed skills, and directly inspectable artifacts, and provides a runnable agent environment.

创建时间:
2026-08-05
原始信息汇总

SkillTV-Bench 数据集详情

数据集概述

SkillTV-Bench 是一个用于评估“裁判”(Judge)在技能增强型智能体执行(Skill-Augmented Agentic Execution)中判断能力的基准测试数据集。其核心目标是测试一个裁判模型能否判断一个长时程智能体执行过程是否真正满足了任务要求。

该数据集包含 681 条执行轨迹,来源于 50 个源任务,覆盖 11 个领域,每条轨迹附带 1–6 个技能,验证准确率提升可达 +14.8 个百分点

数据组成与划分

划分 Harbor 案例数 源任务数 领域数 标签(通过/失败) 预期用途
data/evaluation/ 203 14 9 47 / 156 固定基准评估与候选筛选
data/evolution/ 478 36 11 284 / 194 独立的 JudgeSkill 进化信号
总计 681 50 11 331 / 350 任务无关的基准数据集

每个独立案例包含:

  • 原始任务指令与标准化智能体轨迹
  • 任务智能体可用的 1–6 个技能
  • 最终产物与可检查的执行环境
  • 带有隐藏源标签的 Harbor 验证器
  • 用于确定性验证的逻辑溯源元数据

数据格式

每个案例是一个完整的 Harbor 任务,目录结构如下:

text <task-name>__<trial-id>/ ├── instruction.md ├── task.toml ├── metadata.json ├── environment/ │ ├── Dockerfile │ ├── original_task_instruction.md │ ├── trajectory.json │ ├── available_skills/ │ └── artifacts/ ├── solution/ │ └── solve.sh └── tests/ ├── test.sh └── test_outputs.py

推理过程中,真实标签仅由验证器持有,不对裁判暴露。

方法概述

  1. 构建基准:筛选 SkillsBench 执行记录,标准化事件流,附加任务时的技能与产物,并通过 Harbor 验证器封装标签。
  2. 进化 JudgeSkill:在独立的开发集上分析错误,提出针对性修订,通过固定加权门控提升候选方案。
  3. 推理时验证:构建检查计划,执行产物与过程检查,记录检查日志,输出基于证据的 PASS 或 FAIL 判断。

主要结果

对比项 无精细 JudgeSkill 有精细 JudgeSkill 变化
智能体裁判准确率 43.8% 58.6% +14.8 pp
智能体裁判平衡准确率 56.8% 63.4% +6.6 pp
10 次 rollout 的轨迹选中成功率 33.9% 45.5% +11.6 pp

在 10 次 rollout 时,SkillTV-Evolve 相比常见的单次 rollout 成功率(22.9%)提升 22.6 个百分点,并超过最强的非技能 rollout 基线(38.4%)7.1 个百分点。完整评估集上的准确率从 JudgeSkill v1 到 v4 单调上升。

数据来源与处理

源轨迹来自 benchflow-ai/skillsbench-trajectories 仓库中 xiangyi-completed/withskills-claude-code 归档集合。SkillTV-Bench 在此基础上增加了自身的过滤、标准化、任务无关划分、产物选择、匿名化和 Harbor 裁判任务封装。

可复现性与数据卫生

  • data/MANIFEST.json 记录了确定性划分哈希、字节数、文件数、标签数和最大文件校验值。
  • 评估集与进化集在源任务层面完全不相交。
  • 标签仅在预测结果生成后才被加载。
  • 常见工作站路径和 Office 作者元数据在任务构建时已被脱敏。
  • 凭据、私有端点、生成任务、模型输出和本地配置均不纳入版本控制。

使用方式

  • 环境要求:Python 3.12 或更高版本,建议安装 uv、Docker 及所配置裁判智能体的 CLI。
  • 安装:git clone https://github.com/HanZhi306/SkillTV-Bench.git 后执行 uv sync --frozen
  • 可通过 Harbor 运行智能体裁判(uv run harbor run -c configs/harbor.example.yaml),或通过脚本运行直接 LLM 裁判和基于验证器的 rollout 选择。

许可证

  • 代码与文档:Apache-2.0
  • 基准数据:CC BY 4.0
  • 第三方材料遵循其相邻或上游许可证管理
搜集汇总
数据集介绍
SkillTV-Bench 数据集图片
构建方式
SkillTV-Bench的构建源于对长时程智能体执行验证的深层需求。研究团队从benchflow-ai/skillsbench-trajectories的存档轨迹中,精选出50个源任务、681条执行轨迹,并经过严格的过滤、标准化、任务级别不相交划分、工件选择与匿名化处理,最终封装为Harbor格式的完整判题任务。每个案例均包含原始指令、归一化轨迹、任务时技能、可检查的工件与执行环境,以及隐藏真实标签的Harbor验证器,确保判定过程公正且可复现。数据划分为203个案例的评估集与478个案例的演化集,两者在源任务层面完全隔离,以支持固定的基准评估与可重用的JudgeSkill进化。
特点
SkillTV-Bench的核心特色在于其任务时技能(task-time skills)的引入,将原本仅依赖最终响应的浅层检查,转变为基于证据的定向验证。每个案例附带1至6个技能,这些技能引导评判者制定检查计划,收集工件与过程证据,并输出可审计的PASS或FAIL判断。此外,数据集具有严格的逻辑溯源元数据、任务级不相交的划分策略,以及确定性验证机制,确保了评估结果的可信性与可重复性。其配套的SkillTV-Evolve方法,通过开发时循环分析错误并门控式迭代JudgeSkill,在无参数更新的情况下,将验证准确率从43.8%提升至58.6%,充分彰显了技能增强型评判的潜力。
使用方法
SkillTV-Bench的使用遵循完备的流程,支持三种核心场景:基于代理的评判(agent-as-judge)、直接LLM评判(LLM-as-judge)以及验证器引导的滚动选择(verifier-guided rollout selection)。用户通过克隆仓库并运行`uv sync --frozen`安装依赖,随后根据指南配置评判代理或调用基线脚本。示例配置直接读取已发布的评估数据,无需任何预处理。此外,数据集还支持JudgeSkill进化循环,允许用户在私有数据上迭代改进技能,并通过固定门控机制验证每次修订的有效性。所有推理流程均在预测生成后才暴露真实标签,并附有数据清单与验证脚本,确保实验的透明性与可复现性。
背景与挑战
背景概述
SkillTV-Bench数据集由上海交通大学、上海人工智能实验室、中山大学及伦敦大学学院的研究者于2026年联合构建,旨在系统评估裁判模型在技能增强型智能体长时程执行任务中的验证能力。该数据集基于SkillsBench轨迹库,精选681条执行轨迹,覆盖50个源任务与11个领域,为每条轨迹精心配置1至6项任务时技能、执行环境及可检测工件,并以Harbor验证器封装隐藏标签。其核心研究问题在于,当智能体仅提供最终响应时,裁判模型难以甄别执行过程中的关键缺陷;SkillTV-Bench通过引入任务时技能,促使裁判从表面化输出检查转向证据驱动的定向验证,从而推动智能体执行验证范式的重要转变,为提升智能体可靠性与可审计性奠定了高影响力基准。
当前挑战
SkillTV-Bench所解决的领域挑战在于,现有裁判模型面对长时程智能体执行时,常因上下文碎片化而遗漏任务关键性失败,无法准确判断执行是否真正满足任务指令。构建过程亦面临多重挑战:原始轨迹来源异构,需进行事件流标准化与匿名化处理;为确保数据完整性,需在保留任务逻辑的前提下筛选代表性工件;评测集与演化集必须在源任务层面严格隔离,以防数据泄漏;每条案例需封装为可运行的Harbor任务,实现确定性验证与可复现评估。此外,裁判技能的精炼需要在无参数更新的条件下,通过误差分析与固定门控机制迭代优化,平衡推理成本与验证精度,构成了兼具理论深度与实践难度的复合挑战。
常用场景
经典使用场景
SkillTV-Bench作为一项前沿的评估基准,其核心应用场景聚焦于评判长时间跨度、技能增强型智能体执行的验证效能。该基准精妙地将原始指令、标准化轨迹、任务时技能与可检视工件封装于可运行的agentic环境之中,旨在检验评判者能否精准区分任务是否真正得以满足。通过提供包含681条轨迹、覆盖11个领域的丰富数据集,研究者得以系统性地度量各类评判模型(如直接LLM-as-judge或agent-as-judge)在部分上下文情境下的验证能力,从而推动智能体评估方法的科学化与规范化发展。
解决学术问题
该数据集直面智能体执行验证中的核心学术挑战:传统评判方法往往仅审视最终响应而忽略执行过程的关键细节,导致对长时程任务完成状态的误判。SkillTV-Bench通过引入任务时技能与可审计的评判流程,解决了部分上下文评判者因证据缺失而无法识别任务关键失败的问题。其研究意义在于,它提供了首个以技能增强执行为对象的标准化验证基准,揭示了评判准确率从43.8%至58.6%的显著提升空间,为领域内关于证据驱动验证与技能感知评估的理论探讨奠定了实证基础,深刻影响了智能体可靠性研究的范式演进。
衍生相关工作
围绕SkillTV-Bench已衍生出一系列引领性的学术成果与工程实践。其中,SkillTV-Evolve所提出的JudgeSkill机制成为一大亮点,其通过固定门控的演进循环,在不更新模型参数的前提下,持续优化评判技能的版本迭代(v1至v4),实现了验证准确率的单调递增。这一方法论启发了后续研究对可训化验证器、证据基础评判逻辑以及任务时技能自动构建的深入探索。此外,该基准与Harbor评估框架的深度整合,促进了开放可复现的智能体评估生态的构建,激励了更多关于部分上下文评判、轨迹归一化与artifact选择等子问题的研究,为智能体评估领域的持续创新注入了活力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务