遇见数据集

Skill-Use

收藏
github2026-08-07 更新2026-08-12 收录
官方服务:

资源简介:

Skill-Use是一个用于评估大语言模型代理在逐步披露下实际识别、遵循和保持在技能范围内的基准测试数据集。它包含79个真实技能、177个可执行任务和177个轨迹评分标准,覆盖9个领域,并分解为触发、合规性和边界三个可观察的方面。

Skill-Use is a benchmark dataset designed to assess the practical ability of large language model (LLM) agents to identify, adhere to, and stay within their defined skill boundaries under step-by-step disclosure. It comprises 79 real-world skills, 177 executable tasks, and 177 trajectory-based scoring criteria, spanning 9 distinct domains, and is structured into three observable aspects: triggering, compliance, and boundary.

创建时间:
2026-07-29
原始信息汇总

数据集概述

Skill-Use 是一个用于评估大型语言模型(LLM)在智能体框架(Agentic Harnesses)中是否真正具备“技能使用”能力的基准数据集。其核心目标是衡量 LLM 智能体在渐进式信息揭示(progressive disclosure)条件下,能否在实际操作中识别(recognize)、遵循(follow)并保持在(stay within)给定技能的范围之内。

核心规模

指标 数量
真实技能(Real Skills) 79
可执行任务(Executable Tasks) 177
轨迹评分标准(Trajectory Rubrics) 177
覆盖领域(Domains) 9
智能体框架(Agent Harnesses) 2
评分条目总数 1,314(平均每个评分标准 7.4 项,范围 3–16)
技能衍生评分条目 882(用于评估遵循度与边界)

评估维度

Skill-Use 将技能使用能力分解为三个独立可观测的方面,并基于完整轨迹而非最终答案进行评分:

  1. 触发(Trigger) — 智能体是否调用了相关技能。
  2. 遵循(Compliance) — 智能体是否忠实遵循了规定的操作流程。
  3. 边界(Boundary) — 智能体是否避免了被禁止的操作。

数据集内容

  • 技能文档:以重写后的源形式提供(skill/skill.md)。
  • 任务定义:以 YAML 格式存储,每个技能配对多个任务。
  • 轨迹评分标准:与任务一一对应,用于评估智能体执行轨迹。
  • 沙箱资源:为每个任务提供真实文件,置于运行环境中用于执行测试。
  • 评分引擎:包含 score_trace.pyscore_matrix.py 等脚本,用于自动评分并生成排行榜。

主要结果摘要

该基准评估了来自 7 个家族的 8 个前沿 LLM,在 Claude CodeCodex 两种智能体框架下的表现:

  • 最佳模型-框架组合的 SU(技能使用)得分仅为 0.613
  • 即使在已触发技能的子集中,最高遵循度(Comp.†)也仅为 0.638,表明模型在进入技能后仍会遗漏步骤。
  • 在几乎所有行中,边界(Boundary)得分均高于遵循(Compliance)得分,说明模型避免禁止操作比完整完成规定流程更容易。
  • 模型排名随框架变化:GPT-5.5 在 Claude Code 下领先,而 Claude Opus 4.8 在 Codex 下领先。这表明技能使用是“模型 + 框架”组合的属性,而非仅由模型单独决定。

许可信息

  • 代码许可:MIT
  • 数据许可:CC BY 4.0

引用信息

该数据集对应的论文为《Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?》,作者包括 Jinyi Han 等人,发布在 arXiv(编号 2608.04828)。

搜集汇总
数据集介绍
Skill-Use 数据集图片
构建方式
Skill-Use数据集构建于大语言模型在智能体框架中技能调用能力评估的背景下,旨在填补现有基准对技能识别、遵循及边界约束综合考察的空白。构建流程涵盖多领域真实技能的采集与重写,形成结构化的技能文档,并针对每项技能设计可执行任务,同时配套生成与任务一一对应的轨迹评分细则。数据集涵盖9个领域,包含79项真实技能、177个可执行任务及177份轨迹评分细则,评分细则内含1314个评分项,其中882项源自技能文档,用于评估遵循与边界维度。构建过程注重真实性与可执行性,任务均配有实际沙箱文件,确保评估环境与真实应用场景一致。
特点
该数据集的核心特性在于对智能体轨迹进行全过程分级评估,而非仅关注最终结果,将技能使用能力细分为触发、遵循与边界三个可独立观测的维度,可精准定位模型在技能调用各环节的薄弱点。数据集规模适中且覆盖多领域,每项技能平均包含4.8个专属要求,有效考察模型对细节的遵循程度。基于渐进式披露机制,仅提供技能名称与简短描述,要求模型自主判断相关性并检索完整流程,高度模拟真实使用场景。此外,数据集支持多智能体框架评估,并提供了可复现的评分工具与容器化执行环境,便于跨模型比较。
使用方法
使用Skill-Use时,研究者可通过克隆仓库并运行提供的脚本完成环境搭建与容器构建,随后调用run_task.sh或run_batch.sh执行单任务或批量评估,选择Claude Code或Codex等智能体框架作为执行环境。评估过程中,系统记录完整的轨迹文件,并利用score_trace.py基于评分规则对轨迹进行评分,生成触发、遵循、边界及综合技能使用分数。score_matrix.py可汇总多次运行结果,生成排行榜样式的比较表。该数据集适用于对比不同大语言模型在统一智能体框架下的技能调用效能,亦可分析模型与框架组合对技能使用表现的影响,为智能体系统设计提供实证依据。
背景与挑战
背景概述
Skill-Use数据集由Jinyi Han等人于2026年创建,旨在探究大型语言模型(LLM)在智能体框架(如Claude Code和Codex)中实际运用技能的能力。该数据集包含79个真实技能、177个可执行任务及对应的轨迹评分标准,覆盖9个领域,并创新性地将技能使用能力分解为触发(Trigger)、遵从(Compliance)和边界(Boundary)三个可独立观测的维度。其核心研究问题在于,当仅提供技能名称和简短描述时,智能体是否能够识别相关技能、检索完整流程并忠实执行。该数据集通过对完整轨迹的评分而非仅关注最终答案,为评估LLM在复杂任务中的技能应用提供了更细致的手段,对智能体与技能交互领域具有重要参考价值。
当前挑战
Skill-Use数据集面临多重挑战。领域问题层面,现有基准多聚焦于单步任务或最终结果,难以捕捉多步骤流程中的技能遵从与边界遵守,导致对LLM技能应用能力的评估不全面。构建过程中,需确保技能与任务的真实性,并为每个任务设计涵盖技能衍生要求的轨迹评分标准,177个评分标准包含1314个评分项,平均每个7.4项,跨度3至16项,工作量大且需精细设计。此外,需适配不同智能体框架的渐进式披露机制,并确保评分引擎的客观性与可重复性。评估结果显示,最优模型在技能使用综合得分上仅为0.613,即使在触发技能后,遵从度最高也仅达0.638,揭示模型在技能执行细节上的不足,凸显了任务难度与评测方法的持续优化需求。
常用场景
经典使用场景
Skill-Use基准的经典使用场景在于对具备代理能力的大语言模型进行系统性的技能调用能力评估。该数据集精心构筑了79项真实技能与177个可执行任务,横跨九个专业领域,并配备了完整的轨迹评分细则。研究者可借此在Claude Code与Codex两种主流代理框架下,通过渐进式技能揭示机制,全面度量模型在触发(Trigger)、遵循(Compliance)及边界(Boundary)三个维度上的表现。这一评估范式不仅突破了传统仅以最终答案为准绳的局限,更将精细化的轨迹级评分融入评测流程,为深入剖析代理模型在真实工具操作中的技能运用能力提供了严谨且可复现的实验平台。
实际应用
在实际应用中,Skill-Use为部署于复杂软件开发环境中的智能代理提供了不可或缺的效能检验工具。开发团队可利用该基准,在本地沙盒中模拟真实任务,例如通过pdftk技能执行PDF合并等操作,从而对候选模型在特定代理框架下的技能运用熟练度进行预发布评估。该基准所揭示的模型与框架间的性能耦合现象,为技术选型提供了关键依据,助力工程师们依据不同代理框架的适配特性,优选最佳模型组合,以显著提升自动化工作流的执行成功率与稳定性。其开源的可扩展架构与标准化的评分脚本,亦使得其能够无缝集成至持续集成/持续部署(CI/CD)流水线中,为智能编码助手的迭代优化与质量保障构筑了一道坚实的防线。
衍生相关工作
Skill-Use数据集的问世,催生了一系列影响深远的衍生研究工作。在技能工程领域,研究者们基于其三维评估框架,探索了如何优化技能文档的编写范式与检索策略,以提升代理模型的技能触发准确率。在代理评测方法论层面,其轨迹级评分体系启发了众多后续工作,推动了从稀疏的最终结果评估向密集的过程监督转变的学术浪潮。此外,该基准所揭示的模型与框架间性能差异,直接促进了跨框架能力迁移与适配领域的研究,同时,针对其呈现出的遵循能力短板,也激发了关于意图对齐与过程强化学习的深入探索。这些衍生工作共同构建了一个围绕技能使用能力的良性研究生态,持续推动着可控、可信代理技术的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务