Skill-Use
收藏资源简介:
Skill-Use是一个用于评估大语言模型代理在逐步披露下实际识别、遵循和保持在技能范围内的基准测试数据集。它包含79个真实技能、177个可执行任务和177个轨迹评分标准,覆盖9个领域,并分解为触发、合规性和边界三个可观察的方面。
Skill-Use is a benchmark dataset designed to assess the practical ability of large language model (LLM) agents to identify, adhere to, and stay within their defined skill boundaries under step-by-step disclosure. It comprises 79 real-world skills, 177 executable tasks, and 177 trajectory-based scoring criteria, spanning 9 distinct domains, and is structured into three observable aspects: triggering, compliance, and boundary.
数据集概述
Skill-Use 是一个用于评估大型语言模型(LLM)在智能体框架(Agentic Harnesses)中是否真正具备“技能使用”能力的基准数据集。其核心目标是衡量 LLM 智能体在渐进式信息揭示(progressive disclosure)条件下,能否在实际操作中识别(recognize)、遵循(follow)并保持在(stay within)给定技能的范围之内。
核心规模
| 指标 | 数量 |
|---|---|
| 真实技能(Real Skills) | 79 |
| 可执行任务(Executable Tasks) | 177 |
| 轨迹评分标准(Trajectory Rubrics) | 177 |
| 覆盖领域(Domains) | 9 |
| 智能体框架(Agent Harnesses) | 2 |
| 评分条目总数 | 1,314(平均每个评分标准 7.4 项,范围 3–16) |
| 技能衍生评分条目 | 882(用于评估遵循度与边界) |
评估维度
Skill-Use 将技能使用能力分解为三个独立可观测的方面,并基于完整轨迹而非最终答案进行评分:
- 触发(Trigger) — 智能体是否调用了相关技能。
- 遵循(Compliance) — 智能体是否忠实遵循了规定的操作流程。
- 边界(Boundary) — 智能体是否避免了被禁止的操作。
数据集内容
- 技能文档:以重写后的源形式提供(
skill/skill.md)。 - 任务定义:以 YAML 格式存储,每个技能配对多个任务。
- 轨迹评分标准:与任务一一对应,用于评估智能体执行轨迹。
- 沙箱资源:为每个任务提供真实文件,置于运行环境中用于执行测试。
- 评分引擎:包含
score_trace.py和score_matrix.py等脚本,用于自动评分并生成排行榜。
主要结果摘要
该基准评估了来自 7 个家族的 8 个前沿 LLM,在 Claude Code 和 Codex 两种智能体框架下的表现:
- 最佳模型-框架组合的 SU(技能使用)得分仅为 0.613。
- 即使在已触发技能的子集中,最高遵循度(Comp.†)也仅为 0.638,表明模型在进入技能后仍会遗漏步骤。
- 在几乎所有行中,边界(Boundary)得分均高于遵循(Compliance)得分,说明模型避免禁止操作比完整完成规定流程更容易。
- 模型排名随框架变化:GPT-5.5 在 Claude Code 下领先,而 Claude Opus 4.8 在 Codex 下领先。这表明技能使用是“模型 + 框架”组合的属性,而非仅由模型单独决定。
许可信息
- 代码许可:MIT
- 数据许可:CC BY 4.0
引用信息
该数据集对应的论文为《Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?》,作者包括 Jinyi Han 等人,发布在 arXiv(编号 2608.04828)。





