遇见数据集

Skill2-Bench

收藏
arXiv2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

Skill2-Bench是由普林斯顿大学等机构提出的跨技能长程推理基准数据集,旨在评估大语言模型在任务链中切换不同推理技能的能力。该数据集涵盖数学、科学、编程、逻辑、规划等9个可验证与开放式领域,包含558种精细标注的技能,任务由2至10步组成,每步依赖前步输出并切换技能。构建过程首先从种子数据集中提取技能标签,再通过参考模型计算技能切换难度(技能熵),最后采样技能序列并生成统一场景的任务。该基准可用于揭示模型在技能切换中的性能衰退,并为训练更鲁棒的技能原生大语言模型提供信号。

Skill2-Bench is a cross-skill long-horizon reasoning benchmark dataset proposed by Princeton University and other institutions. It aims to evaluate the ability of large language models (LLMs) to switch between different reasoning skills within a task chain. This dataset covers 9 verifiable and open-ended domains including mathematics, science, programming, logic, planning and others, and contains 558 finely annotated skills. Each task consists of 2 to 10 steps, where each step relies on the output of the previous step and switches to a new skill. During the construction process, skill labels are first extracted from a seed dataset, then the skill switching difficulty (skill entropy) is calculated using a reference model, and finally skill sequences are sampled and tasks in a unified scenario are generated. This benchmark can be used to reveal the performance degradation of models during skill switching, and provide signals for training more robust skill-native large language models.

创建时间:
2026-08-06
原始信息汇总

数据集概述

该数据集项目围绕长程推理任务中的技能切换能力展开,包含一个基准测试集、一种评估指标和一套训练方法。

核心组成

  • Skill²-Bench 基准测试集:包含 558 个技能,覆盖 9 个领域(数学、科学、编程、逻辑、信息提取、规划、创意写作、上下文检索、指令遵循),任务均为需要模型在多个技能之间切换的多步任务。
  • 技能熵(Skill Entropy):衡量技能切换难度的指标。当参考模型能分别出色完成两个技能但组合时失败,技能熵值较高;模型性能随技能熵升高而下降。
  • Skill-Entropy RL:基于 GRPO 的训练方法,奖励函数不仅评估最终答案,还评估模型的技能切换计划,结合最终答案奖励与技能熵奖励(作用于带技能标注的轨迹)。

数据集获取

  • Hugging Face 地址:https://huggingface.co/datasets/Gen-Verse/Skill2-Bench

使用环境

  • Python ≥ 3.10,CUDA 12.x,PyTorch 2.8(推荐)

运行流程

  1. 熵校准:技能标注、去重合并、参考模型校准生成熵映射。
  2. 任务生成:通过 API 或 vLLM 生成基准任务及数学强化学习任务池。
  3. SFT 预热:跨技能 SFT 或仅数学 SFT。
  4. RL 训练:执行 Skill-Entropy RL 或数学 RL,支持奖励变体(如 gated / multi-gold)。
  5. 评估:合并 checkpoint 后对 Skill²-Bench 进行评估,支持开源模型(vLLM)与 API 模型(Claude/GPT/Gemini)。

许可证

MIT 许可证。

搜集汇总
数据集介绍
Skill2-Bench 数据集图片
构建方式
Skill2-Bench的构建基于一种系统化的跨技能长时程任务生成管线,该管线整合了多领域种子数据集。首先,从六个可验证领域(数学、科学、编程、逻辑、规划、信息抽取)以及三个开放式领域(创意写作、上下文检索、指令遵循)中构建包含558项细粒度技能的技能库,技能标注通过LLM辅助和嵌入聚类实现。其次,利用参考模型Claude-opus-4.7估计技能对之间的技能熵,该熵值量化了技能切换的难度。随后,通过采样技能序列并设定低、中、高三个熵级别,结合统一的场景提议和重写过程,将种子问题融合为连贯的长时程任务,每个步骤依赖前序答案。最后,通过验证器过滤以确保答案保持、场景一致性、依赖性和无答案泄漏。
特点
Skill2-Bench的核心特点在于其引入了技能熵这一定向配对度量,用于量化技能切换的难度,并将此度量应用于任务级难度分级。该基准覆盖558项技能,跨越九个不同领域,其中六个可验证领域和三个开放式领域,确保了评估的多样性和挑战性。每个任务根据其技能熵值被划分为低、中、高三个难度级别,使得模型在不同技能切换需求下的表现可被精确衡量。实验表明,模型在跨技能任务中的准确率随熵值增加而单调下降,揭示了单技能评估无法捕捉的切换缺陷。此外,基准设计促使模型在推理链中显式切换技能,暴露了技能选择与答案模态受前一步骤影响的常见失败模式。
使用方法
Skill2-Bench的使用方法旨在评估和训练语言模型的跨技能长时程推理能力。评估时,模型需在跨技能模式下按顺序回答任务中的每一步骤,其答案由领域特定的评分器(如符号等价性、单元测试、多选题匹配等)进行单步评分,最终得到整体平均分。该基准还可与技能熵强化学习框架结合使用,其中模型在每一步不仅输出答案,还预测所采用的技能,奖励函数结合了步骤正确性和技能熵奖励,以促使模型规划出与黄金技能序列对齐的技能链。此训练信号可直接应用于现有数据集,如OpenR1-Math,通过简单标注技能标签和中间结论,即可提升模型在跨技能任务上的表现,并泛化至外部长时程和通用推理基准。
背景与挑战
背景概述
Skill2-Bench数据集由普林斯顿大学等机构的Yinghui He、Ling Yang等研究者于2026年提出,旨在评估大语言模型在长程推理中跨技能切换的能力。现有基准多聚焦于单一技能或整体任务难度,忽略了技能间转换的复杂性。该数据集基于558个技能、9个可验证及开放式领域,构建了跨技能长程任务,并引入技能熵作为度量技能切换难度的标尺。通过对8个前沿及4个开源模型的评估,揭示了模型在技能切换上的结构性缺陷,为相关领域提供了新的评估视角。
当前挑战
Skill2-Bench所面临的挑战主要体现在两方面:其一,领域内长期存在对跨技能长程推理缺乏有效度量的问题,现有基准难以捕捉模型在技能切换时的表现差异,导致评估结果片面;其二,数据集构建过程中需克服从多领域种子数据提取技能、设计合理的场景依赖任务、确保技能熵计算的可靠性等难题,同时需处理开放式领域的答案评估、多步骤任务的依赖关系维护以及高计算成本下的参考模型选择等复杂技术问题。
常用场景
经典使用场景
Skill2-Bench作为首个系统评估跨技能长程推理能力的基准,其核心应用场景在于衡量大语言模型在复杂推理链中灵活切换不同技能的能力。该基准构建于558种技能之上,横跨数学、科学、编程、逻辑、规划等九个可验证与开放式领域,每个任务都依据技能熵标定难度层级。研究者通过该基准能够精准定位模型在技能切换点的性能衰减,揭示出即便模型在单技能任务上表现优异,在跨技能任务中仍可能遭遇显著的能力瓶颈。这一基准为诊断大模型在复合推理场景下的结构性缺陷提供了标准化度量工具。
实际应用
在实际应用中,Skill2-Bench为智能体的多步骤规划、复杂文档处理、自主科研等需要连续调用不同推理能力的场景提供了性能评估基准。例如,一个机器人救援任务可能需要先进行数学计算,再基于计算结果进行路径规划,最后从日志中提取关键信息,这种跨数学、规划、信息抽取的技能链在现实世界系统中普遍存在。该基准能够帮助企业级AI系统在部署前准确定位其在跨领域长程任务中的薄弱环节,指导模型选型与优化方向。同时,其构建的跨技能任务合成流程也可直接用于生成多样化的训练数据,提升智能体在真实复杂环境中的鲁棒性。
衍生相关工作
Skill2-Bench催生了将技能熵从基准度量转化为训练信号的重要研究方向。其衍生工作Skill-Entropy RL框架将技能熵奖励与标准答案奖励相结合,在强化学习过程中引导模型显式预测每步所用技能,并通过技能熵对齐奖励优化技能序列的规划能力。实验表明,该方法使Qwen3-4B-Instruct在Skill2-Bench上的得分从34.4%大幅提升至68.4%,同时可无缝应用于OpenR1-Math等现成训练数据,展现了技能熵作为可复用训练信号的普适潜力。此外,该基准的构建方法论也为后续技能感知的数据筛选、自适应训练策略等研究提供了标准化框架,推动了从技能评估到技能学习的闭环研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务