遇见数据集

R3-Skill

收藏
github2026-07-08 更新2026-07-10 收录
数据链接:
官方服务:

资源简介:

R3-Skill是一个查询条件基准数据集,用于LLM代理技能路由,包含5,696个测试查询和2,050个测试池技能,技能标识符以不透明ID(如skill-00000)发布,在查询和技能池文件中保持一致映射。数据集基于多个公共资源构建,旨在支持两阶段检索器(R3-Embedding + R3-Reranker)的评估和复现。

R3-Skill is a query-conditioned benchmark dataset for LLM agent skill routing, which contains 5,696 test queries and 2,050 test pool skills. Skill identifiers are released as opaque IDs (e.g., skill-00000) with consistent mappings maintained across both query and skill pool files. Constructed based on multiple public resources, this dataset is designed to support the evaluation and reproducibility of the two-stage retriever (R3-Embedding + R3-Reranker).

创建时间:
2026-07-08
原始信息汇总

R3-Skill 数据集概述

R3-Skill 是一个用于 LLM 智能体技能路由(skill routing)的查询条件基准(query-conditional benchmark),旨在评估和提升模型根据用户查询从技能库中检索相关技能的能力。

数据集构成

  • 测试查询data/test.jsonl,包含 5,696 条测试查询
  • 技能池data/skills_test.jsonl,包含 2,050 个测试技能
  • 技能标识:以不透明 ID(如 skill-00000)形式发布,查询文件与技能池文件中的 ID 保持一致映射。
  • 技能池划分:训练集与测试集的技能池互不相交(disjoint)。
  • 数据来源:基于以下公开资源构建:

配合的两阶段检索器

该基准配套设计了名为 R3-Embedding + R3-Reranker 的两阶段检索器:

  • 第一阶段(召回):使用 R3-Embedding(双编码器),将查询和每个技能独立编码,通过余弦相似度对整个技能池进行排序,速度快、可扩展。
  • 第二阶段(重排序):使用 R3-Reranker(交叉编码器),仅对第一阶段召回的前 N 个候选技能(默认 N=20)进行联合查询-技能对的评分,从而判断查询条件兼容性(query-conditional compatibility)。

模型权重托管在 Hugging Face 上:

核心设计思想:SKIP-as-resource

论文的核心思想是将 LLM 拒绝的技能组合作为重排序器的负监督信号,而不是直接丢弃,从而提升查询条件兼容性的判断能力。

数据格式示例

技能库格式(JSONL,每行一个 JSON): json {"id": "music-composer", "text": "name | description | body"}

推荐 text 字段遵循 name | description | body 格式(与训练一致,重排序器仅截断 body 部分)。

查询输入格式:支持单个查询字符串或文本文件(每行一个查询)或 JSONL 文件(包含 query 字段)。

输出格式(JSONL): json {"query": "...", "top_k": [{"id": "...", "score": 0.83}, ...]}

引用

bibtex @inproceedings{r3skill2026, title = {Skill Is Not Document: A Query-Conditional Benchmark and Two-Stage Retriever for LLM Agent Skill Routing}, author = {Wang, Zifei and Wen, Wei and Ji, Qiang and Qiao, Ruizhi and Sun, Xing}, year = {2026}, url = {https://arxiv.org/abs/2606.03565}, }

搜集汇总
数据集介绍
R3-Skill 数据集图片
构建方式
R3-Skill数据集专为LLM智能体技能路由任务而构建,旨在评估检索系统在查询条件约束下从技能库中精准匹配技能的能力。其构建依托多个公开资源,包括SKILLRET、SkillRouter-Eval-Core、AiSkill及agency-agents-zh等数据集,从中抽取技能描述与用户查询,形成包含5,696条测试查询与2,050个测试技能池的基准。技能标识符采用不透明ID(如skill-00000),查询文件与技能池文件之间通过该ID建立一致映射,同时确保训练集与测试集的技能池互不重叠,保障评估的公正性。
特点
该数据集的核心特点在于其独特的查询条件性设计,强调技能路由并非简单的文档检索,而是需要理解查询与技能集之间的兼容性。数据集中引入了LLM拒绝的技能组合作为负样本,为排序器提供监督信号,这一思想体现于SKIP-as-resource策略。此外,数据集采用两级检索架构:第一阶段通过双编码器进行高效召回,利用余弦相似度完成全技能池的粗筛;第二阶段利用交叉编码器对候选集进行精细重排序,修复双编码器无法感知的技能间条件兼容性问题,从而提升检索精度。
使用方法
使用R3-Skill数据集时,用户需从Hugging Face下载R3-Embedding与R3-Reranker模型权重,并放置于models目录下。运行infer.py可基于自定义技能库进行端到端检索,支持单条查询或查询文件输入,输出结果为JSON行格式。通过reproduce.py加载data/下的测试数据,能复现论文中的评测指标。用户亦可编写Python脚本,利用SentenceTransformer和CrossEncoder库直接调用模型,实现嵌入计算或排序功能。关键参数包括recall_n(召回深度)、top_k(最终结果数)及batch_size,可根据硬件资源灵活调整。
背景与挑战
背景概述
R3-Skill是腾讯AI实验室于2026年发布的一项针对大语言模型智能体技能路由的查询条件基准。由王梓斐、文玮等研究人员构建,该数据集旨在解决智能体从庞大技能库中精准检索与用户查询相匹配技能的核心问题。传统方法将技能视为静态文档,忽略了技能间的兼容性与查询的依赖性,R3-Skill通过构建包含5696条测试查询与2050条技能池的基准,并引入“跳过即资源”策略,将大模型拒绝的技能组合转化为训练中的负样本,显著推动了技能路由领域的评估标准化与模型改进。
当前挑战
所解决的领域挑战在于,现有检索模型常以独立方式编码技能,未能捕捉技能间的相互依赖及其对查询条件兼容性的影响,导致检索结果缺乏整体协调性。构建过程中的挑战主要体现在两方面:一是需要设计一个既包含正例又包含负例的技能路由数据集,负例需反映真实场景下技能不被采纳的情形;二是需要构建两阶段检索架构,第一阶段快速召回候选,第二阶段通过交叉编码器精细重排,然而平衡两个阶段的效率与精度、并妥善处理训练数据中负样本的获取与标注,构成了数据集构建的核心难题。
常用场景
经典使用场景
R3-Skill数据集专为评估与优化大语言模型(LLM)智能体在复杂任务中的技能路由能力而设计。其核心使用场景是衡量检索系统能否根据用户多样化、非结构化的查询请求,从庞大技能库中精准匹配最合适的代理技能。研究者可借助该Benchmark,测试在不同难度与覆盖范围的查询条件下,模型对技能语义相关性、隐性依赖关系以及条件兼容性的理解深度。该基准提供了5,696条测试查询与2,050个测试技能,促使学术社区转向研究查询条件性检索这一更具挑战性的范式,避免仅依赖技能文档表面的字符串或关键词匹配。
解决学术问题
该数据集直面当前LLM智能体系统中“技能即文档”这一经典认知偏差。传统方法将技能视为静态文档,利用语义相似度检索,却忽略了技能间的集合兼容性与用户查询的隐性约束,导致在多技能协作场景下路由效果欠佳。R3-Skill通过引入查询条件性判断与拒绝监督信号(即LLM在生成技能时自动丢弃的不匹配组合作为负样本),揭示了单向量编码无法捕捉的“查询-技能”条件关联问题。这一设计推动了智能体路由领域从基于内容的文档匹配迈向基于场景的语义理解与条件判别,显著提升了学术研究的生态合理性。
衍生相关工作
基于R3-Skill数据集及其思想,已衍生出一系列值得关注的研究工作。首先是R3-Embedding与R3-Reranker两阶段检索模型,它们分别代表了高效粗召回与精密细排序的创新融合,未来可启发更多轻量级条件检索架构。其次,其“SKIP-as-resource”策略——将被LLM拒绝的技能组合保留为负训练信号——为弱监督与对比学习在智能体路由中的运用开辟了新路径。此外,该数据集也直接催生了SkillRouter-Eval-Core等衍生评测集,并推动AiSkill与agency-agents-zh等社区项目纳入了统一查询条件性技能库的标准构建方式,促进了技能路由评测生态的标准化与可复现性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务