R3-Skill
收藏资源简介:
R3-Skill是一个查询条件基准数据集,用于LLM代理技能路由,包含5,696个测试查询和2,050个测试池技能,技能标识符以不透明ID(如skill-00000)发布,在查询和技能池文件中保持一致映射。数据集基于多个公共资源构建,旨在支持两阶段检索器(R3-Embedding + R3-Reranker)的评估和复现。
R3-Skill is a query-conditioned benchmark dataset for LLM agent skill routing, which contains 5,696 test queries and 2,050 test pool skills. Skill identifiers are released as opaque IDs (e.g., skill-00000) with consistent mappings maintained across both query and skill pool files. Constructed based on multiple public resources, this dataset is designed to support the evaluation and reproducibility of the two-stage retriever (R3-Embedding + R3-Reranker).
R3-Skill 数据集概述
R3-Skill 是一个用于 LLM 智能体技能路由(skill routing)的查询条件基准(query-conditional benchmark),旨在评估和提升模型根据用户查询从技能库中检索相关技能的能力。
数据集构成
- 测试查询:
data/test.jsonl,包含 5,696 条测试查询。 - 技能池:
data/skills_test.jsonl,包含 2,050 个测试技能。 - 技能标识:以不透明 ID(如
skill-00000)形式发布,查询文件与技能池文件中的 ID 保持一致映射。 - 技能池划分:训练集与测试集的技能池互不相交(disjoint)。
- 数据来源:基于以下公开资源构建:
配合的两阶段检索器
该基准配套设计了名为 R3-Embedding + R3-Reranker 的两阶段检索器:
- 第一阶段(召回):使用 R3-Embedding(双编码器),将查询和每个技能独立编码,通过余弦相似度对整个技能池进行排序,速度快、可扩展。
- 第二阶段(重排序):使用 R3-Reranker(交叉编码器),仅对第一阶段召回的前 N 个候选技能(默认 N=20)进行联合查询-技能对的评分,从而判断查询条件兼容性(query-conditional compatibility)。
模型权重托管在 Hugging Face 上:
核心设计思想:SKIP-as-resource
论文的核心思想是将 LLM 拒绝的技能组合作为重排序器的负监督信号,而不是直接丢弃,从而提升查询条件兼容性的判断能力。
数据格式示例
技能库格式(JSONL,每行一个 JSON): json {"id": "music-composer", "text": "name | description | body"}
推荐 text 字段遵循 name | description | body 格式(与训练一致,重排序器仅截断 body 部分)。
查询输入格式:支持单个查询字符串或文本文件(每行一个查询)或 JSONL 文件(包含 query 字段)。
输出格式(JSONL): json {"query": "...", "top_k": [{"id": "...", "score": 0.83}, ...]}
引用
bibtex @inproceedings{r3skill2026, title = {Skill Is Not Document: A Query-Conditional Benchmark and Two-Stage Retriever for LLM Agent Skill Routing}, author = {Wang, Zifei and Wen, Wei and Ji, Qiang and Qiao, Ruizhi and Sun, Xing}, year = {2026}, url = {https://arxiv.org/abs/2606.03565}, }




