遇见数据集

AetherSearch_SFT

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Search-SFT 2000 是一个包含 2,000 条经过验证的完整 agent 轨迹的数据集,专门用于 Qwen2.5-3B 模型的智能搜索格式冷启动训练。每条轨迹都以 Qwen assistant 的终止令牌 <|im_end|> 结尾。数据集由两种轨迹类型组成:单次搜索(single_search,1,025 条,占 51.25%)和多次搜索(multi_search,975 条,占 48.75%),搜索深度从 1 到 4 层不等。每个训练样本包含五个字段:id、question、trajectory_type、search_count 和 full_trajectory_text,其中 full_trajectory_text 是唯一的训练文本。记录的顺序通过确定性种子 42 全局打乱,ID 从 000001 到 002000 顺序分配。训练语义规定:系统/用户/问题文本以及 <information>...</information> 部分不被监督,而 assistant 的思考/响应、<search>...</search>、<answer>...</answer> 以及最终的 <|im_end|> 令牌被监督。数据集不提供令牌级掩码,下游训练器需自行构建。训练单元是整个轨迹,单次搜索轨迹保留一次搜索/信息轮次直到最终答案,多次搜索轨迹保留所有顺序搜索/信息轮次。此外,还包含一个用于审计的 provenance_manifest.jsonl 文件,以及用于文件校验的 checksums.sha256。该数据集仅定义轨迹数据契约,不声称 SFT 性能已被测量。

Search-SFT 2000 is a dataset containing 2,000 verified complete agent trajectories, specifically designed for cold-start training of the Qwen2.5-3B model in intelligent search format. Each trajectory ends with the Qwen assistants termination token <|im_end|>. The dataset consists of two trajectory types: single search (single_search, 1,025 trajectories, 51.25%) and multi-search (multi_search, 975 trajectories, 48.75%), with search depths ranging from 1 to 4 layers. Each training sample includes five fields: id, question, trajectory_type, search_count, and full_trajectory_text, where full_trajectory_text is the only training text. The records are globally shuffled using a deterministic seed 42, with IDs sequentially assigned from 000001 to 002000. Training semantics specify that system/user/question texts and the <information>...</information> sections are not supervised, while the assistants thinking/response, <search>...</search>, <answer>...</answer>, and the final <|im_end|> token are supervised. The dataset does not provide token-level masks; downstream trainers need to construct them. The training unit is the entire trajectory. Single-search trajectories retain one search/information round until the final answer, while multi-search trajectories retain all sequential search/information rounds. Additionally, a provenance_manifest.jsonl file for auditing and a checksums.sha256 file for file integrity verification are included. The dataset only defines the trajectory data contract and does not claim that SFT performance has been measured.

创建时间:
2026-08-18
原始信息汇总

数据集概述

Search-SFT 2000 是一个用于 Qwen2.5-3B 智能体搜索格式冷启动的全轨迹监督微调(SFT)数据集,包含 2,000 条经过验证的完整 agent 轨迹,每条轨迹均以 Qwen 助手的终止符 <|im_end|> 结束。

数据构成

轨迹类型分布

轨迹类型 记录数 占比
single_search 1,025 51.25%
multi_search 975 48.75%
总计 2,000 100.00%

搜索深度分布

搜索深度 记录数 占比
1 1,025 51.25%
2 667 33.35%
3 265 13.25%
4 43 2.15%

数据模式

每条公开训练记录包含以下五个字段(按固定顺序):

  1. id
  2. question
  3. trajectory_type
  4. search_count
  5. full_trajectory_text

其中 full_trajectory_text 是唯一的训练文本。记录顺序已使用固定随机种子 42 进行全局打乱,并按打乱后的顺序从 000001002000 分配 ID。

训练语义

数据集定义的语义合约如下:

  • systemuserquestion 文本不参与监督;
  • 完整的 <information>...</information> 片段不参与监督;
  • 助手的 <think>...</think> 片段参与监督;
  • 助手的 <search>...</search> 片段参与监督;
  • 助手的 <answer>...</answer> 片段参与监督;
  • 最终的 <|im_end|> 作为助手 EOT/EOS 参与监督。

注意:公共 JSONL 文件不包含 token 级掩码,下游训练者需依据上述合约自行构建 token 级掩码。

轨迹单元

训练单元为 full_trajectory

  • 单次搜索轨迹:保留从一次搜索/信息轮次到最终回答的完整内容;
  • 多次搜索轨迹:保留从每次连续搜索/信息轮次到最终回答的完整内容。

来源与审计

数据集附带审计文件 provenance_manifest.jsonl,包含:

  • 每个新公开 ID 对应的打乱前公开 ID;
  • 遗留来源标识符;
  • 源哈希值;
  • EOT 前/后的完整轨迹哈希值;
  • 确定性打乱密钥。

局限性

  • 该数据集工件不声称已对 SFT 性能进行过评测;
  • 它仅定义完整轨迹的数据合约,token 级掩码属于下游训练者的职责。

校验

可通过发布目录中的校验和文件进行完整性验证:

bash sha256sum -c checksums.sha256

搜集汇总
数据集介绍
AetherSearch_SFT 数据集图片
构建方式
在智能体搜索能力冷启动的训练需求驱动下,该数据集通过采集并验证完整智能体轨迹的方式构建而成,共收录2000条经过校验的全轨迹样本,专门面向Qwen2.5-3B的Agentic Search格式。数据涵盖单次搜索与多次搜索两类轨迹,其中单次搜索1025条、多次搜索975条,搜索深度从1层延伸至4层,形成递进式的结构分布。全部记录经过确定性种子为42的全局乱序处理后,按乱序顺序分配000001至002000的编号,并配套提供仅用于审计的溯源清单,以映射乱序前后的标识、来源哈希与轨迹哈希。
特点
该数据集的核心特征在于以完整轨迹为训练单元,每条公开记录严格包含id、question、trajectory_type、search_count与full_trajectory_text五个字段,其中full_trajectory_text为唯一的训练文本。监督语义契约具有明确的边界划分:系统与用户提问文本不受监督,信息包裹区间整体排除在监督之外,而助手的思考、搜索与回答三类标签以及结尾的终止符均纳入监督目标。这种设计使模型能够学习从检索到推理再到作答的完整行为链条,同时规避对检索内容本身的直接拟合。
使用方法
使用该数据集时,训练方需依据语义契约自行构建词元级掩码,因为公开的JSONL文件并不存储掩码信息。每一训练样本以full_trajectory为基本单元,单次搜索轨迹保留一次搜索与信息回合直至最终回答,多次搜索轨迹则保留全部顺序搜索与信息回合直至最终回答。完整助手轨迹须以终止标记结束,该标记作为助手EOT/EOS被纳入监督目标,且不重复、不额外附加endoftext标记。下游训练器在载入数据后应严格按照监督范围实施掩码,并可通过校验文件核对发布文件的完整性。
背景与挑战
背景概述
智能体检索能力的训练长期受限于缺乏高质量、可复现的全轨迹监督数据。AetherSearch_SFT数据集于2025年前后发布,由相关研究团队构建,旨在为Qwen2.5-3B模型的智能体检索格式提供冷启动监督微调语料。该数据集收录2000条经校验的完整智能体轨迹,涵盖单次检索与多次检索两种形态,并以确定性的随机种子对记录顺序进行全局混洗,从而保证训练过程的可复现性。其核心研究问题在于如何以统一的轨迹契约定义检索智能体的监督信号,并推动下游训练器在此基础上构建令牌级掩码。该数据集为检索增强生成与工具调用智能体的训练提供了标准化的数据基础,对相关领域的可复现研究具有推动作用。
当前挑战
该数据集所服务的领域问题在于训练语言模型自主执行检索并基于检索结果生成答案,即智能体检索。构建过程中面临多重挑战:其一,完整轨迹需确保以助手终止符结束,并严格界定系统与用户文本、信息跨度、思考、检索与回答各部分的监督边界,任何掩码偏差都可能影响训练效果;其二,公开产物不含令牌级掩码,下游训练器须依据语义契约自行构造掩码,增加了使用门槛与不一致风险;其三,多次检索轨迹需保持每次检索与信息轮次的顺序完整性,对数据校验与审计提出较高要求;其四,数据集自身声明并未测量监督微调性能,仅定义数据契约,故其实际效用尚待下游实验验证。
常用场景
经典使用场景
在智能体检索增强生成的研究脉络中,AetherSearch_SFT数据集最为经典的用途在于为Qwen2.5-3B模型提供Agentic Search格式的冷启动监督微调语料。该数据集囊括两千条经过验证的完整智能体轨迹,涵盖单次检索与多次检索两类范式,后者进一步细分为二至四跳的序列化检索深度,从而在训练阶段完整保留从系统指令、用户提问、信息观测到思维链、检索动作与最终作答的全流程结构。研究者借助这一语料,能够令小规模模型习得在开放域问答中自主发起检索、串联多轮证据并终止于规范回答的能力,构成检索智能体能力塑造的基石。
解决学术问题
该数据集所应对的核心学术议题,在于智能体检索训练中长期存在的轨迹级监督信号匮乏与掩码语义失范问题。既往工作往往仅对最终答案施加监督,致使模型难以内化检索决策与信息整合的中间过程;亦有研究将信息观测文本一并纳入损失计算,诱发模型对检索内容的机械复述。AetherSearch_SFT通过明确界定监督契约,将系统与用户文本、信息跨度排除于监督之外,而将思维链、检索动作、最终答案及终止符纳入监督目标,从而为轨迹级微调提供了可复现的语义规范,推动了检索智能体训练从粗放式监督向精细化掩码的范式迁移。
衍生相关工作
围绕该数据集,后续研究可沿三条路径延展:其一,基于其全轨迹单元与掩码契约,衍生出面向不同基座模型的检索智能体微调复现工作,用以检验冷启动策略的模型泛化性;其二,借助其单跳与多跳轨迹的均衡分布,催生出检索深度与推理复杂度之间缩放规律的实证研究;其三,依托其溯源审计文件,发展出训练数据去重、污染检测与轨迹级质量评估的方法学工具。这些衍生方向共同构成检索智能体数据治理与能力评测的生态雏形,为领域内可复现研究的推进奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务