遇见数据集

XYZ-Aquila-SFT

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

XYZ-Aquila SFT 是一个双语(英语和中文)监督微调数据集,专注于多轮、面向搜索的工具使用轨迹。该数据集共包含 7,000 个高质量样本,其中 5,000 个为英语示例,2,000 个为中文示例。这些数据是用于训练 XYZ-Aquila-mini 和 XYZ-Aquila-pro 模型的更大规模监督微调数据的一个代表性样本。数据以 JSON Lines (JSONL) 格式组织,每种语言对应一个独立的配置文件(en 和 zh)。每个数据样本是一个 JSON 对象,包含五个核心字段:用户请求的“question”、最终答案监督的“answer”、表示轨迹中工具调用次数的“number of tool calls”、记录完整多轮交互序列的“trajectory”(包含系统指令、用户请求、助手推理与工具调用、工具响应以及最终回复等角色消息),以及轨迹级别的正确性标注“trajectory correctness”。轨迹字段以对话兼容的结构序列化了工具调用和观察结果,完整保留了智能体与搜索工具交互的中间过程。该数据集旨在支持以下研究和开发:面向搜索的智能体的监督微调、双语环境下的工具使用和多轮推理能力研究、轨迹格式的实验以及智能体行为分析,以及对中英文搜索任务的受控研究。数据集的部分问答内容源自 `PolarSeeker/OpenSeeker-v1-Data`。用户需注意,数据中的搜索信息可能随时间过时,工具模式可能需要适配其他框架,且该数据集本身并非独立的评估基准。

XYZ-Aquila SFT is a bilingual (English and Chinese) supervised fine-tuning dataset focused on multi-turn, search-oriented tool usage trajectories. The dataset contains a total of 7,000 high-quality samples, including 5,000 English examples and 2,000 Chinese examples. These data are a representative sample of a larger-scale supervised fine-tuning dataset used for training the XYZ-Aquila-mini and XYZ-Aquila-pro models. The data is organized in JSON Lines (JSONL) format, with a separate configuration file for each language (en and zh). Each data sample is a JSON object containing five core fields: the user requests question, the supervised final answer answer, the number of tool calls indicating the count of tool calls in the trajectory, the trajectory that records the complete multi-turn interaction sequence (including role messages such as system instructions, user requests, assistant reasoning and tool calls, tool responses, and final replies), and the trajectory-level correctness annotation trajectory correctness. The trajectory field serializes tool calls and observations in a dialogue-compatible structure, fully preserving the intermediate process of the agents interaction with the search tool. This dataset aims to support the following research and development: supervised fine-tuning of search-oriented agents, studies on tool usage and multi-turn reasoning capabilities in bilingual environments, experiments with trajectory formats and agent behavior analysis, and controlled studies on English and Chinese search tasks. Some question-answer content in the dataset is derived from `PolarSeeker/OpenSeeker-v1-Data`. Users should note that the search information in the data may become outdated over time, the tool patterns may need adaptation to other frameworks, and this dataset itself is not an independent evaluation benchmark.

创建时间:
2026-07-22
原始信息汇总

XYZ-Aquila SFT 数据集概述

数据集简介

XYZ-Aquila SFT 是一个双语监督微调数据集,包含 7,000 条多轮、面向搜索的工具使用轨迹,其中包含 5,000 条英文示例和 2,000 条中文示例。该数据集是用于训练 XYZ-Aquila-miniXYZ-Aquila-pro 模型的更广泛 SFT 语料库的一个样本,记录了代理与搜索工具的交互、中间观察结果以及中英文答案生成过程。

数据集配置

配置 语言 分割 文件名 示例数量
en 英文 train xyz_aquila_sft_en_5000.jsonl 5,000
zh 中文 train xyz_aquila_sft_zh_2000.jsonl 2,000
总计 7,000

每种语言分别提供为独立的 JSONL 分片,仓库中不包含合并的重复分片。

数据格式

每条数据为一行 JSON 对象,包含四个顶层字段:

字段 类型 描述
question string 与轨迹关联的用户请求
answer string 最终答案的监督信息
number of tool calls integer 轨迹中表示的工具调用次数
trajectory list 有序的 systemuserassistant 消息,包括工具交互

工具定义通过官方 Qwen3 聊天模板中的 tools 块渲染到第一条 system 消息中。工具调用和观察结果被序列化在 assistant 和 user 消息内容中,以自包含的聊天结构保留完整的多轮交互。

工具定义

每条轨迹的第一个 system 消息中包含三个函数模式:

  • web_search
  • scrape_and_extract_info
  • run_python_code

该嵌入块与官方 Qwen3 聊天模板在接收原始系统消息和结构化工具列表时产生的 system 消息内容字节等价。

数据加载

可通过 Hugging Face Datasets 库加载指定语言配置:

python from datasets import load_dataset

english = load_dataset("XYZAILab/XYZ-Aquila-SFT", "en", split="train") chinese = load_dataset("XYZAILab/XYZ-Aquila-SFT", "zh", split="train")

也支持流式加载。

预期用途

该数据集适用于以下研究和开发方向:

  • 面向搜索的代理的监督微调
  • 双语工具使用和多轮推理
  • 轨迹格式实验和代理行为分析
  • 英文和中文搜索任务的受控研究

模型基准表现

使用更广泛 SFT 语料库训练出的最终 XYZ-Aquila 模型在中英文代理搜索基准上表现优异:

基准 XYZ-Aquila-mini XYZ-Aquila-pro (397B-A17B)
BrowseComp 78.8 84.8
BrowseComp-ZH 82.9 85.1
DeepSearchQA 89.5 92.5
GAIA 97.1 97.1
LiveBrowseComp 48.7 53.7
HLE 51.1 53.3
WideSearch 80.8 81.2

所有数值均为百分比。DeepSearchQA 使用 F1,WideSearch 使用 Item F1 Max@4,其余基准使用准确率。这些分数是针对使用更广泛 SFT 语料库训练的发布模型,并非对本 7,000 条示例样本的独立评估。

局限性

  • 搜索来源的信息可能过时、不完整或与当前来源不一致
  • 工具模式和轨迹约定可能需要适配其他代理框架
  • 该数据集不是独立基准,仅在其上训练并不能建立事实可靠性或部署就绪性
  • 用户应独立验证生成的答案,并针对预期领域、语言和风险要求评估模型

许可与归属

该数据集以 Apache License 2.0 发布。其中一小部分问答内容来源于 PolarSeeker/OpenSeeker-v1-Data,该数据集以 MIT License 发布。用户有责任遵守与上游内容和搜索轨迹中代表的外部来源相关的适用许可证和条款。

搜集汇总
数据集介绍
XYZ-Aquila-SFT 数据集图片
构建方式
在人工智能驱动的搜索代理研究领域,高质量的多轮交互数据是提升模型工具使用能力的关键。XYZ-Aquila-SFT数据集正是为此而生,它源自更广泛的监督微调语料库,精心挑选了7,000条双语、面向搜索的工具使用轨迹。其中包含5,000条英文样本和2,000条中文样本,每条样本均以JSONL格式存储,清晰记录了用户请求、最终答案、工具调用次数、完整的对话轨迹以及轨迹正确性标注。对话轨迹按照系统指令、用户请求、推理与工具调用、工具响应、最终回复的顺序组织,全面捕捉了代理与搜索工具的复杂互动过程,为模型学习如何基于搜索反馈生成高质量答案提供了坚实基础。
特点
该数据集的核心特色在于其双语多轮交互结构与搜索导向的鲜明定位。其内容不仅覆盖英文与中文两个语言配置,更通过超过5,000条英文和2,000条中文的高质量轨迹,展现了代理在真实搜索场景中的行为模式。每个样本均包含详尽的工具调用序列和观察结果,而非仅仅训练模型生成回答,从而助力于深入探索工具使用、多轮推理与行为分析。值得一提的是,部分问答内容源自OpenSeeker-v1-Data,但整体数据集在规模上保持在1K至10K之间,兼顾了实用性与可控性,是进行双语搜索代理微调与实验的理想选择。
使用方法
使用者可通过Hugging Face Datasets库轻松加载该数据集,支持按语言配置分别处理:调用`load_dataset('XYZAILab/XYZ-Aquila-SFT', 'en', split='train')`获取英文部分,或使用`zh`参数获取中文部分。对于大规模数据处理,还支持流式加载以减少内存压力。数据集专为搜索导向代理的监督微调而设计,适用于工具调用、多轮推理和双语搜索任务的实验研究。加载后,每条数据的`trajectory`字段即为聊天兼容格式的完整对话,可直接用于训练;`question`和`answer`字段则便于进行端到端监督。开发者需注意,该数据集并非独立基准,使用时需结合具体模型和任务需求进行验证与适配。
背景与挑战
背景概述
XYZ-Aquila-SFT数据集由XYZAILab于近期发布,旨在为面向搜索的工具使用智能体提供高质量的监督微调数据。该数据集包含7000条双语多轮交互轨迹,涵盖英文和中文场景,是构建XYZ-Aquila-mini与XYZ-Aquila-pro模型的核心训练语料之一。其研究聚焦于如何让语言模型在复杂搜索任务中高效调用工具、解析中间观测结果并生成准确答案。该数据集在GAIA、BrowseComp等基准测试中展现了卓越性能,显著推动了智能体搜索领域的发展,为双语环境下工具学习与推理能力的研究提供了重要资源。
当前挑战
该数据集主要应对两大挑战:其一,在领域问题层面,传统语言模型在面对需要多步搜索与工具协作的复杂查询时,常因缺乏结构化推理轨迹而表现不佳,XYZ-Aquila-SFT通过提供完整的工具调用与观测序列,为模型学习多跳搜索与答案合成奠定了基础。其二,在构建过程中,挑战包括:如何确保双语轨迹的语义一致性与任务复杂性平衡,如何从多样化的搜索场景中提取高质量、可复用的交互范例,以及如何设计标准化数据格式以兼容不同智能体框架。此外,搜索数据固有的时效性与不完整性也要求对轨迹真实性进行持续验证。
常用场景
经典使用场景
XYZ-Aquila-SFT数据集的经典使用场景在于对语言模型进行面向搜索场景的监督式微调,以提升其多轮工具调用与推理生成能力。该数据集包含7,000条中英双语、结构化保存的搜索导向型智能体交互轨迹,每一条轨迹均记录了用户提问、智能体的推理与工具调用过程、工具返回的中间观测结果以及最终答案生成的全链路信息。研究者可以借助此类数据,训练模型在真实检索环境中自主决定何时调用搜索引擎、如何整合分步返回的信息,并生成连贯且信息丰富的回答,从而构建具备在线信息获取能力的对话式AI系统。
实际应用
在实际应用层面,XYZ-Aquila-SFT数据集训练出的模型能够赋能多种需要实时信息检索的智能助理系统。例如,在企业知识库问答场景中,模型可自动调用内部搜索工具获取最新文档信息,比传统基于静态索引的问答系统更加灵活高效;在金融与法律情报分析领域,智能体能够根据用户提出的复杂交叉查询,逐步检索多维数据源并生成综合分析报告;在面向消费者的通用助手应用中,模型可以实时获取网络资讯,回答涉及时事、天气、产品比价等变化迅速的查询,显著提升用户交互体验与信息获取效率。
衍生相关工作
以XYZ-Aquila-SFT数据集为核心数据资源,衍生出一系列具有影响力的模型与研究工作。其中最具代表性的是XYZ-Aquila-mini与XYZ-Aquila-pro系列模型,两者均在GAIA基准上达到了97.1%的准确率,而更大规模的XYZ-Aquila-pro在BrowseComp与DeepSearchQA等任务上分别取得84.8%和92.5%的出色成绩,展现了数据增强训练的显著成效。此外,该数据集的思想也启发了后续关于多语言搜索智能体、工具调用轨迹约束优化以及人机协作信息检索等方向的研究,为构建能够主动探索外部知识并在复杂环境中稳健运行的下一代AI系统奠定了坚实的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务