遇见数据集

RaceBench

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

RaceBench 是一个精心策划的 SFT(监督微调)数据集,专门用于提升小模型(0.5B-3B 参数规模)在边缘部署场景下的能力。该数据集混合了来源于 fable-5-premium 的 agent 工具使用轨迹和来源于 GPT-5.5/Gemini/Grok/Claude 等模型的蒸馏数据,经过质量过滤,仅保留评分 >=60/100 的高质量样本。数据集总共有 359,821 条样本,其中 agent 轨迹(4 倍上采样后)占 7.1%,蒸馏数据(涵盖编码、网络安全和蒸馏类别)占 92.9%。数据字段包括:messages(聊天格式的对话,可直接用于 SFT)、source_group(来源分组)、source(原始来源分割名称)、category(内容类别:agent、coding、cybersecurity、distilled)和 quality_score(质量评分 0-100)。数据集经过跨数据集 SHA-256 去重,移除了约 29K 冗余行。RaceBench 特别适用于训练小模型进行工具调用、多步推理、编码、网络安全分析以及通用蒸馏任务,是边缘模型微调的高信号、低噪声数据集。

RaceBench is a carefully curated SFT (Supervised Fine-Tuning) dataset specifically designed to enhance the capabilities of small models (0.5B-3B parameters) in edge deployment scenarios. The dataset mixes agent tool-use trajectories from fable-5-premium and distilled data from models such as GPT-5.5, Gemini, Grok, and Claude, filtered to retain only high-quality samples with quality scores >=60/100. The dataset contains a total of 359,821 samples, of which agent trajectories (after 4x upsampling) account for 7.1%, and distilled data (covering coding, cybersecurity, and distilled categories) accounts for 92.9%. Data fields include: messages (conversations in chat format, directly usable for SFT), source_group (source group), source (original source split name), category (content category: agent, coding, cybersecurity, distilled), and quality_score (quality score 0-100). The dataset has been deduplicated across datasets using SHA-256, removing approximately 29K redundant rows. RaceBench is particularly suitable for training small models in tool calling, multi-step reasoning, coding, cybersecurity analysis, and general distillation tasks, making it a high-signal, low-noise dataset for fine-tuning edge models.

创建时间:
2026-07-30
原始信息汇总

数据集概述

RaceBench 是一个面向边缘部署场景的精选监督微调(SFT)数据集,旨在增强小型模型(0.5B-3B)的智能体工具使用能力与推理表现,使其在边缘环境中可作为 API 型前沿模型的替代方案。该数据集遵循 MIT 许可证,语言为英语,规模属于 100K 至 1M 条样本区间,任务类型为文本生成。

数据集构成

RaceBench 由两个来源的数据混合而成,总计 359,821 行

来源 行数 占比
Fable-5 Agent Traces(4倍上采样) 25,460 7.1%
蒸馏数据(coding + cybersecurity + distilled) 334,361 92.9%

来源一:Fable-5 Agent Traces
来自 saidutta69/fable-5-premium,包含多轮智能体轨迹、工具调用、推理链和结构化函数调用模式,经 4 倍上采样以保留智能体信号。

来源二:蒸馏数据(质量 ≥ 60)
来自 GPT-5.5 / Gemini / Grok / Claude 蒸馏数据集,筛选质量不低于 60 分的样本,具体分布为:

  • Coding:135K 行
  • Cybersecurity:167K 行
  • Distilled:61K 行

质量保障机制

  • 质量门槛:所有样本的质量得分均不低于 60/100,低质量数据被排除
  • 去重处理:通过跨数据集的 SHA-256 去重,移除了 29K 冗余行
  • 专注领域:聚焦编程、安全与蒸馏数据,贴合实际边缘部署需求

适用场景与优势

该数据集专为小型模型设计,主要优势包括:

  1. 工具使用信号:智能体轨迹教授函数调用和多步推理模式,弥补小模型在纯指令数据上的不足
  2. 质量下限保障:杜绝低质量样本干扰
  3. 领域聚焦:编程 + 安全 + 蒸馏数据的组合是边缘部署的实践重点
  4. 去重优化:减少冗余,提升训练效率

数据字段

字段 类型 说明
messages List[Struct{role, content}] 聊天格式对话(SFT 就绪)
source_group str 来源组,值为 "fable-5""distillation"
source str 原始来源分割名称
category str 内容类别(agentcodingcybersecuritydistilled
quality_score float64 质量得分(0-100)

使用方式

可通过 Hugging Face datasets 库直接加载:

python from datasets import load_dataset

ds = load_dataset("saidutta69/RaceBench", split="train") print(f"Examples: {len(ds)}") print(ds[0]["messages"])

支持按类别过滤:

python coding = ds.filter(lambda x: x["category"] == "coding") agent = ds.filter(lambda x: x["category"] == "agent")

同时兼容 Axolotl 微调框架,提供对应的 YAML 配置示例。引用该数据集时,可参考其提供的 BibTeX 条目。

搜集汇总
数据集介绍
RaceBench 数据集图片
构建方式
RaceBench数据集的构建融合了源自Fable-5的智能体工具调用轨迹与高质量的蒸馏数据,并经由严格的品质筛选与去重流程精制而成。其中,智能体轨迹部分通过四倍上采样以强化其信号,而蒸馏数据则仅保留编码、网络安全及通用蒸馏类别中品质评分不低于60的样本。跨数据集的SHA-256去重机制剔除了近三万条冗余记录,最终汇聚为约36万条训练实例,确保了数据的高纯度与多样性。
使用方法
使用RaceBench数据集便捷高效,开发者可通过HuggingFace的datasets库一键加载,并利用其对话格式的messages字段直接进行监督微调。数据集支持按category字段灵活筛选,如提取编码或智能体相关子集,以满足特定任务需求。同时,该数据集兼容Axolotl等主流训练框架,配置简单,便于集成至现有工作流,助力小型模型在边缘场景中的能力跃升。
背景与挑战
背景概述
近年来,随着边缘计算与隐私保护的日益重视,在资源受限设备上部署高效的智能模型成为研究热点。RaceBench数据集由Sai Dutta等人于2026年构建,旨在解决小规模语言模型(0.5B至3B参数)在边缘场景中能力不足的问题,使其能够替代API调用的前沿模型。该数据集融合了代理工具调用轨迹与高质量蒸馏数据,涵盖编码、网络安全和通用推理领域,经过严格质量筛选(≥60分)和去重处理,共包含约36万条样本。通过提供高信号、低噪声的训练数据,RaceBench显著提升了小模型的函数调用与多步推理能力,为边缘AI部署提供了关键资源,对模型压缩、工具学习及安全编码等研究具有重要推动意义。
当前挑战
RaceBench的构建面临着多方面的挑战。首先,小模型在边缘设备上受限于计算资源和内存,难以从普通指令数据中高效学习复杂的工具调用和多步推理,这要求数据集提供高信噪比的样本。其次,在数据构建过程中,需从大规模异构蒸馏数据(如GPT-5.5、Gemini等生成文本)中筛选出质量达标的数据,确保无低质量行混入,并解决类别不平衡(如代理追踪仅占7.1%)。此外,跨数据集去重需处理29K冗余行,以保持数据独特性。最后,设计混合比例(如4倍上采样代理追踪)和类别平衡策略,以保持小模型的泛化能力,同时避免过拟合,均是构建过程中的关键难点。
常用场景
经典使用场景
RaceBench数据集专为边缘部署场景下的小型语言模型(0.5B-3B参数)设计,其经典使用场景聚焦于监督微调(SFT)流程。该数据集融合了代理工具调用轨迹与高质量蒸馏数据,为小型模型提供了高信号、低噪声的训练语料,使其在资源受限的边缘设备上能够执行复杂任务。通过内置的聊天格式消息字段,研究者可直接利用该数据集对模型进行指令微调,从而显著提升模型在函数调用、多步推理及工具使用等能力上的表现,成为边缘智能领域模型压缩与效能优化的得力工具。
解决学术问题
该数据集着力解决小型模型在边缘环境下性能不足的学术难题。传统上,小型模型因参数量有限,难以从普通指令数据中习得复杂的工具调用与推理模式。RaceBench通过引入高质量的代理轨迹和经过严格质量筛选(≥60分)的蒸馏数据,有效弥合了小型模型与云端前沿模型之间的能力鸿沟。其研究意义在于,为探索数据质量与模型性能之间的量化关系提供了实证基础,同时推动了高效、可持续的边缘AI部署策略的发展,对隐私保护与低延迟推理等研究领域具有深远影响。
实际应用
在实际应用层面,RaceBench数据集直接支持边缘计算环境中的智能代理部署。例如,在物联网设备、移动终端及嵌入式系统上,依托该数据集微调的小型模型能够执行本地化的代码生成、漏洞检测及网络安全管理等任务,减少对云端API的依赖,从而降低通信开销和隐私泄露风险。此外,该数据集还可用于开发离线场景下的智能助手,实现实时交互与决策支持,极大拓展了AI技术在资源受限环境下的应用边界。
数据集最近研究
最新研究方向
RaceBench数据集聚焦于边缘部署场景下的小型语言模型(0.5B-3B)能力增强,通过融合智能体工具调用轨迹与高质量蒸馏数据,探索以数据为中心的方法提升小模型的工具使用与多步推理能力。其研究方向与当前大模型轻量化、边缘智能化的前沿趋势紧密契合,尤其关注在资源受限环境中替代API级前沿模型的可行性。数据集的构建策略强调质量阈值控制与跨源去重,旨在为小模型提供高信噪比的训练信号,推动安全编码与网络安全等垂直领域的实用化部署,具有重要的工程实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务