RaceBench
收藏资源简介:
RaceBench 是一个精心策划的 SFT(监督微调)数据集,专门用于提升小模型(0.5B-3B 参数规模)在边缘部署场景下的能力。该数据集混合了来源于 fable-5-premium 的 agent 工具使用轨迹和来源于 GPT-5.5/Gemini/Grok/Claude 等模型的蒸馏数据,经过质量过滤,仅保留评分 >=60/100 的高质量样本。数据集总共有 359,821 条样本,其中 agent 轨迹(4 倍上采样后)占 7.1%,蒸馏数据(涵盖编码、网络安全和蒸馏类别)占 92.9%。数据字段包括:messages(聊天格式的对话,可直接用于 SFT)、source_group(来源分组)、source(原始来源分割名称)、category(内容类别:agent、coding、cybersecurity、distilled)和 quality_score(质量评分 0-100)。数据集经过跨数据集 SHA-256 去重,移除了约 29K 冗余行。RaceBench 特别适用于训练小模型进行工具调用、多步推理、编码、网络安全分析以及通用蒸馏任务,是边缘模型微调的高信号、低噪声数据集。
RaceBench is a carefully curated SFT (Supervised Fine-Tuning) dataset specifically designed to enhance the capabilities of small models (0.5B-3B parameters) in edge deployment scenarios. The dataset mixes agent tool-use trajectories from fable-5-premium and distilled data from models such as GPT-5.5, Gemini, Grok, and Claude, filtered to retain only high-quality samples with quality scores >=60/100. The dataset contains a total of 359,821 samples, of which agent trajectories (after 4x upsampling) account for 7.1%, and distilled data (covering coding, cybersecurity, and distilled categories) accounts for 92.9%. Data fields include: messages (conversations in chat format, directly usable for SFT), source_group (source group), source (original source split name), category (content category: agent, coding, cybersecurity, distilled), and quality_score (quality score 0-100). The dataset has been deduplicated across datasets using SHA-256, removing approximately 29K redundant rows. RaceBench is particularly suitable for training small models in tool calling, multi-step reasoning, coding, cybersecurity analysis, and general distillation tasks, making it a high-signal, low-noise dataset for fine-tuning edge models.
数据集概述
RaceBench 是一个面向边缘部署场景的精选监督微调(SFT)数据集,旨在增强小型模型(0.5B-3B)的智能体工具使用能力与推理表现,使其在边缘环境中可作为 API 型前沿模型的替代方案。该数据集遵循 MIT 许可证,语言为英语,规模属于 100K 至 1M 条样本区间,任务类型为文本生成。
数据集构成
RaceBench 由两个来源的数据混合而成,总计 359,821 行:
| 来源 | 行数 | 占比 |
|---|---|---|
| Fable-5 Agent Traces(4倍上采样) | 25,460 | 7.1% |
| 蒸馏数据(coding + cybersecurity + distilled) | 334,361 | 92.9% |
来源一:Fable-5 Agent Traces
来自 saidutta69/fable-5-premium,包含多轮智能体轨迹、工具调用、推理链和结构化函数调用模式,经 4 倍上采样以保留智能体信号。
来源二:蒸馏数据(质量 ≥ 60)
来自 GPT-5.5 / Gemini / Grok / Claude 蒸馏数据集,筛选质量不低于 60 分的样本,具体分布为:
- Coding:135K 行
- Cybersecurity:167K 行
- Distilled:61K 行
质量保障机制
- 质量门槛:所有样本的质量得分均不低于 60/100,低质量数据被排除
- 去重处理:通过跨数据集的 SHA-256 去重,移除了 29K 冗余行
- 专注领域:聚焦编程、安全与蒸馏数据,贴合实际边缘部署需求
适用场景与优势
该数据集专为小型模型设计,主要优势包括:
- 工具使用信号:智能体轨迹教授函数调用和多步推理模式,弥补小模型在纯指令数据上的不足
- 质量下限保障:杜绝低质量样本干扰
- 领域聚焦:编程 + 安全 + 蒸馏数据的组合是边缘部署的实践重点
- 去重优化:减少冗余,提升训练效率
数据字段
| 字段 | 类型 | 说明 |
|---|---|---|
messages |
List[Struct{role, content}] |
聊天格式对话(SFT 就绪) |
source_group |
str |
来源组,值为 "fable-5" 或 "distillation" |
source |
str |
原始来源分割名称 |
category |
str |
内容类别(agent、coding、cybersecurity、distilled) |
quality_score |
float64 |
质量得分(0-100) |
使用方式
可通过 Hugging Face datasets 库直接加载:
python from datasets import load_dataset
ds = load_dataset("saidutta69/RaceBench", split="train") print(f"Examples: {len(ds)}") print(ds[0]["messages"])
支持按类别过滤:
python coding = ds.filter(lambda x: x["category"] == "coding") agent = ds.filter(lambda x: x["category"] == "agent")
同时兼容 Axolotl 微调框架,提供对应的 YAML 配置示例。引用该数据集时,可参考其提供的 BibTeX 条目。





