遇见数据集

flint-dataset

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Flint洞穴人推理数据集是一个专为指令微调设计的合成数据集,旨在训练本地开源模型(如gemma-4-31b)使用一种压缩、高效且不损害答案质量的推理风格。其核心特点是洞穴人风格推理轨迹,通过省略冠词、助动词、开场白等冗余内容,保留技术术语、数字、否定词和代码原文,并以每行一个主张、使用符号(如`->`、`→`)的方式,将逻辑步骤高度浓缩,形成电报式的密集推理。每个样本包含自然语言输入(用户提示/任务)、对应的洞穴人风格推理轨迹以及完整的散文式答案(在生成后保持不变)。数据覆盖多个领域,包括数学、代码、创意、对话和通用领域。数据集通过两阶段流程生成:首先由一个推理大语言模型为每个输入生成自然推理和答案;然后由另一个大语言模型将原始推理转换为洞穴人风格,同时保持原始答案不变。数据集规模约为1.6万个样本,来源于五个公开数据集:HelpSteer2(对话)、LongForm(创意)、NuminaMath-CoT(数学)、OpenCodeReasoning(代码)和s1K(通用)。根据统计数据,使用洞穴人风格推理平均可节省约84%的推理部分token消耗,显著提升了推理效率。数据集还包含丰富的元数据,如答案验证状态(针对数学问题)、生成和转换所用的模型、token计数等,便于深入分析和使用。

The Flint Caveman Reasoning Dataset is a synthetic dataset purpose-built for instruction tuning, designed to train local open-source models (e.g., Gemma-4-31B) with a compact, efficient reasoning style that does not compromise answer quality. Its core characteristic is the caveman-style reasoning trajectory, which omits redundant content such as articles, auxiliary verbs, and opening remarks, while preserving technical terms, numbers, negations, and original code segments. It condenses logical steps into telegraphic, dense reasoning by placing each claim on a separate line with symbols like `->` or `→`. Each sample contains a natural language input (user prompt/task), the corresponding caveman-style reasoning trajectory, and the complete prose-style answer (maintained unchanged after generation). The dataset covers multiple domains including mathematics, code, creativity, dialogue, and general scenarios. It is generated via a two-stage workflow: first, a reasoning large language model (LLM) generates natural reasoning and answers for each input; then another LLM converts the original reasoning into the caveman-style format while keeping the original answer unaltered. The dataset has approximately 16,000 samples, sourced from five public datasets: HelpSteer2 (dialogue), LongForm (creativity), NuminaMath-CoT (mathematics), OpenCodeReasoning (code), and s1K (general domain). According to statistical data, adopting caveman-style reasoning reduces token consumption in the reasoning segment by an average of 84%, significantly boosting reasoning efficiency. The dataset also includes rich metadata such as answer validation status (for mathematical problems), models used for generation and conversion, token counts, and more, to facilitate in-depth analysis and application.

创建时间:
2026-06-02
原始信息汇总

数据集名称

flint — caveman reasoning dataset

许可证

MIT

语言

英语

任务类别

文本生成

数据集规模

10,000 < 样本数 < 100,000(当前约15,912条)

数据集描述

该数据集是一个指令微调数据集,将自然语言输入与“穴居人风格”的推理轨迹(caveman-style reasoning traces)以及完整散文风格的答案配对。目标是训练本地开源模型(如gemma-4-31b)在保持答案质量的前提下,以压缩、节省token的方式进行推理。

什么是穴居人推理?

穴居人推理保留了每个逻辑步骤,但去除了语法和填充词汇,生成密集、简洁的推理内容,在推理时消耗更少的token。

  • 正常推理示例: The issue is most likely caused by your authentication middleware validating token expiration with the wrong comparison operator.
  • 穴居人推理示例: Bug: auth middleware token expiry check uses < not <=. Fix operator, redeploy.

规则:删除冠词和助动词;删除开场白和“让我想想”;保留技术术语、数字、否定词和代码原样;每行一个主张;使用符号(->, , vs, &)。此风格仅应用于推理部分,答案始终为完整散文。

构建流程

  1. 生成:一个推理LLM为每个输入生成自然推理+答案。生成器不看到参考答案。
  2. 转换:另一个LLM将原始推理转换为穴居人风格。原始答案保持不变。

数据模式

每条记录包含以下字段:

字段 类型 描述
input string 用户提示/任务
reasoning string 穴居人风格的推理轨迹
answer string 完整散文答案(从生成阶段保持不变)
domain string 领域:mathcodecreativeconversationalgeneral
source string 源数据集名称
verified bool / null true = 数学答案经核实与参考解等效;false = 无法核实的数学答案;null = 不适用(非数学)。错误的数学答案已被删除,而非标记为false
meta.id string 源数据集中的唯一记录ID
meta.gen_model string 用于生成(阶段1)的模型
meta.convert_model string 用于穴居人转换(阶段2)的模型
meta.split_method string 思考/答案分割方法(如nativeheuristic等)
meta.sample_idx int 该样本在源数据集中的索引
meta.caveman_level string 转换强度级别(如medium
meta.raw_tokens int 原始推理的token数量
meta.caveman_tokens int 穴居人推理的token数量

源数据集

源数据集 领域 Hugging Face 标识符
helpsteer2 conversational nvidia/HelpSteer2
longform creative akoksal/LongForm
numina_math math AI-MO/NuminaMath-CoT
opencode_reasoning code nvidia/OpenCodeReasoning
s1k general simplescaling/s1K

压缩统计

使用 google/gemma-4-31b-it tokenizer 测量。压缩比 = caveman_tokens / raw_tokens(越低越密集)。Saved = 每行平均消除的token百分比。

源数据集 样本数 原始Token数 穴居人Token数 压缩比 节省比例
helpsteer2 4380 10,509,030 2,043,420 0.19 81%
longform 5594 5,428,827 1,174,189 0.22 78%
numina_math 3187 4,601,678 738,483 0.16 84%
opencode_reasoning 1601 4,588,759 569,573 0.12 88%
s1k 1150 6,168,822 446,971 0.07 93%
总计 15912 31,297,116 4,972,636 0.16 84%

注意:正在生成更多数据,每次更新时会同步统计数据。

搜集汇总
数据集介绍
flint-dataset 数据集图片
构建方式
flint-dataset的构建依托于两阶段流水线式方法论。首阶段,一个推理型大语言模型针对各类用户提示自主生成自然语言推理轨迹与详尽答案,此过程中不依赖任何参考答案。次阶段,另一语言模型将原始推理转化为‘穴居人推理’风格,省略冠词、助动词及冗余引导语,同时完整保留原始答案文本。最终,每一数据条目涵盖输入提示、简洁推理链、完整回答、领域标签、来源标识及验证状态等多元字段,形成结构化且富含元信息的指令调优数据集。
特点
该数据集最显著的特质在于其开创性的‘穴居人推理’范式,即在保持每一逻辑推理步骤完整性的前提下,通过压缩语法与填充词,实现推理过程的极致精简与高效。统计数据表明,相比原始推理,该数据集平均可削减84%的令牌消耗,其中s1k领域压缩比高达93%,显著提升了推理时效性与经济性。同时,数据集广涉数学、代码、创意、对话与通用五大领域,并引入严谨的数学答案等价性验证机制,确保数据质量与可靠性。
使用方法
FLINT数据集专为训练本地开放权重模型(如Gemma系列)而设计,旨在教导模型采用令牌高效风格进行推理而不失答案质量。使用时可将数据集加载至标准训练流水线,以输入字段作为监督信号,引导模型学习从用户提示生成压缩推理轨迹并输出完整答案的映射关系。建议结合领域标签与验证状态筛选子集进行差异化微调,亦可利用元数据中的令牌压缩比等指标评估推理效率,以优化模型在实时应用场景中的推理成本与响应速度。
背景与挑战
背景概述
flint-dataset是由研究人员为应对大语言模型推理效率瓶颈而构建的指令微调数据集,发布于2024年。该数据集的核心研究问题在于探索如何在保持回答质量的前提下,通过压缩推理过程的token消耗来提升模型推理的经济性。数据集通过将自然语言推理轨迹转化为“穴居人推理”风格——保留逻辑步骤但去掉语法虚词,从而显著降低token使用量。其影响力体现在为开源模型(如Gemma-4-31B)提供了一种实用训练方案,使推理密集型任务的计算成本大幅下降,同时推动了高效推理范式的研究。
当前挑战
该数据集主要面临两重挑战。其一,领域问题层面,传统链式思维推理虽提升准确性却导致推理轨迹冗长,增加推理时延和计算开销,亟需一种在压缩性与可解释性间取得平衡的推理风格。其二,构建过程中,需要确保“穴居人推理”转换的忠实性——即压缩后的推理步骤仍逻辑完整且不丢失关键信息;同时应对多领域数据(数学、代码、创意等)的推理风格差异,设计统一的转换规则,并处理数学答案的严格验证,避免错误样本污染训练集。
常用场景
经典使用场景
在语言模型的高效推理研究领域,flint数据集主要被用于训练模型生成一种称为“穴居人推理”的精简推理链。该数据集将自然语言指令与经过压缩的、去除了语法冗余和填充词的推理步骤配对,同时保留完整的最终答案。研究者通常利用此数据集对开源模型(如gemma-4-31b)进行指令微调,使模型能够在保持回答质量的前提下,大幅减少推理过程中的token消耗,从而提升推理效率。
实际应用
在实际部署场景中,flint数据集训练出的模型可显著降低企业级语言模型推理服务的算力开支。例如,在客服对话、代码辅助、数学解题等需要实时响应的应用中,采用穴居人推理风格的模型能够在保证输出质量的同时,大幅缩短推理延迟和节省API调用成本。这对于资源受限的边缘设备或对推理吞吐量要求极高的大规模服务平台尤为有价值。
衍生相关工作
该数据集的工作思路催生了一系列关于推理压缩与token效率优化的后续研究。研究者借鉴其将复杂推理过程转化为极简符号化表达的方法,进一步探索了不同压缩策略对模型通用推理能力的影响。此外,围绕穴居人推理与完整思维链之间的性能对比、压缩比与推理准确率之间的权衡等课题,涌现出大量实证分析工作,推动了高效推理方案从理论探索走向工程实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务