遇见数据集

thinking-rollouts

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

thinking-rollouts数据集是一个专注于代码生成和推理任务的数据集,包含从思维链(chain-of-thought)模型在DS-1000和LiveCodeBench基准测试上生成的未经约束的rollout数据。数据以原始形式保存,完整记录了模型的思维过程(即推理链)和最终答案。数据集采用Hive分区Parquet格式存储,路径结构为`rollouts/domain=<dataset>/model=<tag>/temp=<temp>/data.parquet`,其中模型标签(如`qwen3-8b-think`和`qwen3-1.7b-nothink`)已整合了思维模式信息,每个实例包含100个样本。数据列包括模型、思维模式、温度、数据集、实例ID、样本、库或难度、原始文本(含完整思维输出)、推理文本、答案文本、提取的代码、完成原因、思维是否闭合、答案是否存在、推理标记数、答案标记数、总标记数、采样参数(JSON格式)以及通过状态。该数据集适用于文本生成任务,特别是代码生成、思维链推理和模型行为分析,旨在支持对模型推理过程的研究和评估。

The thinking-rollouts dataset is a dataset focused on code generation and reasoning tasks, containing unconstrained rollout data generated from chain-of-thought models on the DS-1000 and LiveCodeBench benchmarks. The data is saved in its raw form, fully documenting the models thought process (i.e., reasoning chain) and final answer. The dataset is stored in Hive-partitioned Parquet format, with a path structure of `rollouts/domain=<dataset>/model=<tag>/temp=<temp>/data.parquet`, where model tags (e.g., `qwen3-8b-think` and `qwen3-1.7b-nothink`) incorporate thinking mode information, and each instance contains 100 samples. The data columns include model, thinking mode, temperature, dataset, instance ID, sample, library or difficulty, raw text (including full thought output), reasoning text, answer text, extracted code, completion reason, whether thinking is closed, whether answer exists, reasoning token count, answer token count, total token count, sampling parameters (in JSON format), and pass status. This dataset is suitable for text generation tasks, particularly code generation, chain-of-thought reasoning, and model behavior analysis, aiming to support research and evaluation of model reasoning processes.

创建时间:
2026-06-22
原始信息汇总

数据集:thinking-rollouts

该数据集包含了来自思维链(Chain-of-Thought)模型在 DS-1000 和 LiveCodeBench 两个基准上的无约束 rollout 结果。CoT 内容与最终答案一并逐字保存。

  • 任务类别:文本生成 (text-generation)
  • 领域标签:代码生成、推理、DS-1000、LiveCodeBench、Qwen3
  • 许可证:MIT

数据集结构与配置

数据集包含两个配置,分别对应不同数据来源,均以 Parquet 格式存储。

配置名称 数据路径 说明
rollouts-ds1000 rollouts/domain=ds1000/**/*.parquet 来自 DS-1000 数据集的数据
rollouts-livecodebench rollouts/domain=livecodebench/**/*.parquet 来自 LiveCodeBench 数据集的数据

数据采用 Hive 分区格式,路径结构如下: rollouts/domain=<数据集>/model=<模型标签>/temp=<温度>/data.parquet

其中 thinking_mode 已合并到模型标签中,例如 qwen3-8b-thinkqwen3-1.7b-nothink。每个实例包含 100 个采样。

数据列及说明

每条记录包含以下字段:

列名 类型/说明
model 模型名称
thinking_mode 是否使用思维链模式
temp 采样温度
dataset 数据集名称 (ds1000 / livecodebench)
instance_id 实例唯一标识
sample 采样序号
`library difficulty`
raw_text 完整输出文本(包含 <think> 标签)
reasoning_text 仅推理部分的文本
answer_text 仅答案部分的文本
extracted_code 从输出中提取的代码
finish_reason 生成结束原因
thinking_closed 思维链是否闭合
answer_present 答案是否存在
n_reasoning_tokens 推理部分的 token 数量
n_answer_tokens 答案部分的 token 数量
n_total_tokens 总 token 数量
sampling_params 采样参数(JSON 格式)
passed 是否通过测试

模式说明

该数据集模式是 genlm/rollouts 项目问题 #5 中定义格式的超集,也是 temperature-sweep-data 模式的扩展。

搜集汇总
数据集介绍
thinking-rollouts 数据集图片
构建方式
在代码生成与链式推理(Chain-of-Thought, CoT)领域,如何系统性地评估思考模型(thinking models)的推理过程与输出质量,是当前研究的热点。该数据集旨在记录并共享来自思考模型在DS-1000与LiveCodeBench基准上的无约束生成轨迹,并严格保存包括<think>标记在内的原始文本、推理文本与最终答案。构建方式遵循genlm/rollouts规范,采用Hive分区Parquet格式存储,模型与思考模式标识被折叠至模型标签中,每个实例对应100个采样点,以支持充分的统计分析。
使用方法
该数据集的使用极其便捷,可通过HuggingFace Datasets库直接加载,支持rollouts-ds1000与rollouts-livecodebench两个子配置。用户无需手动处理复杂路径,即可按需获取特定领域、模型或温度下的样本。每行记录涵盖完整的推理轨迹与执行结果,适用于对比实验、推理过程可视化、token效率分析以及失败案例研究,为改进链式推理模型提供了扎实的数据基础。
背景与挑战
背景概述
在大型语言模型(LLM)的推理能力研究中,链式思维(Chain-of-Thought, CoT)作为一种有效提升模型复杂问题求解能力的技术,正受到学术界与工业界的广泛关注。thinking-rollouts数据集由相关领域的研究团队于近期构建,专注于捕获思维模型(thinking models)在DS-1000与LiveCodeBench两个代码生成与推理基准上的无约束生成过程。该数据集的核心贡献在于,它以结构化的Parquet格式保存了模型从原始思考文本到最终答案的完整推理轨迹,包括中间推理步骤、答案抽取以及执行通过与否的标签。通过将思考模式(thinking_mode)作为模型标签的一部分进行梳理,它为推动思考模型的透明性、可解释性及后续的强化学习微调(如基于rollout数据的训练)提供了高质量的原始资源,对代码生成与复杂推理任务的研究范式具有重要的推动作用。
当前挑战
该数据集所解决的领域挑战主要体现在两方面。其一,在代码生成与数学推理任务中,现有评估往往只关注最终答案的正确性,忽视了推理过程的多样性与中间错误模式,导致模型在生成合理中间步骤时缺乏监督信号;thinking-rollouts通过保存完整的<think>标记内思考文本,为剖析模型失败原因与改进推理策略提供了基础。其二,在数据集构建过程中,面临的挑战包括如何大规模、高效地对DS-1000及LiveCodeBench中每个实例进行100次采样,以确保统计显著性;同时需要统一不同模型(如Qwen3系列)在不同推理模式下的输出格式,并处理推理过程可能未闭合(thinking_closed)、答案缺失(answer_present)等异常情况,保障数据质量便于下游使用。
常用场景
经典使用场景
在代码生成与推理对齐研究领域,thinking-rollouts数据集被广泛用于评估链式思维(Chain-of-Thought)模型在编程任务中的表现。该数据集收录了来自Qwen3系列等模型在DS-1000和LiveCodeBench两个基准上的完整推理轨迹与最终答案,每个实例均包含100个独立样本。研究者可借助其结构化的Parquet格式,提取思考过程中的<think>标记文本、推理令牌数量及最终答案等字段,系统性地分析推理深度与代码生成准确性之间的关联,从而探究大语言模型在复杂编程问题中的内在认知机制。
解决学术问题
该数据集有效攻克了当前代码生成领域缺乏大规模、细粒度推理过程标注数据的难题。传统基准多仅记录最终答案,难以揭示模型在解题过程中的推理演变与自我修正行为。thinking-rollouts通过保存完整的思考文本与中间推理令牌统计,使得学术社区能够深入剖析模型何时启用思考模式、思考与回答阶段的资源分配规律,以及推理长度与任务难度、编程语言规范之间的映射关系。这为理解大模型在编程领域的元认知能力提供了宝贵的实验素材,推动了可解释代码生成技术的发展。
实际应用
在实际工程应用中,thinking-rollouts可辅助开发者优化面向编程助手的大语言模型推理策略。例如,通过分析数据集中提取的代码段及其通过/失败状态,工程师能够构建针对性更强的监督微调数据集,提升模型在复杂API调用和库函数使用上的准确率。同时,数据集中涵盖的不同温度采样参数与思考模式标注,可用于开发智能化的推理预算控制机制——使系统根据任务难度动态切换思考深度,在保持代码质量的同时降低延迟与计算成本,这对于部署实时编程助手产品具有重要意义。
数据集最近研究
最新研究方向
当前,大语言模型的链式思维推理能力与代码生成任务的深度融合成为研究热点。thinking-rollouts数据集聚焦于DS-1000与LiveCodeBench两大基准,系统收录了Qwen3系列模型在推理模式开启与关闭下的无约束展开结果,详尽保留了从原始<think>标记输出到最终代码提取的完整轨迹。该数据集的独特价值在于,它首次以hive分区的Parquet格式公开了百次采样级别的细粒度样本,每条记录均包含推理文本、答案文本、抽取代码及通过状态等元数据,为探索思维链对代码合成质量的影响提供了实证基础。随着Qwen3等强推理模型的涌现,该资源正被学界用于分析推理长度、思考闭合模式与代码通过率之间的潜在关联,进而推动可解释、高可靠代码生成范式的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务