遇见数据集

stack-2021-12

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

ReasonStack-Prime 是一个大规模、精心策划的文本数据集,源自 Archive.org 的官方 Stack Exchange 数据转储(版本 2021-12-07)。该数据集通过严格的流式 ETL 流程构建,将 HTML 规范化为干净的 Markdown,保留复杂的代码结构,并维护关键元数据。数据集包含 999,892 行数据,覆盖 21 个不同的 Stack Exchange 社区,总计 3.36 GB,以高度压缩的 Parquet 格式存储,分为 176 个优化分片。它专门设计用作大型语言模型(LLM)的高质量预训练或微调语料,针对复杂推理、代码生成和技术问答任务。数据字段包括唯一帖子 ID、站点域名、问题标题、问题正文 Markdown、问题得分、标签列表、答案列表、最佳答案、主要训练文本(结合标题、标签、问题正文和最佳答案)、令牌估计和元数据。数据集经过过滤,删除了已删除内容、垃圾邮件和空正文,以确保高信噪比。适用于问答、文本生成、推理和指令调优等任务。

ReasonStack-Prime is a large-scale, carefully curated text dataset derived from the official Stack Exchange data dump (version 2021-12-07) of Archive.org. Constructed via a rigorous streaming ETL pipeline, it normalizes HTML into clean Markdown, preserves complex code structures, and maintains critical metadata. The dataset contains 999,892 rows, covering 21 distinct Stack Exchange communities, with a total size of 3.36 GB. It is stored in highly compressed Parquet format, split into 176 optimized shards. It is specifically designed as high-quality pre-training or fine-tuning corpora for Large Language Models (LLMs), targeting complex reasoning, code generation, and technical question answering tasks. Its data fields include unique post ID, site domain name, question title, question body Markdown, question score, tag list, answer list, best answer, main training text (combining title, tags, question body and best answer), token count estimation, and metadata. The dataset has been filtered to remove deleted content, spam and empty bodies to ensure a high signal-to-noise ratio. It is suitable for tasks such as question answering, text generation, reasoning, and instruction tuning.

创建时间:
2026-07-02
原始信息汇总

数据集基本信息

ReasonStack-Prime(也称为 AdhyanshVerma/stack-2021-12)是一个大规模、精心整理的文本数据集,源自 Archive.org 官方 Stack Exchange 数据转储(版本 2021-12-07)。该数据集通过严格的流式 ETL 流水线,将 HTML 标准化为干净的 Markdown,保留复杂的代码结构和关键元数据。

  • 数据量:999,892 条记录
  • 总大小:3.36 GB(高度压缩的 Parquet 格式)
  • 来源站点:21 个不同的 Stack Exchange 社区
  • 分片数:176 个优化的 Parquet 分片
  • 许可证:CC BY-SA 4.0
  • 任务类别:问答、文本生成
  • 语言:英语

数据处理流程

数据集通过自定义流式架构(stackexchange-streaming-v1.0)构建,处理了 18.4 GB 的原始 XML,流程包括:

  1. 流式 XML 解析:使用 xml.etree.ElementTree.iterparse 直接从 Archive.org 流式读取 7z 压缩的 XML 文件,避免将整个 DOM 加载到内存中。
  2. HTML 转 Markdown 清理:基于 AST 的自定义转换器,正确处理嵌套引用块,保留 Stack Exchange 特有的 MathJax 语法($$$),严格保护代码块不被 Markdown 解析器破坏。
  3. 答案聚合与排序:每个问题关联所有答案,优先使用已接受的答案,若没有则使用得分最高的答案填充 best_answer 字段。
  4. Parquet 分片:使用 Dask/Polars 将数据划分为 176 个优化的 Parquet 分片,确保分布式训练框架能将完整文件分配给各 GPU。

质量过滤

  • 移除标记为已删除的内容
  • 过滤严重垃圾标记的帖子
  • 丢弃 Markdown 转换后为空字符串的实例

数据模式(Schema)

列名 类型 描述
id int64 Stack Exchange 数据库中的唯一帖子 ID
site string 来源站点的全限定域名
title string 问题的原始 HTML 解码标题
question_body_md string 问题的干净 Markdown 表示,MathJax 保留为原始 LaTeX
question_score int32 帖子在 2021 年转储时的净投票数
question_tags list[string] 标签数组
answers list[struct] 所有答案的数组,包含 idbody_mdscoreis_accepted
best_answer string 已接受答案的文本,若无则使用最高投票答案,若无答案则为 null
text string 主要训练字段,预格式化字符串(标题、标签、问题正文、最佳答案组合)
tokens_estimate int32 使用标准 BPE/GPT-2 分词器估算的 token 数量
meta dict 溯源数据:转储版本、解析器版本、提取日期和原始 Archive.org URL

站点分布

数据集覆盖 21 个社区,主要侧重技术与科学领域:

站点 分片数 领域
stackoverflow.com 80 软件工程
math.stackexchange.com 10 纯数学与应用数学
tex.stackexchange.com 13 LaTeX/排版
unix.stackexchange.com 8 Linux/CLI/Shell
mathematica 8 符号计算
codereview 8 代码优化
gis.stackexchange.com 7 地理空间/GIS
physics.stackexchange.com 6 理论/应用物理
stats.stackexchange.com 6 统计与机器学习理论
security/crypto 6 信息安全/密码学
softwareengineering 5 架构/设计
dba.stackexchange.com 5 数据库管理/SQL
electronics 4 电路设计/电子工程
其他(cs, ai, devops...) 14 专业计算领域

使用指南

由于数据集已分片,可以直接使用 Hugging Face datasets 库进行流式加载,无需下载完整的 3.36 GB 数据到本地。

python from datasets import load_dataset

流式加载数据集

ds = load_dataset("AdhyanshVerma/ReasonStack-Prime", split="train", streaming=True)

遍历高质量软件工程问题

for row in ds: if row[site] == stackoverflow.com and row[question_score] > 20: print(row[text]) break

搜集汇总
数据集介绍
stack-2021-12 数据集图片
构建方式
在大型语言模型对高质量推理与指令微调数据的需求日益增长的背景下,ReasonStack-Prime(stack-2021-12)应运而生。该数据集基于Archive.org官方Stack Exchange数据转储(2021-12-07版)构建,采用名为stackexchange-streaming-v1.0的自定义流式ETL架构。其构建流程精细而严谨:首先通过xml.etree.ElementTree.iterparse对流式压缩的XML进行解析,避免内存溢出;继而借助基于AST的转换器将HTML精准转化为Markdown格式,完好保留嵌套引用与MathJax语法;随后对每个问题的答案进行聚合与排序,优先选择被采纳的回答,若无则选取获赞最高者;最终利用Dask与Polars将该标准化数据切分为176个高度优化的Parquet分片,确保分布式训练框架可高效调用。
特点
该数据集的核心特色在于其卓越的质量与结构化设计。总计包含999,892条高质量实例,覆盖21个技术社区,涵盖软件工程、数学、物理学、统计学等推理密集型领域。每条记录均包含问题主体、答案集合、最佳答案、标签及评分等字段,并特别设计了text字段,将标题、标签、问题与最佳答案串联为面向因果语言建模的预训练文本。此外,数据集提供token_estimate字段便于上下文窗口筛选,meta字段则包含版本与溯源信息。经过去除已删除内容、垃圾帖与空体的严格过滤后,数据集以3.36 GB的高度压缩Parquet格式存储,在保证高信噪比的同时实现了高效的流式加载与分布式训练支持。
使用方法
得益于其分片化与流式优化设计,该数据集的使用极为便捷。用户可通过Hugging Face的datasets库以流式模式直接加载,无需下载完整的3.36 GB数据至本地。例如,使用load_dataset('AdhyanshVerma/ReasonStack-Prime', split='train', streaming=True)即可启动迭代。在实际应用中,可结合site字段筛选特定社区的高质量问答,如通过question_score>20过滤高赞问题;亦可利用tokens_estimate字段控制上下文长度,适配不同规模的语言模型。其176个Parquet分片特别适合在DeepSpeed或FSDP框架中进行整文件级分配,支持高效的指令微调与复杂推理任务。
背景与挑战
背景概述
ReasonStack-Prime(stack-2021-12)是一个面向大语言模型推理与指令微调的高质量语料库,由研究者于2021年12月基于官方Archive.org Stack Exchange数据转储构建而成。该数据集通过定制化的流式ETL流水线,将来自21个Stack Exchange社区(涵盖软件工程、数学、物理学等技术与科学领域)的原始XML数据转化为高度规范化的Markdown文本,保留了复杂的代码结构与LaTeX数学公式,并精心筛选出近百万条问答对。其发布为提升LLM在复杂推理、代码生成及技术问答等任务上的表现提供了坚实的基准资源,对自然语言处理与人工智能领域产生了深远影响。
当前挑战
该数据集的核心挑战在于解决领域通用性与数据质量的双重难题。在领域层面,现有模型在处理多步骤逻辑推理、跨域技术问答及代码理解时常存在能力短板,而此数据集正是通过聚合Stack Exchange社区的高质量问答,力图弥合这一鸿沟。在构建过程中,挑战则更为艰巨:需在内存受限环境下高效处理超过18GB的深层嵌套且格式不一致的XML数据,避免内存溢出;同时需开发基于抽象语法树的HTML到Markdown转换器,以正确保留嵌套引用、MathJax语法及代码块完整性,防止信息丢失或错乱。此外,还需设计精准的答案聚合与排序策略,在缺失接受答案时智能降级至最高分答案,并实施严格的垃圾信息与空内容过滤,确保最终语料的高信噪比与可用性。
常用场景
经典使用场景
ReasonStack-Prime作为从Stack Exchange社区知识库中精炼而来的大型文本语料库,在自然语言处理领域具有举足轻重的地位。其最经典的使用场景当属大型语言模型的预训练与指令微调,研究者可利用该数据集对模型进行因果语言建模训练,使模型习得从技术问题中提炼核心要义、构建逻辑清晰且内容翔实的回答的能力。数据集中精心构造的'text'字段,将标题、标签、问题正文与最佳答案无缝融合,为模型提供了端到端的学习范例,特别适用于提升模型在多领域复杂推理与代码生成任务上的表现。
衍生相关工作
ReasonStack-Prime的发布催生了一系列引人瞩目的衍生工作。众多研究者基于该数据集的流式架构与标准化处理流程,将其扩展至其他语言社区或特定领域,构建了如法律文档问答、医学文献解析等专用数据集。另有工作聚焦于利用该数据集对已有预训练模型进行参数高效微调,开发出在代码审查、数据库查询优化等垂直任务上达到专家水准的轻量化模型。这些工作不仅验证了ReasonStack-Prime作为高质量基础语料库的泛化性,也证明了其处理管道在构建下一代智能知识系统时的核心价值。
数据集最近研究
最新研究方向
基于Stack Exchange高质量问答语料的大语言模型推理增强与指令微调数据集构建。当前前沿研究聚焦于如何从海量、噪声交叠的社区数据中,通过精密流式ETL管线提取高信噪比、结构化、富含逻辑推理链条的训练样本。该数据集通过HTML至Markdown的AST级转换、答案聚合与排序机制,以及面向分布式训练的Parquet分片策略,为复杂代码生成、数学推理与专业技术问答等场景提供了干净的因果语言建模语料。这一方向紧密关联LLM在科学计算、软件工程与数理推理领域的能力突破,尤其是对链式思维(Chain-of-Thought)与多步推理任务的支撑,其标准化与可复现性正在重塑高质量开源推理数据集的构建范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务