遇见数据集

code-alchemy

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

CodeAlchemy是一个大规模合成代码数据集,专门用于训练和评估代码语言模型。该数据集包含约9766亿令牌(约162M行),磁盘大小约873 GB,采用Parquet格式并经过zstd压缩。数据集由5个训练子集和2个评估子集构成,涵盖了多种代码相关任务。训练子集包括:1) code-enhance:包含原始源代码的重写版本、语法错误标注和质量评分,数据来源于stack_edu、refinecode和the-stack-v2-train-smol-ids,使用gpt-oss-20b模型生成;2) code-qa:代码问答对,来源于stack_edu和DeepMind code_contests,主要使用gpt-oss-20b模型生成;3) code-dev:开发者任务,包含推理轨迹和完成内容,所有种子文件来源于stack_edu,使用gpt-oss-20b模型生成,但需要手动获取原始源代码替换占位符;4) code-dialogue:开发者与助手之间的多轮对话,使用gpt-oss-20b模型生成,同样需要手动获取原始源代码;5) code-trace:代码执行轨迹,包含插桩代码和标准输出,来源于stack_edu和DeepMind code_contests,使用gpt-oss-20b模型生成并通过沙箱执行生成轨迹。评估子集包括dev-eval(用于code-dev的评估,包含Claude响应用于比较评分)和trace-eval(用于code-trace的评估,包含Claude响应和自动指标)。数据集的主要列是`text`,包含完全格式化的提示-完成对或多轮对话,用于预训练。由于所有权考虑,原始源文件未包含在数据集中,需要按照说明手动获取。该数据集适用于代码生成、问答、对话和代码追踪等任务。

CodeAlchemy is a large-scale synthetic code dataset specifically designed for training and evaluating code language models. The dataset contains approximately 976.6 billion tokens (about 162 million lines), with a disk size of about 873 GB, stored in Parquet format and compressed with zstd. It consists of 5 training subsets and 2 evaluation subsets, covering various code-related tasks. The training subsets include: 1) code-enhance: contains rewritten versions of original source code, syntax error annotations, and quality scores, sourced from stack_edu, refinecode, and the-stack-v2-train-smol-ids, generated using the gpt-oss-20b model; 2) code-qa: code question-answer pairs, sourced from stack_edu and DeepMind code_contests, primarily generated using the gpt-oss-20b model; 3) code-dev: developer tasks, including reasoning traces and completion content, with all seed files from stack_edu, generated using the gpt-oss-20b model, but requiring manual retrieval of original source code to replace placeholders; 4) code-dialogue: multi-turn dialogues between developers and assistants, generated using the gpt-oss-20b model, also requiring manual retrieval of original source code; 5) code-trace: code execution traces, including instrumented code and standard output, sourced from stack_edu and DeepMind code_contests, generated using the gpt-oss-20b model and executed in a sandbox to produce traces. The evaluation subsets include dev-eval (for evaluating code-dev, containing Claude responses for comparative scoring) and trace-eval (for evaluating code-trace, containing Claude responses and automatic metrics). The main column of the dataset is `text`, which contains fully formatted prompt-completion pairs or multi-turn dialogues for pre-training. Due to ownership considerations, original source files are not included in the dataset and must be manually retrieved as per instructions. The dataset is suitable for tasks such as code generation, question answering, dialogue, and code tracing.

创建时间:
2026-07-16
原始信息汇总

数据集概述

CodeAlchemy 是一个由 IBM 研究团队创建的合成代码数据集,旨在用于训练和评估代码语言模型。它包含约 9766 亿 Token,约 1.62 亿行数据,分布在 7 个子集中。


数据集规模与统计

配置名称 分割 行数 Token 数(估计) 分片数 大小
code-enhance train 45,787,739 1245 亿 116 114 GB
code-qa train 22,217,884 313 亿 31 30 GB
code-dev train 62,187,373 2698 亿 252 248 GB
code-dialogue train 30,908,028 5447 亿 467 478 GB
code-trace train 1,313,480 63 亿 4 3.9 GB
dev-eval test 1,488 1 12 MB
trace-eval test 1,050 1 5.2 MB
总计 162,417,042 ~9766 亿 872 ~873 GB

所有文件均为 Parquet 格式,采用 zstd 压缩。


主要字段

  • text:预训练的主要列,包含格式化的提示-回答对或多轮对话,格式为 `User: <prompt>

Assistant: <response>。对于 has_reasoningTrue的行,回答中包含<think>...</think>` 反思块。

  • len_texttext 字段的字符长度,用于估算 Token 数(len_text / 4)。

子集说明

1. code-enhance(代码增强)

  • 描述:对原始代码文件的改写版本、语法错误注释及质量评分。
  • 来源stack_edurefinecodethe-stack-v2-train-smol-ids
  • 生成模型:gpt-oss-20b(推理努力程度:中等)。
  • 主要列blob_id(文件标识符)、language(编程语言)、corpus(源语料库)、raw_has_syntax_error_tree_sitter(原始代码是否有语法错误)、raw_quality_score(原始代码质量评分)、text(改写后的代码)、text_has_syntax_error_tree_sitter(改写代码是否有语法错误)、len_text(字符长度)。

2. code-qa(代码问答)

  • 描述:代码问答对。
  • 来源stack_edu 和 DeepMind code_contests
  • 生成模型:gpt-oss-20b(高),竞赛部分使用 gpt-oss-120b(高)。
  • 主要列blob_idcorpusstyle(问答风格/格式)、languagehas_reasoning(是否包含推理)、textlen_text

3. code-dev(开发者任务)

  • 描述:包含推理轨迹和完成的开发者任务。
  • 来源:所有种子文件来自 stack_edu
  • 生成模型:gpt-oss-20b(中等)。
  • 注意text_with_placeholders 列包含占位符 {{{REPLACE_WITH_BLOB_ID_SOURCE}}},需要替换为对应 blob_id 的种子源代码(因所有权问题未包含)。
  • 主要列blob_idlanguagecorpusdifficulty_user_1(任务难度)、training_value_user_1(训练信号价值)、validity_user_1(有效性评分)、text_with_placeholderslen_text

4. code-dialogue(多轮对话)

  • 描述:开发者与助手之间的多轮对话。
  • 生成模型:gpt-oss-20b(高),第一轮对话复用了 code-dev 的数据。
  • 注意:同样包含占位符 {{{REPLACE_WITH_BLOB_ID_SOURCE}}},需手动替换。
  • 主要列blob_idcorpuslanguagedifficulty_user_1training_value_user_1has_reasoningtext_with_placeholderslen_text

5. code-trace(代码执行轨迹)

  • 描述:包含插桩代码和标准输出的代码执行轨迹。
  • 来源stack_edu 和 DeepMind code_contests
  • 生成流程:插桩数据和测试脚本由 gpt-oss-20b(高)生成,轨迹通过沙箱执行生成。
  • 主要列blob_idcorpuslanguageinstrumented_filename(插桩代码文件名)、external_packages(所需外部包)、stdout(执行标准输出)、compression_ratio_of_trace(轨迹压缩比)、textlen_text

6. dev-eval(开发者评估集)

  • 描述:用于 code-dev 的评估集,包含 Claude 响应以供比较评分。
  • 提示生成:gpt-oss-20b(高)。
  • 主要列id(唯一标识符)、blob_idlanguagecategories(任务类别)、skill(评估技能)、prompt(输入提示)、response-claude-sonnet-4-5-20250929(Claude Sonnet 4.5 的响应,最多 5 万 Thinking Token)。

7. trace-eval(轨迹评估集)

  • 描述:用于 code-trace 的评估集,包含 Claude 响应和自动指标,用于比较评分。
  • 生成流程:同 code-trace。
  • 主要列idblob_idlanguageinstrumented_filenameexternal_packagesexecute_stdout(真实执行标准输出)、promptcompletion(真实完成内容)、compression_ratio_completion(完成内容的压缩比)、has_unpredictable(是否有不可预测元素)、has_computational_challenges(是否有计算挑战)、has_trace_issues(是否有已知轨迹问题)、prediction_claude_4.5_thinking_off(Claude 4.5 关闭思考的预测)、exact_match_claude_4.5_thinking_off(行精确匹配分数)、rouge_2_claude_4.5_thinking_off(行 ROUGE-2 分数)。

使用方式

python from datasets import load_dataset

加载特定子集

ds = load_dataset("open-alchemy/code-alchemy", name="code-enhance", split="train", streaming=True)

加载评估集

eval_ds = load_dataset("open-alchemy/code-alchemy", name="dev-eval", split="test")


引用与许可

  • 论文arXiv 2606.10087
  • 许可:参见 NOTICE 文件。IBM 不主张其知识产权,但数据集按“原样”提供,无任何明示或暗示的保证。
搜集汇总
数据集介绍
code-alchemy 数据集图片
构建方式
CodeAlchemy是一个大规模合成代码数据集,旨在用于代码语言模型的训练与评估。其构建过程依托于多个公开源代码语料库,包括Stack Edu、RefineCode、The Stack v2以及DeepMind的Code Contests,并借助IBM的gpt-oss系列模型进行生成。数据集的五个训练子集覆盖了代码改写、问答、开发者任务、多轮对话与执行轨迹追踪等场景。为避免版权问题,原始源代码文件未直接包含,而是通过占位符或blob_id索引的方式保留可重构路径。所有数据以Parquet格式存储,采用zstd压缩,整体规模约9766亿词元,共计1.62亿条记录。
特点
该数据集最显著的特征在于其多维度、分层级的任务设计与合成质量保障。每个子集都针对特定下游任务进行了精细构造:code-enhance包含语法错误标注与质量评分,code-qa具备推理标记(has_reasoning),code-dev与code-dialogue则引入了难度与训练价值评分。code-trace子集更创新性地包含沙盒执行生成的完整运行轨迹。评估子集dev-eval与trace-eval则提供了Claude模型的对比响应与自动评分指标,支持模型输出的多角度评价。这种设计使数据集既可用于预训练,亦适用于指令微调与推理能力评估。
使用方法
使用者可通过HuggingFace Datasets库便捷加载各子集。以流式方式加载训练子集可有效管理内存占用,例如使用load_dataset('open-alchemy/code-alchemy', name='code-enhance', split='train', streaming=True)。对于包含占位符的子集(code-dev与code-dialogue),用户需手动从Software Heritage的S3存储桶中获取原始源代码并替换占位符,示例代码已提供完整的S3获取流程。评估集则直接包含完整提示与参考答案,便于直接进行模型性能评估。数据集通过57种编程语言的广泛覆盖,支持跨语言代码理解任务的实验设计。
背景与挑战
背景概述
CodeAlchemy是由IBM研究院的Gupta、Prasad、Panda等人于2026年发布的合成代码数据集,总量约976.6B tokens、1.62亿行,旨在为代码语言模型的训练与评估提供高质量、多样化的数据资源。随着大语言模型在代码生成、理解与调试等任务中的广泛应用,现有真实代码数据集面临版权受限、噪声大、任务覆盖不足等问题。CodeAlchemy通过五项任务子集(代码改写、问答、开发者任务、多轮对话、执行轨迹)和两项评估集,系统性地探索了合成数据在代码智能领域的能力边界,成为连接大规模无标注代码与精细化模型训练需求的重要桥梁,推动了代码语言模型从信息检索式处理向深度推理与执行理解的演进。
当前挑战
CodeAlchemy所应对的领域核心挑战在于:真实代码数据虽丰富,却难以同步满足版权合规、语法正确性、任务多样性及推理深度等多维需求。传统数据集如The Stack虽规模庞大,但包含大量低质量或带语法错误的代码,且缺乏面向推理链与多轮交互的标注。在构建过程中,研究团队面临多重技术难关:一是数据所有权限制,迫使对seed source进行占位符替换,需用户自行从Software Heritage等外部源获取;二是合成流程的复杂性,从gpt-oss-20b/120b模型生成改写、问答与对话,到沙盒执行获得执行轨迹,每一阶段均需精细化控制生成质量;三是海量数据(873GB、872个shard)的存储与高效流式加载,以及eval集中使用闭源模型(如Claude Sonnet)进行评分比较所引入的评估一致性难题。
常用场景
经典使用场景
CodeAlchemy数据集最为经典的应用场景在于为代码语言模型的预训练与指令微调提供大规模、高质量的合成数据。该数据集囊括了代码增强、代码问答、开发者任务、多轮对话及代码执行轨迹等五个训练子集,总计约9766亿词元的庞大体量,覆盖了从代码重写、调试到推理与多步交互的多样化任务形式。研究者通常利用其结构化的用户-助手提示格式与嵌入推理过程的思考链数据,对基础模型进行全参数微调或参数高效微调,从而系统性地提升模型在代码理解、生成与修复等核心能力上的表现。该数据集特别适合用于训练需要深度代码推理能力的语言模型,是代码智能领域预训练与下游任务适配的重要资源。
衍生相关工作
CodeAlchemy的发布已催生了一系列富有影响力的衍生研究工作。围绕其五个训练子集,研究者们分别探索了合成数据增强对模型代码学习效果的边际贡献,例如深入分析了代码重写质量与下游任务准确率之间的关联,揭示了不同推理难度层级的训练数据对大模型逻辑推理能力培养的差异化影响。基于该数据集中的代码执行轨迹,有工作提出了结合符号执行与神经模型的混合方法,用于提升模型对程序运行时状态的预测精度。此外,利用其多轮对话结构,衍生出了面向代码场景的对话策略学习与长上下文建模的研究课题,这些工作共同深化了我们对合成数据在大规模代码语言模型训练中角色与局限性的认知,也为后续更高效的数据合成策略和更鲁棒的代码智能模型设计奠定了理论和实验基础。
数据集最近研究
最新研究方向
随着大语言模型在代码生成与理解领域取得突破性进展,CodeAlchemy数据集应运而生,它通过大规模合成数据策略,为代码语言模型的训练与评估提供了前所未有的资源支撑。当前前沿研究聚焦于利用该数据集所涵盖的代码增强、问答、开发者任务、多轮对话及执行轨迹等五个训练子集,推动模型在代码质量提升、复杂推理链路建模、上下文感知交互及动态执行预测等方向的发展。该数据集超976B词元的庞大规模与结构化设计,使其成为探索可扩展合成数据生成范式、突破真实代码数据稀缺瓶颈的关键工具,其影响力不仅体现在促进代码智能体的能力跃迁上,更标志着从依赖人工标注向大规模自动化数据工程的重要转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务