code-alchemy
收藏资源简介:
CodeAlchemy是一个大规模合成代码数据集,专门用于训练和评估代码语言模型。该数据集包含约9766亿令牌(约162M行),磁盘大小约873 GB,采用Parquet格式并经过zstd压缩。数据集由5个训练子集和2个评估子集构成,涵盖了多种代码相关任务。训练子集包括:1) code-enhance:包含原始源代码的重写版本、语法错误标注和质量评分,数据来源于stack_edu、refinecode和the-stack-v2-train-smol-ids,使用gpt-oss-20b模型生成;2) code-qa:代码问答对,来源于stack_edu和DeepMind code_contests,主要使用gpt-oss-20b模型生成;3) code-dev:开发者任务,包含推理轨迹和完成内容,所有种子文件来源于stack_edu,使用gpt-oss-20b模型生成,但需要手动获取原始源代码替换占位符;4) code-dialogue:开发者与助手之间的多轮对话,使用gpt-oss-20b模型生成,同样需要手动获取原始源代码;5) code-trace:代码执行轨迹,包含插桩代码和标准输出,来源于stack_edu和DeepMind code_contests,使用gpt-oss-20b模型生成并通过沙箱执行生成轨迹。评估子集包括dev-eval(用于code-dev的评估,包含Claude响应用于比较评分)和trace-eval(用于code-trace的评估,包含Claude响应和自动指标)。数据集的主要列是`text`,包含完全格式化的提示-完成对或多轮对话,用于预训练。由于所有权考虑,原始源文件未包含在数据集中,需要按照说明手动获取。该数据集适用于代码生成、问答、对话和代码追踪等任务。
CodeAlchemy is a large-scale synthetic code dataset specifically designed for training and evaluating code language models. The dataset contains approximately 976.6 billion tokens (about 162 million lines), with a disk size of about 873 GB, stored in Parquet format and compressed with zstd. It consists of 5 training subsets and 2 evaluation subsets, covering various code-related tasks. The training subsets include: 1) code-enhance: contains rewritten versions of original source code, syntax error annotations, and quality scores, sourced from stack_edu, refinecode, and the-stack-v2-train-smol-ids, generated using the gpt-oss-20b model; 2) code-qa: code question-answer pairs, sourced from stack_edu and DeepMind code_contests, primarily generated using the gpt-oss-20b model; 3) code-dev: developer tasks, including reasoning traces and completion content, with all seed files from stack_edu, generated using the gpt-oss-20b model, but requiring manual retrieval of original source code to replace placeholders; 4) code-dialogue: multi-turn dialogues between developers and assistants, generated using the gpt-oss-20b model, also requiring manual retrieval of original source code; 5) code-trace: code execution traces, including instrumented code and standard output, sourced from stack_edu and DeepMind code_contests, generated using the gpt-oss-20b model and executed in a sandbox to produce traces. The evaluation subsets include dev-eval (for evaluating code-dev, containing Claude responses for comparative scoring) and trace-eval (for evaluating code-trace, containing Claude responses and automatic metrics). The main column of the dataset is `text`, which contains fully formatted prompt-completion pairs or multi-turn dialogues for pre-training. Due to ownership considerations, original source files are not included in the dataset and must be manually retrieved as per instructions. The dataset is suitable for tasks such as code generation, question answering, dialogue, and code tracing.
数据集概述
CodeAlchemy 是一个由 IBM 研究团队创建的合成代码数据集,旨在用于训练和评估代码语言模型。它包含约 9766 亿 Token,约 1.62 亿行数据,分布在 7 个子集中。
数据集规模与统计
| 配置名称 | 分割 | 行数 | Token 数(估计) | 分片数 | 大小 |
|---|---|---|---|---|---|
| code-enhance | train | 45,787,739 | 1245 亿 | 116 | 114 GB |
| code-qa | train | 22,217,884 | 313 亿 | 31 | 30 GB |
| code-dev | train | 62,187,373 | 2698 亿 | 252 | 248 GB |
| code-dialogue | train | 30,908,028 | 5447 亿 | 467 | 478 GB |
| code-trace | train | 1,313,480 | 63 亿 | 4 | 3.9 GB |
| dev-eval | test | 1,488 | — | 1 | 12 MB |
| trace-eval | test | 1,050 | — | 1 | 5.2 MB |
| 总计 | 162,417,042 | ~9766 亿 | 872 | ~873 GB |
所有文件均为 Parquet 格式,采用 zstd 压缩。
主要字段
- text:预训练的主要列,包含格式化的提示-回答对或多轮对话,格式为 `User: <prompt>
Assistant: <response>。对于 has_reasoning为True的行,回答中包含<think>...</think>` 反思块。
- len_text:
text字段的字符长度,用于估算 Token 数(len_text / 4)。
子集说明
1. code-enhance(代码增强)
- 描述:对原始代码文件的改写版本、语法错误注释及质量评分。
- 来源:
stack_edu、refinecode、the-stack-v2-train-smol-ids。 - 生成模型:gpt-oss-20b(推理努力程度:中等)。
- 主要列:
blob_id(文件标识符)、language(编程语言)、corpus(源语料库)、raw_has_syntax_error_tree_sitter(原始代码是否有语法错误)、raw_quality_score(原始代码质量评分)、text(改写后的代码)、text_has_syntax_error_tree_sitter(改写代码是否有语法错误)、len_text(字符长度)。
2. code-qa(代码问答)
- 描述:代码问答对。
- 来源:
stack_edu和 DeepMindcode_contests。 - 生成模型:gpt-oss-20b(高),竞赛部分使用 gpt-oss-120b(高)。
- 主要列:
blob_id、corpus、style(问答风格/格式)、language、has_reasoning(是否包含推理)、text、len_text。
3. code-dev(开发者任务)
- 描述:包含推理轨迹和完成的开发者任务。
- 来源:所有种子文件来自
stack_edu。 - 生成模型:gpt-oss-20b(中等)。
- 注意:
text_with_placeholders列包含占位符{{{REPLACE_WITH_BLOB_ID_SOURCE}}},需要替换为对应blob_id的种子源代码(因所有权问题未包含)。 - 主要列:
blob_id、language、corpus、difficulty_user_1(任务难度)、training_value_user_1(训练信号价值)、validity_user_1(有效性评分)、text_with_placeholders、len_text。
4. code-dialogue(多轮对话)
- 描述:开发者与助手之间的多轮对话。
- 生成模型:gpt-oss-20b(高),第一轮对话复用了 code-dev 的数据。
- 注意:同样包含占位符
{{{REPLACE_WITH_BLOB_ID_SOURCE}}},需手动替换。 - 主要列:
blob_id、corpus、language、difficulty_user_1、training_value_user_1、has_reasoning、text_with_placeholders、len_text。
5. code-trace(代码执行轨迹)
- 描述:包含插桩代码和标准输出的代码执行轨迹。
- 来源:
stack_edu和 DeepMindcode_contests。 - 生成流程:插桩数据和测试脚本由 gpt-oss-20b(高)生成,轨迹通过沙箱执行生成。
- 主要列:
blob_id、corpus、language、instrumented_filename(插桩代码文件名)、external_packages(所需外部包)、stdout(执行标准输出)、compression_ratio_of_trace(轨迹压缩比)、text、len_text。
6. dev-eval(开发者评估集)
- 描述:用于 code-dev 的评估集,包含 Claude 响应以供比较评分。
- 提示生成:gpt-oss-20b(高)。
- 主要列:
id(唯一标识符)、blob_id、language、categories(任务类别)、skill(评估技能)、prompt(输入提示)、response-claude-sonnet-4-5-20250929(Claude Sonnet 4.5 的响应,最多 5 万 Thinking Token)。
7. trace-eval(轨迹评估集)
- 描述:用于 code-trace 的评估集,包含 Claude 响应和自动指标,用于比较评分。
- 生成流程:同 code-trace。
- 主要列:
id、blob_id、language、instrumented_filename、external_packages、execute_stdout(真实执行标准输出)、prompt、completion(真实完成内容)、compression_ratio_completion(完成内容的压缩比)、has_unpredictable(是否有不可预测元素)、has_computational_challenges(是否有计算挑战)、has_trace_issues(是否有已知轨迹问题)、prediction_claude_4.5_thinking_off(Claude 4.5 关闭思考的预测)、exact_match_claude_4.5_thinking_off(行精确匹配分数)、rouge_2_claude_4.5_thinking_off(行 ROUGE-2 分数)。
使用方式
python from datasets import load_dataset
加载特定子集
ds = load_dataset("open-alchemy/code-alchemy", name="code-enhance", split="train", streaming=True)
加载评估集
eval_ds = load_dataset("open-alchemy/code-alchemy", name="dev-eval", split="test")
引用与许可
- 论文:arXiv 2606.10087
- 许可:参见 NOTICE 文件。IBM 不主张其知识产权,但数据集按“原样”提供,无任何明示或暗示的保证。




