CoderForge-Preview-v3-10000
收藏资源简介:
laion/CoderForge-Preview-v3-10000是一个从togethercomputer/CoderForge-Preview数据集的trajectories-tokenized_qwencoder子集中抽取的10,000行预标记数据子集。该数据集专为Qwen3模型设计,包含input_ids、attention_mask、labels等多个字段,适用于文本生成任务。数据来源于四个不同的源(R2E_Gym, SWE_Rebench, SWE_Smith, filtered_reward1),并通过确定性采样(种子=42)生成。数据集格式为原生预标记,可直接用于axolotl训练框架,支持长序列处理(序列长度可达32768 tokens)。
laion/CoderForge-Preview-v3-10000 is a subset of 10,000 pre-tokenized rows extracted from the trajectories-tokenized_qwencoder subset of the togethercomputer/CoderForge-Preview dataset. This dataset is specifically designed for the Qwen3 model and includes multiple fields such as input_ids, attention_mask, labels, etc., making it suitable for text generation tasks. The data comes from four different sources (R2E_Gym, SWE_Rebench, SWE_Smith, filtered_reward1) and is generated through deterministic sampling (seed=42). The dataset is in native pre-tokenized format and can be directly used with the axolotl training framework, supporting long sequence processing (sequence length up to 32768 tokens).
数据集概述:laion/CoderForge-Preview-v3-10000
基本信息
- 许可证:Apache-2.0
- 任务类别:文本生成(text-generation)
- 标签:sft、agent、swe-bench、axolotl、pretokenized
数据集来源
该数据集是 togethercomputer/CoderForge-Preview 中 trajectories-tokenized_qwencoder 子集的行子集,原始数据集包含 4 个来源块(slug)共 155,144 行数据。
数据规模
- 总行数:10,000 行
- 采样方式:确定性采样,种子为 42,从 4 个来源块(R2E_Gym、SWE_Rebench、SWE_Smith、filtered_reward1)的连接结果中抽取
数据格式
数据为 Qwen3 的原生预标记化(pre-tokenized)格式(tokenizer 与 Qwen2.5-Coder / Qwen3-Coder / Qwen3-8B 共享)。每行包含以下列:
| 列名 | 数据类型 | 说明 |
|---|---|---|
input_ids |
list[int32] | 输入 token ID 序列 |
attention_mask |
list[int8] | 注意力掩码(全部为 1,由本子集添加以触发 axolotl 的预标记化数据集自动检测) |
labels |
list[int64] | 标签序列(已应用 -100 掩码) |
chat_template_applied |
str | 解码后的对话渲染(用于调试) |
trajectory_id |
str | 轨迹 ID |
reward |
float64 | 奖励值 |
source |
str | 固定为 "togethercomputer/CoderForge-Preview/trajectories-tokenized_qwencoder" |
使用方式(Axolotl)
yaml datasets:
- path: laion/CoderForge-Preview-v3-10000 chat_template: chatml sequence_len: 32768 # 上游数据序列长度可能超过 80k token;axolotl 会进行截断
Axolotl 会自动检测预标记化列并跳过聊天模板渲染器。




