遇见数据集

Qwen3-0.6B-GRPO-GSPO-RLVR-Data

收藏
魔搭社区2026-08-16 更新2026-08-16 收录
官方服务:

资源简介:

# 数据集卡:Qwen3 RLVR math + code 统一集 ## 来源与处理 上游是国内 ModelScope 数据集快照 `Cocolime/GRPO-GSPO-rl-data-clean@master`,服务器下载日志记录日期为 2026-08-10。本交付没有重新抓取国外数据;它从该快照选择训练/测试 math 与 code 文件,统一为任务指定的目录,再生成等价 verl Parquet 和每文件前 8 条 smoke 子集。 这是一个“重新编排和校验”的衍生数据集,不声称拥有上游样本版权。使用者应分别核对上游及各原始子数据集的许可证、题目平台条款与发布限制;尤其 Codeforces/LiveCodeBench 类型题目不得据此推定为可任意商业再分发。 ## 规模 | split | ability | 文件 | 行数 | |---|---:|---:|---:| | train | code | 2 | 33,707 | | train | math | 3 | 36,380 | | test | code | 2 | 709 | | test | math | 5 | 2,957 | | **总计** | | **12** | **73,753** | 文件明细: | 路径 | 行数 | |---|---:| | `train/code/codeforces.jsonl` | 8,733 | | `train/code/deepcoder_24k.jsonl` | 24,974 | | `train/math/dapo_math_17k.jsonl` | 17,398 | | `train/math/gsm8k.jsonl` | 7,473 | | `train/math/math12k.jsonl` | 11,509 | | `test/code/codeforces.jsonl` | 448 | | `test/code/lcb_lite.jsonl` | 261 | | `test/math/aime24.jsonl` | 30 | | `test/math/aime25.jsonl` | 30 | | `test/math/cmath.jsonl` | 1,098 | | `test/math/gsm8k.jsonl` | 1,319 | | `test/math/math500.jsonl` | 480 | 精确字节数和逐文件 SHA-256 在 `data/manifest.json`。用户说明原测试集只有 math;本次国内快照中另有 Codeforces 448 条与 LCB Lite 261 条,因此将这 709 条整理为 `test/code/`,没有伪造 code 测试题。 ## Schema 每行是 UTF-8 JSON: ```json { "data_source": "gsm8k", "prompt": [{"role": "user", "content": "..."}], "ability": "math", "reward_model": {"style": "rule", "ground_truth": "42"}, "extra_info": {} } ``` - `ability`: `math` 或 `code`。 - `reward_model.ground_truth`: math 为答案字符串;code 通常为序列化 judge JSON,包含题型、测试点、时限与内存限制。 - `prompt`: verl 消息列表。 - `extra_info`: 上游附加元数据,内容随子集变化。 JSONL 是审阅/交换格式,`data/verl/` 是训练格式;两者行内容相同。`data/verl/smoke/` 只适合快速连通测试,不能用于统计结论。 ## 数据质量与风险 - 转换时逐行解析 JSON,拒绝空文件,记录行数与 SHA-256。 - 未执行去重、污染检测或许可证重标注;不能假设 train/test 与公开基准完全无交叉。 - 编程题 ground truth 带隐藏测试,必须使用隔离 reward;不应把 judge payload 拼进模型 prompt。 - 数学答案可能有多个等价表达,使用符号验证而非纯字符串比较。 - 数据可能包含偏差、不完整陈述或不安全代码,只应用于研究和受控评测。

提供机构:
maas
创建时间:
2026-08-12
二维码
社区交流群
二维码
科研交流群
商业服务