遇见数据集

prolong-64k-text

收藏
魔搭社区2026-05-26 更新2026-07-15 收录
官方服务:

资源简介:

# ProLong-64K Text (prolong-64k-text) [princeton-nlp/prolong-data-64K](https://huggingface.co/datasets/princeton-nlp/prolong-data-64K) 经 Llama-3 反 tokenize 后的纯文本版。将上游 MDS 格式(每 sample 固定 65,536 tokens,多文档 packed)按 `indices` 字段切回 **一行 = 一个原始独立文档** 的扁平形态,便于 tokenizer 切换、长度过滤、自定义 packing 等下游处理。 ## 数据规模 | 项目 | 值 | |---|---| | 行数(= 原始文档数) | ~20.3 M | | 子集数 | 10 | | 上游 Llama-3 tokens(实测) | ~25 B(不含 dclm-baseline) | | 存储 | parquet + zstd,每子集 64 shards,共 640 文件,~45.5 GB | ## Schema | 列名 | 类型 | 含义 | |---|---|---| | `text` | string | Llama-3 反 tokenize 后的文档文本(UTF-8) | | `domain` | string | 子集名(10 个取值) | | `src_partition` | string | 上游 partition ID(`proc00-64` … `proc63-64`) | | `src_sample_idx` | int32 | partition 内 sample 索引 | | `src_doc_idx` | int32 | packed sample 内文档索引 | | `n_tokens` | int32 | Llama-3 token 数(取自上游 `indices`,未重新 tokenize 验证) | ## 子集组成 | 子集 | 文档数 | 来源 | 形态 | |---|---|---|---| | book | 98,302 | SlimPajama Books | 长文档,≈1 doc/sample | | thestackv1_concat_by_repo | 98,302 | GitHub 整 repo 拼接 | 长文档,≈1 doc/sample | | textbooks | 3,755 | TextbookChapters | 长文档,≈1 doc/sample | | fineweb-edu | 6,517,820 | FineWeb-Edu | packed 多文档 | | fineweb-2023-50 | 8,955,062 | FineWeb 2023-50 | packed 多文档 | | arxiv | 75,302 | SlimPajama ArXiv | packed 多文档 | | stackexchange | 1,832,506 | SlimPajama StackExchange | packed 多文档 | | dolmawiki | 1,830,022 | Dolma Wikipedia | packed 多文档 | | openwebmath | 552,898 | OpenWebMath | packed 多文档 | | tuluv2 | 330,381 | Tulu-v2 短指令对话 | packed 多文档 | > ⚠️ **dclm-baseline 缺失**:上游实际有 11 个子集,其中 dclm-baseline(5.28M docs / ~25.8 GB)未包含在本仓库中。 ## 文档长度分布 采样方法:每子集随机抽 8/64 partition(seed=42),覆盖 ~2.6M 文档(12.5%)。长度为 Llama-3 token 数。 **三类分布形态:** | 形态 | 子集 | 特征 | |---|---|---| | 完全填满 64K | book, thestack | 100% == 65,536 tokens | | 基本填满 64K | textbooks | 95% ≥ 64K, mean = 63,845 | | 变长长尾 | arxiv (mean 14K), openwebmath (mean 2K) | p99 达 18K–64K | | 全短文档 | fineweb-edu, fineweb-2023-50, dolmawiki, stackexchange, tuluv2 | 99%+ < 8K | **全量估计:** 长文档(≥ 8K)仅占 ~1.5%,≥ 64K 约 20 万篇(~1.0%)。 <details> <summary>详细分位数表</summary> | 子集 | 抽样数 | mean | p50 | p95 | p99 | max | ≥8K | ≥32K | ≥64K | |---|---|---|---|---|---|---|---|---|---| | book | 12,288 | 65,536 | 65,536 | 65,536 | 65,536 | 65,536 | 100% | 100% | 100% | | thestackv1_concat_by_repo | 12,288 | 65,536 | 65,536 | 65,536 | 65,536 | 65,536 | 100% | 100% | 100% | | textbooks | 465 | 63,845 | 65,536 | 65,536 | 65,536 | 65,536 | 99.6% | 97.4% | 94.8% | | arxiv | 9,443 | 14,213 | 10,955 | 37,742 | 65,536 | 65,536 | 63.6% | 7.5% | 1.1% | | openwebmath | 67,970 | 1,976 | 771 | 7,560 | 18,539 | 65,536 | 4.4% | 0.4% | 0.1% | | fineweb-edu | 813,357 | 990 | 605 | 2,855 | 7,545 | 65,536 | 0.9% | 0.0% | 0.0% | | dolmawiki | 228,506 | 588 | 262 | 2,106 | 5,231 | 63,396 | 0.4% | 0.0% | 0.0% | | fineweb-2023-50 | 1,123,506 | 717 | 436 | 2,108 | 4,769 | 65,536 | 0.3% | 0.0% | 0.0% | | stackexchange | 225,402 | 595 | 422 | 1,593 | 3,164 | 23,393 | 0.1% | 0.0% | 0.0% | | tuluv2 | 40,856 | 849 | 413 | 3,192 | 3,513 | 6,924 | 0.0% | 0.0% | 0.0% | </details> ## 还原正确性 10 个已上传子集与 HF 原版做了字节级 round-trip 对照(HF MDS → Llama-3 decode → 逐字节比对),**零差异**。 > 注:tuluv2 早期审计曾误报 33.7% 文档丢失,后发现是 MDS parser bug(tuluv2 schema 比其他子集多一列 `mask`,header 偏移多 4 字节),修正后完全一致。 ## 加载方式 ```python # ModelScope SDK from modelscope.msdatasets import MsDataset ds = MsDataset.load("fenghonghao/prolong-64k-text", split="train", trust_remote_code=True) # 直接读 parquet import pyarrow.parquet as pq tbl = pq.read_table("data/book/train-00-of-64.parquet", columns=["text", "n_tokens"]) ``` 文件布局:`data/<subset>/train-XX-of-64.parquet`,64 shards × 10 subsets = 640 文件。 ## 派生数据集 | 数据集 | 说明 | |---|---| | [fenghonghao/prolong-64k-qwen3](https://modelscope.cn/datasets/fenghonghao/prolong-64k-qwen3) | + Qwen3 重 tokenize 的 `input_ids` 列 | | [fenghonghao/prolong-64k-qwen3-cut16k](https://modelscope.cn/datasets/fenghonghao/prolong-64k-qwen3-cut16k) | 长度过滤 + 随机裁剪到 [1024, 16384],适合 16K 训练 | ## 数据血缘 ``` princeton-nlp/prolong-data-64K (MDS, Llama-3 tokens, 11 subsets) ↓ 反 tokenize(按 indices 还原文档文本) fenghonghao/prolong-64k-text ← 本数据集(10 subsets, ~20.3M docs) ↓ Qwen3 tokenize fenghonghao/prolong-64k-qwen3 ↓ 长度过滤 + 16K 裁剪 fenghonghao/prolong-64k-qwen3-cut16k ``` ## 引用 ```bibtex @article{gao2024prolong, title = {How to Train Long-Context Language Models (Effectively)}, author = {Gao, Tianyu and Wettig, Alexander and Yen, Howard and Chen, Danqi}, journal = {arXiv:2410.02660}, year = {2024}, url = {https://arxiv.org/abs/2410.02660} } ``` ## License Apache 2.0。各子集源数据保留原 license 条款,详见 [ProLong dataset card](https://huggingface.co/datasets/princeton-nlp/prolong-data-64K)。

提供机构:
maas
创建时间:
2026-05-18
二维码
社区交流群
二维码
科研交流群
商业服务