遇见数据集

MemoryDecoder-at-Scale-domain-data

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

MemoryDecoder at Scale领域数据是一个用于大规模持续预训练(CPT)的数据集,专为MemoryDecoder at Scale项目设计。该数据集涵盖三个专业领域:生物学、法律和金融。每个领域包含原始文本数据(每行一个JSON对象,字段为text)、预处理后的tokenized数据集(使用Qwen3分词器)以及与预处理训练分割对齐的KNN分布。预处理数据以Hugging Face DatasetDict格式保存,包含训练和测试分割。数据统计如下:生物学领域有3,327,031条CPT记录,551,666,432个预处理训练token;法律领域有276,852条记录,124,632,808个token;金融领域有4,402,694条记录,4,413,570,760个token。KNN分布以NumPy数组形式存储,包括目标token ID、行偏移、稀疏token ID和概率。数据来源于Biology-Instructions、DISC-Law-SFT和FinTrain等上游数据集。该数据集可用于领域特定的持续预训练和基于k近邻的语言模型改进研究。

MemoryDecoder at Scale Domain Data is a dataset designed for large-scale continual pre-training (CPT) as part of the MemoryDecoder at Scale project. It covers three specialized domains: biology, law, and finance. Each domain includes raw text data (one JSON object per line with a text field), preprocessed tokenized datasets (using the Qwen3 tokenizer), and KNN distributions aligned with the preprocessed training splits. The preprocessed data is saved in Hugging Face DatasetDict format, containing training and test splits. Statistics: biology has 3,327,031 CPT records with 551,666,432 preprocessed training tokens; law has 276,852 records with 124,632,808 tokens; finance has 4,402,694 records with 4,413,570,760 tokens. The KNN distributions are stored as NumPy arrays, including target token IDs, row offsets, sparse token IDs, and probabilities. The data originates from upstream datasets such as Biology-Instructions, DISC-Law-SFT, and FinTrain. This dataset can be used for domain-specific continual pre-training and research on improving language models via k-nearest neighbors.

创建时间:
2026-07-30
原始信息汇总

数据集概述

数据集名称:MemoryDecoder at Scale Domain Data

数据集用途:为 MemoryDecoder at Scale 模型提供领域特定的继续预训练(CPT)数据,包括经过分词和预处理的数据集,以及对齐的 KNN 分布。

支持语言:英语(en)、中文(zh)

相关论文MemoryDecoder at Scale (arXiv:2607.27919)(链接为普通文本,未访问)


数据集内容

覆盖领域

  • 生物学(Biology)
  • 法律(Law)
  • 金融(Finance)

数据格式

  • 原始 CPT 数据:每个领域包含 train/train.jsonl 文件,每行一个 JSON 对象,格式为 {"text": "..."}
  • 预处理数据:每个示例包含 input_idsattention_masklabelsdstore_range 字段,以 Hugging Face DatasetDict 格式保存,可使用 datasets.load_from_disk 加载。
  • KNN 分布:每个 KNN 分片包含 label.npyoffset.npyflatten_token_id.npyflatten_prob.npyshape.json 文件;金融领域额外包含 flatten_config.json

数据对齐

预处理的训练数据与对应的 KNN 分布按 token 对齐:每个 KNN 行对应预处理训练集中的一个 datastore token。分词和词表基于 Qwen3 tokenizer。


数据统计

领域 CPT 记录数 预处理训练 token 数 / KNN 行数 Arrow 训练分片数 稀疏支持条目数 KNN 分片数
生物学 3,327,031 551,666,432 15 6,003,676,377 1
法律 276,852 124,632,808 4 3,753,053,591 1
金融 4,402,694 4,413,570,760 116 49,623,545,340 32

上游数据来源

各领域数据源自以下公开数据集,已转换为 MemoryDecoder at Scale 使用的 CPT 文本格式:

使用本数据集时,需审查并遵守相应上游数据集的条款和许可证。


许可证

该数据集使用 other(自定义)许可证,具体条款请参见数据集页面。

搜集汇总
数据集介绍
MemoryDecoder-at-Scale-domain-data 数据集图片
构建方式
该数据集专为MemoryDecoder at Scale模型的领域持续预训练而构建,涵盖生物学、法律与金融三大垂直领域。其构建流程严谨而系统:首先,从Biology-Instructions、DISC-Law-SFT及FinTrain等上游公开数据源采集原始语料,并转换为统一的CPT文本格式,每一行对应一条JSON记录。随后,借助Qwen3分词器对这些文本进行token化与预处理,生成包含input_ids、attention_mask、labels及dstore_range的标准化样本,并以Hugging Face DatasetDict格式存储,同时划分出训练集与测试集。尤为关键的是,该数据集构建了与预处理训练集token级对齐的KNN分布,每个KNN行精确对应一个数据存储token,通过稀疏格式高效编码目标token及其概率,为模型提供细粒度的记忆检索依据。
特点
此数据集的核心特色在于其规模宏大与结构精密。数据显示,其预处理训练token总量逾五十亿,其中金融领域独占四十四亿之巨,配备116个Arrow分片与32个KNN分片,稀疏支持条目近五百亿,充分彰显大规模特性。KNN分布采用稀疏存储,通过offset数组实现高效的行索引,兼顾存储效率与检索性能。此外,数据集实现了跨域统一处理,三个领域均遵循相同的预处理范式与token对齐规则,确保模型在不同专业领域间无缝迁移。其分片设计支持分布式加载,可弹性适应不同计算资源,为大规模持续预训练提供了坚实的数据基石。
使用方法
使用此数据集时,研究者可直接通过Hugging Face的datasets.load_from_disk加载预处理后的DatasetDict工件,复用其内置的train/test划分,免去重复的数据清洗与tokenization步骤。对于KNN分布,可依据官方提供的Python代码段,利用offset数组索引稀疏向量,恢复每个token的完整概率分布,进而集成至MemoryDecoder模型的训练或推理流程。该数据集特别适用于知识密集型领域的持续预训练实验,用户可针对单一领域或组合多领域进行模型微调。需注意,上游数据源具有各自的开源许可,使用时应遵循相应条款,并在学术成果中引用原始论文。
背景与挑战
背景概述
MemoryDecoder-at-Scale-domain-data数据集由Rubin Wei、Jiaqi Cao等研究者于2026年发布,服务于“MemoryDecoder at Scale”项目,旨在通过持续预训练增强大语言模型的参数化长期记忆能力。该数据集聚焦生物、法律和金融三大专业领域,整合了Biology-Instructions、DISC-Law-SFT和FinTrain等上游数据源,并利用Qwen3分词器进行预处理,生成与KNN分布对齐的令牌级训练数据。其核心研究问题在于如何为大规模语言模型提供领域特定的记忆增强信号,以提升其在专业知识密集任务中的表现。该数据集在继续预训练和基于KNN的记忆检索领域具有开创性意义,为后续研究提供了标准化的数据基础设施,推动了参数化记忆与大规模语言模型融合的发展。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题层面,生物、法律和金融文本具有高度专业性和术语复杂性,如何确保模型在持续预训练中保留领域知识而不遗忘通用能力,是核心难点。KNN分布与令牌的对齐要求精确,任何偏差都会影响记忆检索的准确性。在构建过程中,数据规模庞大(如金融领域预训练令牌超过44亿),处理与存储面临效率与资源瓶颈,稀疏支持条目数高达数十亿,需精心设计分片与索引策略。此外,多源数据集的格式转换和隐私合规(如法律数据)增加了清洗与整理的难度,上游数据集许可差异也要求严格的法律审查,确保数据使用的合法性与伦理性。
常用场景
经典使用场景
MemoryDecoder-at-Scale-domain-data数据集专为大规模语言模型的持续预训练(Continued Pretraining)设计,其经典使用场景聚焦于领域自适应预训练。研究人员可借此数据集,在生物学、法律和金融等专业领域上对基座模型进行二次预训练,以增强模型在特定领域的语义理解与生成能力。数据集提供了经过Qwen3分词器预处理的token序列、注意力掩码及标签,并配套了与训练数据逐token对齐的KNN分布,使得模型能够无缝集成非参数检索机制,实现参数化记忆与非参数化知识的深度融合。这一设计使得该数据集成为探索领域知识注入与长尾知识记忆的理想基准。
衍生相关工作
该数据集衍生了多项相关研究,首要的是基于MemoryDecoder架构的系列工作,其核心论文《Memory Decoder at Scale》展示了利用此数据所训练的模型在长文本记忆与领域任务上的显著提升。后续工作包括将其扩展至更多领域的通用持续预训练框架,以及探索KNN分布压缩与高效检索的轻量化方案。此外,研究者基于该数据集的稀疏概率分布设计了可解释记忆分析工具,用于剖析模型记忆的存取机制。这些衍生工作不仅深化了对参数化记忆的理解,也促进了检索增强语言模型在学术研究与工业应用中的融合发展。
数据集最近研究
最新研究方向
MemoryDecoder-at-Scale-domain-data数据集聚焦于大规模领域持续预训练(CPT)与KNN参数化长期记忆融合的前沿探索。其最新研究方向在于通过生物、法律、金融等多领域海量文本构建token级对齐的稀疏KNN分布,以强化模型的领域知识记忆与检索能力。该数据集与Qwen3分词体系深度耦合,并针对各领域发布了大规模预处理语料及分布式存储结构,显著推动了基于非参数记忆的大语言模型在专业场景中的可扩展性研究。结合arXiv论文所提出的预训练参数化长期记忆架构,该资源为跨领域持续学习、记忆增强生成及高效知识注入提供了坚实的数据底座,对缓解灾难性遗忘和提升领域任务精准度具有重要的实践意义与学术影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务