遇见数据集

locus-pretrain-documents-public

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是 Locus 预训练项目的文档公共配置仓库,目前仅包含设置,尚未发布实际语料库。数据格式为经过分词处理的索引 token 工件,采用小端序 int32 二进制数组,包含完整文档或未填充段的偏移量,以及损失掩码、Parquet 索引和元数据。需要特定的 Locus 索引 token 读取器才能使用。数据集仅通过不可变提交的完整清单表示发布版本。此仓库为公共可见,但未分配通用许可证。

This dataset is the public configuration repository for the Locus pre-training project, currently containing only the setup and not yet releasing the actual corpus. The data format consists of tokenized index artifacts, using little-endian int32 binary arrays, containing offsets of complete documents or unfilled segments, along with loss masks, Parquet indexes, and metadata. A specific Locus index token reader is required to use it. The dataset is represented only by the complete manifest of immutable commits for release versions. This repository is publicly visible but does not have a general license assigned.

创建时间:
2026-09-05
原始信息汇总

Locus 预训练数据集(文档公开版)

数据集概述

  • 语言:英语(en)
  • 标签:预训练(pretraining)、分词处理(tokenized)
  • 可见性:公开
  • 当前状态:仅提供设置说明,尚未发布正式语料库,也未对当前格式运行过金丝雀检测流程

数据集内容与格式

  • 本仓库将存放带版本控制的索引化分词产物(versioned indexed token artifacts)
  • 分词数据以小端序 int32 二进制数组形式存储
  • 使用有符号 int64 偏移量标识完整文档或未填充片段
  • 损失掩码采用位打包(bit-packed)格式,并配有 Parquet 索引来源辅助文件(provenance sidecars)
  • 训练数据打包通过 RSDB 系统完成

使用说明与限制

  • 该数据集采用自定义的 Locus 索引化分词读取格式,并非可直接自动加载的文本数据集
  • 仅在固定到不可变提交(immutable commit)的完整、已验证清单(manifest)才构成一次正式发布
  • 实际发布时将附带来源归属及适用的使用条款;本设置卡片不授予任何 blanket 许可证

架构说明

  • 公开与私有产物分别存储于独立的物理分片
搜集汇总
数据集介绍
locus-pretrain-documents-public 数据集图片
构建方式
该数据集以预训练语料库为蓝本,采用定制化索引令牌(indexed token)格式构建,将文本转化为小端序int32二进制数组,并以符号int64偏移量标识完整文档或未填充片段。损失掩码采用位打包机制,辅以Parquet格式的索引和来源旁车文件(provenance sidecars)组织元数据。训练数据通过RSDB策略进行打包,形成可供预训练模型直接高效调用的结构化语料。整个构建过程强调版本管理与可验证性,仅将绑定于不可变提交的完整且经核验的清单视为正式发布版本,确保了数据集的严谨性与可追溯性。
特点
该数据集在结构与存储格式上展现出鲜明的特质。其采用非标准的索引令牌数据形态,非纯文本可加载数据集,需依赖专属的Locus索引令牌读取器方能解析,体现了高度定制化的设计取向。二进制数组与位打包掩码的应用显著提升了存储紧凑性与读取效率,适用于大规模预训练任务。此外,数据集遵循公共与私有工件物理分离的分片原则,兼顾了可见性与安全性。尤为重要的是,其未附随统一的许可协议,来源归属与适用条款将随实际发布明确,这赋予了数据集在合规使用上的灵活性与审慎性。
使用方法
鉴于其特有的索引令牌格式,该数据集不可直接通过常规文本加载工具应用。有效使用方式需借助配套的Locus索引令牌读取器,该组件能够解析二进制数组、偏移量与位打包掩码,进而将数据还原为模型可读取的序列。用户需依据版本化清单定向获取索引、掩码及来源文件,遵循RSDB打包策略组织到的训练批次。由于仅有官方核验并固定于不可变提交的清单才构成完整发布,用户操作时应当校验所引用版本的完整性与授权状态,以确保合法合规地将其运用于预训练流程之中。
背景与挑战
背景概述
随着大规模语言模型预训练对数据规模与质量的要求日益提升,高效的数据组织与索引成为研究前沿。该数据集由Locus项目团队创建,旨在为预训练提供结构化的文档索引与分块方案,其核心研究问题在于如何通过精细的标记化与索引机制优化训练数据的可访问性与利用效率。该工作以其对数据格式的严格定义与版本管理理念,在预设数据管理领域具有方法论上的影响力,为后续研究树立了实践范例。
当前挑战
该数据集面临的挑战集中于两方面:一是领域层面的数据可用性问题,即其定义了一种高度定制化的索引与分块格式,要求使用特定读取器,降低了跨研究的通用性与可复现性;二是构建过程中的工程挑战,包括如何确保不同来源数据的溯源可信、维持索引的版本一致性,以及在不泄露信息的前提下管理公私混合的物理分片,这些都要求在数据工程与隐私保护间取得精细平衡。
常用场景
经典使用场景
该数据集专为大规模语言模型预训练阶段设计,其核心形式为索引化的token序列,并辅以位压缩的损失掩码与Parquet索引。经典使用场景集中于构建定制化的预训练流水线,研究者需借助Locus索引化token阅读器来高效解析文档边界、完成无填充的分片打包,从而在分布式训练环境中实现数据吞吐优化与存储资源的最小化占用。
解决学术问题
该数据集解决了学术研究中关于预训练语料可复现性与高效访问的难题,特别是在大型语料库的版本管理、文档归属追踪及数据溯源方面。其不直接提供明文语料,而是通过锚定不可变提交的完整清单,保障了数据完整性与来源可审计性,推动了预训练数据流程标准化与可信人工智能的发展。
衍生相关工作
该数据集启发了对索引化token流与动态打包策略的研究,衍生出如基于RSDB的高效数据加载器、损失掩码自适应算法及文档级去重工具链。这些工作进一步探索了位级编码与稀疏存储在降低预训练成本中的潜力,并促进了数据版本控制与模型训练生命周期管理的集成框架发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务