遇见数据集

nanoJEPA-base

收藏
Hugging Face2026-05-22 更新2026-05-23 收录
官方服务:

资源简介:

nanoJEPA EN/ZH Ultra-FineWeb 数据集是一个专为 nanoJEPA 模型设计的小规模预训练数据集。它通过流式处理 openbmb/Ultra-FineWeb 数据集中的英文(en)和中文(zh)分片构建而成,旨在为语言模型的预训练提供高质量的双语文本资源。数据集包含三个标准分割:训练集(train)、验证集(valid)和测试集(test),每个分割均以 JSONL 格式存储,每条记录包含文本内容(text)、数据来源(source)、原始数据集名称(dataset)、语言标识(language,取值为 en 或 zh)以及质量评分(score)等字段。数据规模方面,训练集包含 960,000 条样本(英文和中文各 480,000 条),验证集包含 60,000 条样本(中英文各 30,000 条),测试集包含 180,000 条样本(中英文各 90,000 条)。该数据集适用于文本生成任务的预训练,特别是需要中英文双语能力的语言模型开发。数据集的构建过程通过指定脚本完成,支持自定义语言选择、各语言最大样本数以及训练/验证/测试集的比例划分。

The nanoJEPA EN/ZH Ultra-FineWeb dataset is a small-scale pre-training dataset specifically designed for the nanoJEPA model. It is constructed by streaming the English (en) and Chinese (zh) shards from the openbmb/Ultra-FineWeb dataset, aiming to provide high-quality bilingual text resources for language model pre-training. The dataset includes three standard splits: training set (train), validation set (valid), and test set (test), each stored in JSONL format. Each record contains fields such as text content (text), data source (source), original dataset name (dataset), language identifier (language, with values en or zh), and quality score (score). In terms of data scale, the training set contains 960,000 samples (480,000 each for English and Chinese), the validation set contains 60,000 samples (30,000 each for English and Chinese), and the test set contains 180,000 samples (90,000 each for English and Chinese). This dataset is suitable for pre-training in text generation tasks, particularly for developing language models with bilingual capabilities in English and Chinese. The construction process is completed through specified scripts, supporting custom language selection, maximum sample counts per language, and the proportional division of training/validation/test sets.

创建时间:
2026-05-20
原始信息汇总

nanoJEPA EN/ZH Ultra-FineWeb 数据集

数据集概述

本数据集是专为 nanoJEPA 模型设计的轻量级预训练数据集,基于 openbmb/Ultra-FineWeb 数据集构建,包含英文(en)和中文(zh)两种语言。

数据集信息

  • 许可证:Apache-2.0
  • 任务类别:文本生成
  • 语言:英语、中文
  • 数据集名称:nanoJEPA EN/ZH Ultra-FineWeb Dataset

文件结构

数据集包含三个 JSONL 格式文件,每个文件的 schema 如下:

  • train.jsonl:训练集
  • valid.jsonl:验证集
  • test.jsonl:测试集

每条记录包含字段:text(文本内容)、source(来源)、dataset(数据集名称)、language(语言,en 或 zh)、score(分数,默认为 0.0)

数据统计

数据子集 总行数 英文行数 中文行数 扫描行数
train 960,000 480,000 480,000 984,987
valid 60,000 30,000 30,000 61,790
test 180,000 90,000 90,000 185,045
  • 数据集总量:1,200,000 行
  • 数据源openbmb/Ultra-FineWeb(配置:default)
  • 随机种子:42

数据划分比例

  • 训练集:80%
  • 验证集:5%
  • 测试集:15%
搜集汇总
数据集介绍
nanoJEPA-base 数据集图片
构建方式
nanoJEPA-base数据集是从开源高质量语料库`openbmb/Ultra-FineWeb`中,通过流式处理抽取英文与中文子集构建而成。构建过程借助自定义脚本,分别设定英语和中文数据上限各60万条,并按照0.8、0.05、0.15的比例划分为训练集、验证集与测试集,最终生成结构统一的JSONL文件,每条记录包含文本内容、来源、数据集名称、语言标识及质量评分字段。
特点
该数据集专为nanoJEPA预训练任务设计,兼具双语与轻量级特性。其英文与中文部分均保持精确的60万条训练样本规模,总训练条目达96万,同时验证集与测试集也严格对称分布,便于进行跨语言评估。数据源自经过筛选的Ultra-FineWeb,每条记录附带质量评分,有助于研究者灵活过滤低质内容,整体设计兼顾了多样性与可控性。
使用方法
使用时可直接加载本仓库中的`train.jsonl`、`valid.jsonl`与`test.jsonl`文件,每条数据为字典格式,包含`text`、`source`、`dataset`、`language`及`score`字段。开发者可根据`language`字段按需选择英文或中文子集,亦可依据`score`阈值剔除低分样本。该结构兼容主流深度学习框架的数据加载方式,适合直接用于文本生成任务的模型训练与评估。
背景与挑战
背景概述
nanoJEPA-base数据集由研究团队于近期构建,旨在为轻量级自监督学习模型nanoJEPA提供预训练语料。该数据集从OpenBMB发布的Ultra-FineWeb中流式采样英文与中文高质量文本片段,分别采集60万条样本,最终形成包含120万条训练数据、6万条验证数据和18万条测试数据的多语料库。其核心研究问题在于探索如何在不依赖大规模人工标注的前提下,利用精炼的网络文本驱动小型化自主表征学习模型高效训练。通过融合双语内容并严格按比例拆分,该数据集为验证JEPA范式在资源受限场景下的有效性提供了标准化评估基准,对推动轻量化自监督学习的发展具有重要意义。
当前挑战
nanoJEPA数据集面临的核心领域挑战在于如何从海量、嘈杂的网络文本中有效抽取语义连贯且覆盖双语知识的训练样本,以支撑自监督预测编码模型的表征学习。构建过程中,团队需要解决流式采样时的数据去重与质量筛选难题,例如需避免双语样本间的冗余以及低质量噪声文本的混入。同时,为适应nanoJEPA的轻量化架构,数据集必须在控制总量的前提下维持中英文语料的平衡,并确保训练、验证与测试集的分割比例能真实反映模型的多语言泛化能力,这对采样策略的稳定性与高效性提出了较高要求。
常用场景
经典使用场景
在自监督学习与生成式预训练模型的研究浪潮中,nanoJEPA-base数据集为轻量级视觉自编码器(JEPA)的预训练提供了高质量的中英文双语文料。该数据集从Ultra-FineWeb中精心筛选并均衡采样了96万条英文和中文纯净文本,特别适用于训练那些需要在有限计算资源下快速迭代的小规模基础模型。其经典用法是将英文与中文数据等比例混合,使模型在预训练阶段同时接触两种语言的高质量网络文本,进而掌握跨语言的基础语义表征。这一设计让研究者能够聚焦于JEPA架构本身的预测目标设计,而非数据加载的复杂性,极大地简化了实验流程。
实际应用
在实际应用中,nanoJEPA-base数据集能够直接服务于工业界对高效、经济小模型的部署需求。例如,它可以作为旅游翻译、双语客服等轻量级自然语言处理应用的预训练语料,使模型在手机端或边缘设备上具备基础的双语理解能力。此外,该数据集的中英文平行特性也使其适用于跨语言索引、双语新闻摘要以及教育领域的自动问答系统。在内容审核和命名实体识别等需要快速微调的场景中,nanoJEPA-base提供的高质量文本有助于模型用较少标注数据达到可接受的性能,显著降低企业的训练成本和时间开销。
衍生相关工作
nanoJEPA-base数据集的出现推动了多项自监督学习基准研究的演化。它作为一个标准化的预训练资源,直接催生了针对JEPA架构的轻量化变体探索,例如引入对比学习目标的双语JEPA模型,以及结合知识蒸馏的微型Transformer预训练方案。一些后续研究基于该数据集对比了不同掩码策略和表示维度对下游任务(如图形分类、跨语言对齐)的影响,还衍生出针对多模态JEPA的视觉-语言预训练工作。这些工作不仅验证了高质量双语数据在小型模型上的适用性,还拓展了JEPA范式在资源受限场景下的应用边界,形成了从数据构建到模型优化的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务