遇见数据集

KletterMix

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

KletterMix是一个大规模德语文本数据集,以分片JSONL文件格式发布。该完整版本结合了去重后的KletterMix数据与其余已评分的示例,取代了先前较小的`KletterMix-12B`审查子集。数据集包含553,315,017个样本,总计约7250亿个GPT-2 token,逻辑大小约为1.9 TB,存储于125个分片文件中。每个数据行包含以下字段:`id`(稳定的源派生行标识符)、`cluster_id`(整数聚类分配)、`text`(德语文本内容)、`token_count`(文本的GPT-2 token计数)和`proxy_score`(质量或相关性的标量代理分数)。该数据集旨在用于德语文本的预训练和持续预训练实验、数据集检查和过滤研究、聚类结构和分数分布分析,以及利用token计数或代理分数进行采样和课程设计的实验。数据集仅包含文本数据,采用分片JSONL格式以实现流式友好访问,并保留了`id`列。`token_count`值来自单独计算的元数据传递,`proxy_score`值为标量代理质量或相关分数。原始上游数据源为`nvidia/Nemotron-ClimbMix`。数据集采用`cc-by-nc-4.0`许可证发布。

KletterMix is a large-scale German text dataset released in sharded JSONL file format. This full version combines deduplicated KletterMix data with the remaining scored examples, replacing the previously smaller `KletterMix-12B` reviewed subset. The dataset contains 553,315,017 samples, totaling approximately 725 billion GPT-2 tokens, with a logical size of about 1.9 TB, stored across 125 shard files. Each data row includes the following fields: `id` (a stable source-derived row identifier), `cluster_id` (integer cluster assignment), `text` (German text content), `token_count` (GPT-2 token count of the text), and `proxy_score` (a scalar proxy score for quality or relevance). The dataset is intended for use in pre-training and continued pre-training experiments on German text, dataset inspection and filtering research, analysis of cluster structures and score distributions, as well as experiments in sampling and curriculum design using token counts or proxy scores. The dataset contains only text data, employs a sharded JSONL format for stream-friendly access, and retains the `id` column. The `token_count` values are derived from separately computed metadata passes, and `proxy_score` values are scalar proxy quality or relevance scores. The original upstream data source is `nvidia/Nemotron-ClimbMix`. The dataset is released under the `cc-by-nc-4.0` license.

创建时间:
2026-06-02
原始信息汇总

数据集概述

KletterMix 是一个大型德语文本数据集,以分片 JSONL 文件形式发布。该数据集结合了去重后的 KletterMix 数据与剩余的带评分样本,是完整版本,取代了之前的 KletterMix-12B 子集。

基本信息

  • 许可证: cc-by-nc-4.0
  • 语言: 德语
  • 数据规模: 1亿至10亿条记录 (100M < n < 1B)
  • 数据文件: 包含 125 个分片文件,涵盖一个名为 default 的配置(仅训练集)

文件结构

数据按 125 个分片存储,文件名格式为 shard_00000.jsonlshard_00124.jsonl。每个文件均为行分隔的 JSON (.jsonl) 格式,每行代表一条数据样本。

数据模式

每条记录包含以下字段:

字段 类型 描述
id string 稳定的、源自上游的样本行标识符
cluster_id int64 整数形式的聚类分配编号
text string 德语文本内容
token_count int64 该文本的 GPT-2 分词数量
proxy_score float64 标量质量或相关性代理分数

数据规模

  • 分片数量: 125
  • 行数: 553,315,017
  • 分词数量: 约 725B GPT-2 分词
  • 逻辑 JSONL 大小: 约 1.9 TB

预期用途

该数据集适用于:

  • 基于德语文本的预训练与继续预训练实验
  • 数据集检查与过滤研究
  • 聚类结构与分数分布分析
  • 利用分词数量或代理分数进行采样与课程设计的实验

其他说明

  • 仅包含文本数据,无其他模态信息
  • 分片 JSONL 格式便于流式访问
  • id 列在完整版本中保留
  • token_count 来自单独计算的元数据扫描(GPT-2 分词器)
  • proxy_score 为标量代理质量或相关性分数
  • 原始上游数据集来源为 nvidia/Nemotron-ClimbMix
搜集汇总
数据集介绍
KletterMix 数据集图片
构建方式
KletterMix是一个专为德语预训练任务设计的大型文本数据集,其构建借鉴了NVIDIA推出的Nemotron-ClimbMix数据集的设计理念。研究人员通过对原始德语语料进行去重、聚类与质量评分等精细化处理流程,最终生成了结构化的数据集合。该数据集以分片式JSONL格式发布,共计125个shard文件,每个文件中每一行对应一条独立样本,包含唯一标识符、聚类编号、文本内容、GPT-2分词计数以及代理质量评分,便于高效流式加载与后续分析。
使用方法
KletterMix数据集适用于多种德语自然语言处理实验场景,包括预训练与持续预训练、数据集质量分析与过滤方法研究、聚类结构与评分分布探索,以及基于词元计数或代理分数的采样与课程学习设计。使用者可通过HuggingFace Datasets库直接加载分片数据,亦可基于数据集中提供的聚类编号与代理分数实现自定义筛选策略。推荐在引用时参考相关技术论文以获取更完整的构建细节与使用指引。
背景与挑战
背景概述
在自然语言处理领域,大规模高质量预训练语料库的构建是推动语言模型性能提升的关键基石,尤其对于德语等资源相对匮乏的语言而言,其重要性不言而喻。KletterMix数据集由Maurice Kraus、Ruben Härle、Sebastian Sztwiertnia等研究人员于2026年联合发布,源自对NVIDIA的Nemotron-ClimbMix数据集的深度处理与拓展,旨在解决德语文本预训练数据规模不足与质量参差不齐的核心研究问题。该数据集以CC-BY-NC-4.0许可协议公开,包含超过55亿条文本记录,总计约725B GPT-2令牌,是目前规模最大的德语文本数据集之一,显著提升了德语自然语言处理研究的资源基础,并对多语言预训练、数据筛选及聚类分析等领域产生了深远影响。
当前挑战
KletterMix所面临的挑战主要体现在两个层面:在领域问题层面,该数据集致力于攻克德语预训练数据长期存在的数量稀缺与质量不均衡的难题,通过提供大规模、去重并带有质量代理分数的文本语料,为德语语言模型的持续预训练、数据过滤研究及课程学习设计提供了坚实的数据支撑。在构建过程中,研究人员需应对从上游来源整合与去重海量文本的工程挑战,确保超1.9TB逻辑数据的高效分片存储与流式访问,同时需设计与计算可靠的代理分数(proxy_score)和聚类分配(cluster_id),以准确表征文本质量与结构特性,这些环节共同构成了该数据集构建的核心技术难点。
常用场景
经典使用场景
KletterMix作为大规模德语文本语料库,其最经典的使用场景在于支撑德语语言模型的预训练与持续预训练实验。凭借约725B GPT-2令牌的海量规模与精心设计的质量代理评分,研究者能够基于此数据集开展德语自然语言处理的基石性任务——从零开始训练或微调大型语言模型。该数据集以分片JSONL格式发布,支持流式访问,极大便利了大规模分布式训练流程的构建,成为德语NLP社区推动基础模型能力跃升的关键数据支柱。
解决学术问题
KletterMix直面的核心学术难题在于德语高质量预训练数据的稀缺性与不可重复性。此前德语NLP研究常受限于数据规模不足、质量参差或来源单一,导致模型泛化能力受限。该数据集通过聚类去重与代理评分机制,提供了可控的数据筛选与排序依据,使研究者能够系统探究数据质量、簇结构与模型性能之间的因果关联。其开放发布还解决了实验可复现性痛点,为德语语言模型的数据驱动研究奠定了可比较、可追踪的基准平台。
实际应用
在实际应用层面,KletterMix为德语场景下的各类AI产品与商业系统注入了核心动力。企业可基于该数据集预训练或领域适配的德语语言模型,用于智能客服、文档摘要、内容审核与机器翻译等实际任务。其代理评分与令牌计数字段使得开发者能够按需采样,优先使用高质量语料构建轻量化模型,在计算资源受限的场景中实现效率与性能的平衡。此外,该数据集也服务于德语学术研究与教育领域的文本分析系统,助力跨语言信息处理技术落地。
数据集最近研究
最新研究方向
当前KletterMix数据集的研究前沿聚焦于面向低资源语言(如德语)的大规模预训练数据构建与质量评估。该数据集整合了725B GPT-2令牌的超大规模德语文档,并创新性地引入聚类分配与代理评分机制,为数据过滤、课程学习及聚类结构分析提供了全新范式。其研究意义在于突破英语主导的预训练数据生态,推动多语言模型在德语等语料稀缺场景下的性能跃升,尤其对欧洲NLP领域的基础模型国产化、文化对齐及领域适应研究具有里程碑式影响。该工作与近期大模型数据治理、负采样策略及低资源语言公平性等热点议题紧密关联,为构建高质量、可解释的语料库奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务