遇见数据集

cl3410-phase1

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

CL3410 Phase 1 是一个用于语言模型预训练的马拉雅拉姆语和阿萨姆语语料库。该数据集由两个独立构建的语料库组成,分别针对较高资源语言马拉雅拉姆语和较低资源语言阿萨姆语,两者在数据来源、清洗阈值、词汇表和模型上完全独立,仅共享语言无关的流水线代码。数据收集和清洗均从零开始,未使用任何预训练分词器或语言模型。数据规模:马拉雅拉姆语包含553,957个文档,186,612,415个词,训练集分词数499,067,812;阿萨姆语包含553,317个文档,251,290,445个词,训练集分词数480,651,823。数据形式为JSONL.GZ格式,按语言分为train/validation/test三个子集(98/1/1比例)。适用任务包括文本生成、掩码填充、语言模型预训练、分词器训练等。数据集附带从头训练的SentencePiece分词器(词汇量6000,unigram模型),并提供详细的构建报告和统计文件。注意事项:阿萨姆语训练集略低于5亿词目标(约3.9%);少量阿萨姆语文本为机器翻译;部分马拉雅拉姆语文本包含梵语;第三方语料库未直接镜像,需通过代码复现。许可信息按源文档记录,整体为混合许可。

CL3410 Phase 1 is a corpus for language model pre-training in Malayalam and Assamese. The dataset consists of two independently constructed corpora for the higher-resource language Malayalam and the lower-resource language Assamese. They are completely independent in data sources, cleaning thresholds, vocabularies, and models, sharing only language-agnostic pipeline code. Data collection and cleaning were done from scratch without using any pre-trained tokenizers or language models. Data sizes: Malayalam has 553,957 documents, 186,612,415 words, and 499,067,812 training tokens; Assamese has 553,317 documents, 251,290,445 words, and 480,651,823 training tokens. Data is stored in JSONL.GZ format, split into train/validation/test subsets (98/1/1 ratio) per language. Applicable tasks include text generation, masked language modeling, language model pre-training, tokenizer training, etc. The dataset comes with a SentencePiece tokenizer (vocabulary size 6000, unigram model) trained from scratch, along with detailed construction reports and statistics files. Notes: The Assamese training set is slightly below the 500 million token target (about 3.9%); a small amount of Assamese text is machine-translated; some Malayalam text contains Sanskrit; third-party corpora are not directly mirrored and need to be reproduced via code. License information is recorded per source document, with a mixed license overall.

创建时间:
2026-08-19
原始信息汇总

数据集概述

CL3410 Phase 1 是一个用于语言模型预训练的双语语料库,包含马拉雅拉姆语(Malayalam)和阿萨姆语(Assamese)两个独立构建的子集。两者完全独立——拥有各自的来源、清洗阈值、词表和模型,仅共享语言无关的流水线代码。

规模与构成

指标 马拉雅拉姆语 阿萨姆语
文档数 553,957 553,317
词数 186,612,415 251,290,445
训练集 token 数 499,067,812 480,651,823
全语料 token 数 509,330,832 490,722,298
人工采集词占比 22.9% 30.7%
人工采集训练 token 占比 27.2% 35.1%
近重复去除率 0.1% 11.0%
训练/验证/测试划分 98/1/1 98/1/1

“人工采集”指本项目自行收集的数据(抓取、OCR 或转录),而非来自已有公开语料。

数据格式与加载

  • 数据以 jsonl.gz 格式存储,位于 lma-dataset/processed/{ml,as}/ 目录下,按 train/val/test 分割。
  • 每条记录包含字段:doc_id, text, source, source_type (manual/downloaded), url, title, license, date_collected, script_ratio, synthetic, dup_cluster, split_key
  • 可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset ml = load_dataset("amritha27/cl3410-phase1", "malayalam", split="train") as_ = load_dataset("amritha27/cl3410-phase1", "assamese", split="train")

  • 同时提供 SentencePiece tokenizer 模型(词表大小 6,000),以及完整的统计报告(corpus_stats.jsonstage_counters.jsontoken_stats.json)和可视化图表(56 张图、12 个 CSV 表)。

构建方法

采用九阶段流水线,按成本从低到高排列(启发式过滤 → 学习型过滤 → 去重):

  1. 校准:阈值基于每个来源自身分布的百分位数,而非全局假设。
  2. 从零训练的学习型过滤器:字符 5-gram 语言模型(带 stupid backoff)计算困惑度;哈希逻辑回归分类器(2^18 特征)给出质量分数。抓取文本在其自身分布内排序,而非与人工策展分布比较。
  3. 人工文本优先:人工来源先处理并作为去重哈希集的种子,冲突时优先保留人工副本;同时放宽符号和字体比例阈值。
  4. 去重:精确去重(blake2b)和段落级样板文本去除,再通过 MinHash(100 个排列、5 词 shingle)与 LSH banding(20×5,Jaccard 阈值 0.549)进行近重复检测,用 union-find 聚类。
  5. 防污染:按近重复聚类 ID 的哈希值分配数据分割,确保训练/测试边界无近重复跨集,已验证零违规。

Tokenizer 设计

  • SentencePiece unigram 模型,词表 6,000,启用字节回退(byte fallback),character_coverage=0.9995,使用恒等归一化,仅在训练集上训练。
指标 马拉雅拉姆语 阿萨姆语
词元生育率(tokens/word) 2.729 1.953
每 token 字符数 3.53 3.33
UNK 率 0 0
字节回退率 4.10e-02 3.04e-02
词表利用率 97.7% 97.5%

词表大小选择基于 25M 参数预算的权衡:在 d_model=480 的宽度下,6,000 是能维持完整模型宽度的最大词表;更大词表会牺牲计算参数换取极小的生育率提升。

局限性

  • 阿萨姆语训练集缺额:480.7M token,低于 500M 目标 3.9%,下载池已枯竭,需要新来源。
  • 马拉雅拉姆语训练集缺额:仅低于目标 0.19%,差额来自 2% 的验证/测试留出。
  • 少量机器翻译数据:阿萨姆语中约 14.3M 词来自 Sangraha 的机器翻译(synthetic/asm_Beng),已逐文档标记 synthetic: true
  • 约 1.9% 马拉雅拉姆语人工文本为梵语(使用马拉雅拉姆文书写),占全语料 0.45%。
  • 第三方语料未镜像:IndicCorp v2、Sangraha、CulturaX、FineWeb-2、Varta、Samanantar 等需通过收集代码复现。
  • 阿萨姆语使用孟加拉文书写,语言识别通过独特字母 ৰ (U+09F0) 和 ৱ (U+09F1) 区分,而非 Unicode 区块。

许可与版权

采用按来源混合许可,每条记录在 license 字段中单独标注。Wikipedia/Wikisource 内容为 CC BY-SA;扫描书籍为公有领域;抓取新闻仅用于非商业学术研究的合理使用,并附 URL 归属。使用者需自行检查所选用子集的 sourcelicense 字段。本项目为 IIIT Hyderabad 的 CL3410(语言模型与智能体)课程构建。

搜集汇总
数据集介绍
cl3410-phase1 数据集图片
构建方式
该数据集由两个独立构建的预训练语料库组成,分别针对马拉雅拉姆语和阿萨姆语,两者在数据源、清洗阈值、词汇表及模型上完全分离,仅共享参数化的语言无关流水线。构建过程采用九个阶段,从启发式规则到学习型过滤器再到去重,阈值通过各数据源自身分布的百分位数校准,而非预设。学习型过滤器包括基于字符5-gram语言模型的困惑度评估和基于哈希逻辑回归的质量评分,且 crawled 文本在其自身分布内排序。人工收集的文本被优先处理并预置去重哈希集合,同时获得放宽的符号和脚本阈值。去重采用精确匹配(blake2b)、段落级模板移除及MinHash(100排列,5词分片)近似去重,并通过并查集聚类。数据划分基于聚类ID的哈希,确保无近似重复跨越训练/测试边界。
特点
该数据集的一个显著特点是其构建的精细性与透明度。每个文档均带有完整的来源信息,包括来源类型(人工或下载)、URL、许可等,便于复核与再分配。词汇表大小为6000,这是基于参数预算的决策,确保在25M参数预算下模型宽度保持最大。字节回退机制确保零未知令牌率,但报告还提供了禁用字节回退时的反事实未知率。去重严格性高,特别是阿萨姆语近重复去除率达11%,且人工文本在冲突中优先保留。此外,数据集明确标注了局限性,如阿萨姆语训练令牌低于500M目标,部分阿萨姆语文本为机器翻译,以及少量马拉雅拉姆语文本实为天城文转写,充分体现了科研坦诚。
使用方法
该数据集可通过HuggingFace Datasets库直接加载,支持马拉雅拉姆语和阿萨姆语两个子集,每个子集均划分为训练、验证和测试三部分。词元器为独立的SentencePiece模型,可通过hub下载后使用。数据集文档结构清晰,包含统计数据、过滤漏斗、词元统计及报告,便于用户复现整个处理流程。由于许可为逐来源混合,用户在使用时需检查具体数据子集的许可字段。该数据集适用于预训练语言模型、词元器训练以及低资源语言处理研究,尤其适合需要详解构建细节和透明度的场景。
背景与挑战
背景概述
CL3410 Phase 1数据集由印度海得拉巴国际信息技术学院(IIIT Hyderabad)的CL3410课程团队于近年构建,聚焦于马拉雅拉姆语(Malayalam)和阿萨姆语(Assamese)两种印度低资源语言的语言模型预训练语料库。该数据集旨在弥补这两种语言在高质量文本数据上的匮乏,通过独立构建的语料库和从头训练的分词器,为低资源语言的自然语言处理研究提供坚实基础。其核心研究问题在于如何在不依赖现有预训练模型或分词器的情况下,从零构建并清洁大规模语料,同时确保数据质量和领域覆盖。该数据集在低资源语言预训练领域具有开创性意义,其构建方法论和开放许可为后续研究提供了参考,对推动印度语言技术的进步具有重要影响。
当前挑战
该数据集面临的挑战集中在两方面。领域层面,低资源语言如阿萨姆语和马拉雅拉姆语面临数据稀缺、质量参差不齐及语言多样性等问题,且阿萨姆语常被误认为孟加拉语,增加了数据筛选和标注的难度。构建过程中,团队需开发语言无关的管线,处理OCR噪音、跨来源重复和近重复内容,并通过从零训练的字符级5-gram语言模型和逻辑回归分类器进行质量过滤。此外,分词器词汇量选择需在参数预算和性能间权衡,而阿萨姆语最终未达500M token目标,需引入新数据源,这些均构成显著挑战。
常用场景
经典使用场景
该数据集专为低资源印度语言(马拉雅拉姆语和阿萨姆语)的语言模型预训练而设计,提供了从零构建的语料库和分词器。其经典使用场景在于训练掩码语言模型和自回归语言模型,支持文本生成与填充掩码任务,研究人员可借助其高透明度(来源、清洗流程、去重与防污染设计)复现低资源语言模型的构建全过程。
实际应用
在实际应用中,该数据集可支撑开发面向马拉雅拉姆语和阿萨姆语的机器翻译、文本摘要、情感分析等自然语言处理系统,尤其适用于公共服务领域如政府信息分发、教育内容本地化及文化遗产数字化。其标注的许可和来源信息便于合规使用,而内置的分词器则简化了部署流程。
衍生相关工作
该数据集衍生的工作集中于低资源语言模型的分析工具与基准:其详细的分阶段过滤流程和分词器对比(如词频、压缩率、替代UNK率)可复用于构建类似语料库;其文档级防污染策略和基于簇的划分方法为评估数据泄漏提供了新范式,后续研究可借此构建更鲁棒的评估协议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务