cl3410-phase1
收藏资源简介:
CL3410 Phase 1 是一个用于语言模型预训练的马拉雅拉姆语和阿萨姆语语料库。该数据集由两个独立构建的语料库组成,分别针对较高资源语言马拉雅拉姆语和较低资源语言阿萨姆语,两者在数据来源、清洗阈值、词汇表和模型上完全独立,仅共享语言无关的流水线代码。数据收集和清洗均从零开始,未使用任何预训练分词器或语言模型。数据规模:马拉雅拉姆语包含553,957个文档,186,612,415个词,训练集分词数499,067,812;阿萨姆语包含553,317个文档,251,290,445个词,训练集分词数480,651,823。数据形式为JSONL.GZ格式,按语言分为train/validation/test三个子集(98/1/1比例)。适用任务包括文本生成、掩码填充、语言模型预训练、分词器训练等。数据集附带从头训练的SentencePiece分词器(词汇量6000,unigram模型),并提供详细的构建报告和统计文件。注意事项:阿萨姆语训练集略低于5亿词目标(约3.9%);少量阿萨姆语文本为机器翻译;部分马拉雅拉姆语文本包含梵语;第三方语料库未直接镜像,需通过代码复现。许可信息按源文档记录,整体为混合许可。
CL3410 Phase 1 is a corpus for language model pre-training in Malayalam and Assamese. The dataset consists of two independently constructed corpora for the higher-resource language Malayalam and the lower-resource language Assamese. They are completely independent in data sources, cleaning thresholds, vocabularies, and models, sharing only language-agnostic pipeline code. Data collection and cleaning were done from scratch without using any pre-trained tokenizers or language models. Data sizes: Malayalam has 553,957 documents, 186,612,415 words, and 499,067,812 training tokens; Assamese has 553,317 documents, 251,290,445 words, and 480,651,823 training tokens. Data is stored in JSONL.GZ format, split into train/validation/test subsets (98/1/1 ratio) per language. Applicable tasks include text generation, masked language modeling, language model pre-training, tokenizer training, etc. The dataset comes with a SentencePiece tokenizer (vocabulary size 6000, unigram model) trained from scratch, along with detailed construction reports and statistics files. Notes: The Assamese training set is slightly below the 500 million token target (about 3.9%); a small amount of Assamese text is machine-translated; some Malayalam text contains Sanskrit; third-party corpora are not directly mirrored and need to be reproduced via code. License information is recorded per source document, with a mixed license overall.
数据集概述
CL3410 Phase 1 是一个用于语言模型预训练的双语语料库,包含马拉雅拉姆语(Malayalam)和阿萨姆语(Assamese)两个独立构建的子集。两者完全独立——拥有各自的来源、清洗阈值、词表和模型,仅共享语言无关的流水线代码。
规模与构成
| 指标 | 马拉雅拉姆语 | 阿萨姆语 |
|---|---|---|
| 文档数 | 553,957 | 553,317 |
| 词数 | 186,612,415 | 251,290,445 |
| 训练集 token 数 | 499,067,812 | 480,651,823 |
| 全语料 token 数 | 509,330,832 | 490,722,298 |
| 人工采集词占比 | 22.9% | 30.7% |
| 人工采集训练 token 占比 | 27.2% | 35.1% |
| 近重复去除率 | 0.1% | 11.0% |
| 训练/验证/测试划分 | 98/1/1 | 98/1/1 |
“人工采集”指本项目自行收集的数据(抓取、OCR 或转录),而非来自已有公开语料。
数据格式与加载
- 数据以
jsonl.gz格式存储,位于lma-dataset/processed/{ml,as}/目录下,按 train/val/test 分割。 - 每条记录包含字段:
doc_id, text, source, source_type (manual/downloaded), url, title, license, date_collected, script_ratio, synthetic, dup_cluster, split_key。 - 可通过 Hugging Face
datasets库加载:
python from datasets import load_dataset ml = load_dataset("amritha27/cl3410-phase1", "malayalam", split="train") as_ = load_dataset("amritha27/cl3410-phase1", "assamese", split="train")
- 同时提供 SentencePiece tokenizer 模型(词表大小 6,000),以及完整的统计报告(
corpus_stats.json、stage_counters.json、token_stats.json)和可视化图表(56 张图、12 个 CSV 表)。
构建方法
采用九阶段流水线,按成本从低到高排列(启发式过滤 → 学习型过滤 → 去重):
- 校准:阈值基于每个来源自身分布的百分位数,而非全局假设。
- 从零训练的学习型过滤器:字符 5-gram 语言模型(带 stupid backoff)计算困惑度;哈希逻辑回归分类器(2^18 特征)给出质量分数。抓取文本在其自身分布内排序,而非与人工策展分布比较。
- 人工文本优先:人工来源先处理并作为去重哈希集的种子,冲突时优先保留人工副本;同时放宽符号和字体比例阈值。
- 去重:精确去重(blake2b)和段落级样板文本去除,再通过 MinHash(100 个排列、5 词 shingle)与 LSH banding(20×5,Jaccard 阈值 0.549)进行近重复检测,用 union-find 聚类。
- 防污染:按近重复聚类 ID 的哈希值分配数据分割,确保训练/测试边界无近重复跨集,已验证零违规。
Tokenizer 设计
- SentencePiece unigram 模型,词表 6,000,启用字节回退(byte fallback),
character_coverage=0.9995,使用恒等归一化,仅在训练集上训练。
| 指标 | 马拉雅拉姆语 | 阿萨姆语 |
|---|---|---|
| 词元生育率(tokens/word) | 2.729 | 1.953 |
| 每 token 字符数 | 3.53 | 3.33 |
| UNK 率 | 0 | 0 |
| 字节回退率 | 4.10e-02 | 3.04e-02 |
| 词表利用率 | 97.7% | 97.5% |
词表大小选择基于 25M 参数预算的权衡:在 d_model=480 的宽度下,6,000 是能维持完整模型宽度的最大词表;更大词表会牺牲计算参数换取极小的生育率提升。
局限性
- 阿萨姆语训练集缺额:480.7M token,低于 500M 目标 3.9%,下载池已枯竭,需要新来源。
- 马拉雅拉姆语训练集缺额:仅低于目标 0.19%,差额来自 2% 的验证/测试留出。
- 少量机器翻译数据:阿萨姆语中约 14.3M 词来自 Sangraha 的机器翻译(
synthetic/asm_Beng),已逐文档标记synthetic: true。 - 约 1.9% 马拉雅拉姆语人工文本为梵语(使用马拉雅拉姆文书写),占全语料 0.45%。
- 第三方语料未镜像:IndicCorp v2、Sangraha、CulturaX、FineWeb-2、Varta、Samanantar 等需通过收集代码复现。
- 阿萨姆语使用孟加拉文书写,语言识别通过独特字母 ৰ (U+09F0) 和 ৱ (U+09F1) 区分,而非 Unicode 区块。
许可与版权
采用按来源混合许可,每条记录在 license 字段中单独标注。Wikipedia/Wikisource 内容为 CC BY-SA;扫描书籍为公有领域;抓取新闻仅用于非商业学术研究的合理使用,并附 URL 归属。使用者需自行检查所选用子集的 source 和 license 字段。本项目为 IIIT Hyderabad 的 CL3410(语言模型与智能体)课程构建。




