遇见数据集

odia_pretrain_dataset_v2

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Odia Pretrain Dataset v2 是一个高质量、大规模的奥里亚语(Odia)预训练数据集。该数据集由Sai Dutta Abhishek Dash构建,在v1版本基础上新增了来自Wikipedia Odia、IndicCorpV2等来源的数据,经过跨来源去重后,最终包含12,291,203个独特的奥里亚语文档,覆盖30多个数据源。数据集采用CC-BY-4.0许可证,可免费用于商业和研究目的,无需任何形式的申请或门控。数据以Parquet格式存储(32个分片),每个样本包含以下字段:text(干净的奥里亚语文本)、source(数据来源,如monsoon-nlp、wikipedia、indiccorp_v2)、type(固定为'pretrain')、char_count(字符长度,整数类型)、en_aligned(是否具有英文对齐,布尔类型)。该数据集特别适合用于奥里亚语语言模型的预训练、文本生成、掩码语言建模等自然语言处理任务。用户可通过Hugging Face datasets库直接加载使用。

Odia Pretrain Dataset v2 is a high-quality, large-scale Odia pretraining dataset. It was constructed by Sai Dutta Abhishek Dash, building upon the v1 version by adding data from sources such as Wikipedia Odia and IndicCorpV2. After cross-source deduplication, it contains 12,291,203 unique Odia documents covering over 30 data sources. The dataset is licensed under CC-BY-4.0, free for commercial and research purposes without any application or gating. Data is stored in Parquet format (32 shards), with each sample including the following fields: text (clean Odia text), source (data source, e.g., monsoon-nlp, wikipedia, indiccorp_v2), type (fixed as pretrain), char_count (character length, integer), en_aligned (whether it has English alignment, boolean). This dataset is particularly suitable for pretraining Odia language models, text generation, masked language modeling, and other NLP tasks. Users can directly load it via the Hugging Face datasets library.

创建时间:
2026-07-30
原始信息汇总

Odia Pretrain Dataset v2 数据集详情

基本信息

  • 数据集名称: Odia Pretrain Dataset v2
  • 语言: 奥里亚语(Odia,语言代码: or
  • 许可协议: CC-BY-4.0(可商用)
  • 访问限制: 无(无需申请或门控)
  • 数据规模: 12,291,203 行(约 1230 万条)
  • 数据来源: 30+ 个来源
  • 文件格式: Parquet(32 个分片)

数据来源构成

来源 行数 说明
v1 数据集(25+ 来源) 10,290,562 新闻、网页爬取、IndicNLP、Varta、Samanantar、xp3、OdiaQA、Wikipedia、Alpaca 等
monsoon-nlp/odia-cleaned 0(完全去重) 与 v1 完全重叠
Wikipedia(奥里亚语) 641 v1 中未包含的奥里亚语维基百科文章
IndicCorpV2(奥里亚语) 2,000,000 AI4Bharat 的 IndicCorpV2 奥里亚语子集

数据字段说明

字段 类型 描述
text string 清洗后的奥里亚语文本
source string 数据来源(monsoon-nlp、wikipedia 或 indiccorp_v2)
type string 固定为 "pretrain"
char_count int64 字符长度
en_aligned bool 是否有英文对齐

数据集用途

该数据集适用于以下自然语言处理任务:

  • 文本生成(text-generation)
  • 掩码语言建模(fill-mask)
  • 预训练语言模型

使用方式

可通过 Hugging Face datasets 库直接加载: python from datasets import load_dataset ds = load_dataset("saidutta69/odia_pretrain_dataset_v2", split="train")

支持按来源过滤数据,并可计算字符长度分布等统计信息。

背景说明

该数据集是在 v1 基础上构建的,v1 曾因过滤掉 98% 的数据而受到批评。v2 在保留 v1 全部数据的基础上,新增了 Wikipedia 奥里亚语文章和 IndicCorpV2 的 200 万条数据,经全面去重后达到 1230 万条独特文本,相较于 v1 增加了 19% 的数据量。

搜集汇总
数据集介绍
odia_pretrain_dataset_v2 数据集图片
构建方式
在低资源语言预训练语料稀缺的背景下,该数据集以v1版本(25余个来源、约1030万行)为基础,通过增量聚合与严格去重扩展而来。构建过程中引入monsoon-nlp/odia-cleaned(与v1完全重叠,去重后未新增)、奥里亚语维基百科的641篇独有文章以及AI4Bharat IndicCorpV2的200万行奥里亚语文本,跨源执行行级去重后形成1229万余条唯一记录,较v1增长约19%,同时将质量损耗控制在有限范围。
特点
该数据集汇集逾30个来源,涵盖新闻、网页抓取、IndicNLP、Varta、Samanantar、xp3、OdiaQA、维基百科、Alpaca及IndicCorpV2等,共计12,291,203行文本。数据以Parquet格式分发为32个分片,采用CC-BY-4.0许可,可商业使用且无需申请访问权限。字段包括text、source、type、char_count与en_aligned,提供来源标记、字符长度统计以及英语对齐状态,便于质量分析与条件筛选。
使用方法
在文本生成与掩码填充等预训练任务中,可通过datasets库直接加载:load_dataset("saidutta69/odia_pretrain_dataset_v2", split="train")。加载后可按source字段过滤出monsoon-nlp、wikipedia或indiccorp_v2等子集,亦可依据char_count统计字符长度分布,从而按语料来源或文本长度构造训练批次,满足奥里亚语语言模型预训练及多语言建模的语料需求。
背景与挑战
背景概述
奥里亚语作为印度宪法认可的古典语言,其数字化语料长期匮乏,严重制约了低资源语言预训练模型的发展。在此背景下,研究者Sai Dutta Abhishek Dash于2026年发布了Odia Pretrain Dataset v2,该数据集整合了30余个来源(包括新闻、网络爬虫、IndicCorpV2等),经过去重与清洗,最终形成包含1230万条清洁文档的预训练语料库。其核心研究问题在于构建一个无门槛、高质量、可商用的奥里亚语预训练数据集,以填补该语言在自然语言处理领域的资源空白。该数据集的发布对推动奥里亚语机器翻译、文本生成等任务具有重要影响力,并为低资源语言研究提供了可复用的数据构建范式。
当前挑战
该数据集所解决的领域问题是奥里亚语预训练语料稀缺与质量参差不齐的困境。构建过程中面临多重挑战:其一,多源数据融合时需进行跨源去重,尤其是与v1及monsoon-nlp语料的完全重叠检测,以确保数据唯一性;其二,在扩充数据规模的同时需维持低噪声水平,避免引入低质量或重复内容;其三,处理千万级文档对计算资源与工程实现提出极高要求,需在分布式环境下完成高效清洗与格式转换;其四,平衡数据多样性与领域覆盖,确保新闻、维基百科、网络文本等不同来源的合理配比,以支撑泛化性预训练需求。
常用场景
经典使用场景
在低资源语言预训练领域,奥里亚语长期面临高质量语料稀缺的困境,该数据集以1230万条经严格去重的奥里亚语文本为核心,为自回归语言建模与掩码语言建模提供了规模化的训练基底。研究者常将其直接加载为HuggingFace的datasets对象,按source字段切分monsoon-nlp、wikipedia与indiccorp_v2等子集,利用text与char_count字段进行长度分布分析与课程学习策略设计,从而在统一框架下开展奥里亚语单语预训练实验。
解决学术问题
该数据集直面印度低资源语言研究中语料规模不足与质量参差的双重瓶颈,通过整合30余个来源并执行跨源完全去重,将v1的1030万行扩展至1230万行,在仅增加19%数据量的前提下显著提升了来源多样性。其无门控、可商用的CC-BY-4.0许可消除了学术获取壁垒,使研究者得以在可复现的基准上探究数据规模、来源构成与预训练效果之间的因果关联,为低资源语言的缩放律研究提供了可靠的实证材料。
衍生相关工作
该数据集直接衍生于v1的25余个来源语料以及monsoon-nlp/odia-cleaned、Odia Wikipedia与AI4Bharat的IndicCorpV2等上游工作,并在社区反馈驱动下修正了v1过度过滤的缺陷。基于该数据集,后续研究可望开展奥里亚语分词器训练、单语语言模型微调以及跨语言迁移学习等经典任务,其去重与合并流程亦为其他印度语言预训练语料的构建提供了可借鉴的工程范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务