遇见数据集

odia_pretrain_dataset

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

奥里亚语预训练数据集是一个为低资源语言奥里亚语(Odia)构建的大规模、开源文本数据集。该数据集的创建源于对现有奥里亚语数据集访问受限的抗议,作者从零开始,通过整合互联网上所有可公开获取的奥里亚语语料,重建了一个规模更大、更多样化的替代品。数据集总计包含超过975万行文本,汇集了来自25个以上不同来源的数据,包括IndicNLP语料库、网络新闻爬取(Odia Web Corpus v5)、DailyHunt新闻(Varta)、Samanantar平行句对、BigScience XP3多语言数据、Culturax清洗后的网络爬虫、问答数据、指令数据(Alpaca、Dolly、GPTeacher)、维基百科、歌词等多种类型。数据经过严格的质量控制,包括去重(移除超过80万行重复项)、HTML标签清理、短文本过滤等,确保98.5%的样本中奥里亚语内容占比超过50%,整体质量评分为99.5/100。数据集采用CC-BY-4.0许可协议,允许商业和研究使用,旨在为奥里亚语自然语言处理模型的预训练(如文本生成、掩码语言建模)提供无障碍、高质量的资源,以促进该语言在AI领域的发展。

The Odia pretraining dataset is a large-scale, open-source text dataset constructed for the low-resource language Odia. Its creation stems from protests against restricted access to existing Odia datasets, with the authors rebuilding a larger and more diverse alternative from scratch by aggregating all publicly available Odia corpora from the internet. The dataset totals over 9.75 million lines of text, compiled from more than 25 different sources, including IndicNLP corpus, web news crawls (Odia Web Corpus v5), DailyHunt news (Varta), Samanantar parallel sentence pairs, BigScience XP3 multilingual data, Culturax cleaned web crawls, question-answer data, instruction data (Alpaca, Dolly, GPTeacher), Wikipedia, lyrics, and other types. The data undergoes rigorous quality control, including deduplication (removing over 800,000 duplicate lines), HTML tag cleaning, short text filtering, etc., ensuring that over 98.5% of samples contain more than 50% Odia content, with an overall quality score of 99.5/100. The dataset is licensed under CC-BY-4.0, permitting commercial and research use, and aims to provide accessible, high-quality resources for pretraining Odia natural language processing models (e.g., text generation, masked language modeling) to promote the languages development in the AI field.

创建时间:
2026-07-21
原始信息汇总

数据集概览

  • 数据集名称:Odia Pre-training Dataset
  • 全称:Odia Pre-training Dataset (The One That Didnt Need Gating)
  • 语言:奥里亚语(or)、英语(en)
  • 许可证:CC-BY-4.0(可商用)
  • 数据量:9,755,460 行
  • 数据来源:超过 25 个独立来源
  • 主要标签:odia、indic、nlp、pre-training、language-model、multilingual、cc-by-4.0、open-access、no-gating-required
  • 任务类别:text-generation(文本生成)、fill-mask(掩码填充)
  • 存储库:datasets 库

数据来源与构成

数据来源 行数 说明
indic_nlp_corp 3,122,796 IndicNLP 语料库(主干部分)
odia_web_corpus_v5 3,340,338 自采网络数据(新闻、指令等)
varta 1,014,936 DailyHunt 奥里亚新闻文章
samanantar 992,064 奥里亚-英语平行句对
xp3 486,529 BigScience 多语言平行数据
culturax 150,318 清洗后的网络爬取数据
odia_qa 84,920 奥里亚问答数据
oscar_odia 50,092 OSCAR 奥里语子集
alpaca_odia 49,076 奥里亚指令数据
eng_to_odia 20,828 翻译对
wikipedia 17,210 奥里亚维基百科
dolly_odia 14,959 奥里亚 Dolly 数据
gpt_teacher 18,184 GPTeacher 奥里亚数据
odia_news 5,993 Common Crawl 新闻
odia_lyrics 156 奥里亚歌词
其他 10 个来源 约 100,000 社区贡献

数据质量

  • 空文本:0 行
  • 奥里亚内容占比均值:80.6%
  • 奥里亚占比 >50% 的行:98.5%
  • 重复数据去除:去除 805,532 行
  • HTML 标签清理:已完成
  • 短文本过滤(<15 字符):已完成
  • 质量评分:99.5/100

数据模式

字段 类型 描述
text string 奥里亚文本内容
source string 数据来源标识
type string 数据类型:单语、平行、指令、问答等
en_aligned string 英文翻译(仅平行数据存在)

快速使用示例

python from datasets import load_dataset

直接加载,无需申请访问权限

dataset = load_dataset("saidutta69/odia_pretrain_dataset", split="train")

按来源过滤

news = dataset.filter(lambda x: x["source"] in ("varta", "odia_web_corpus_v5")) instructions = dataset.filter(lambda x: x["type"] == "instruction") parallel = dataset.filter(lambda x: x["source"] == "samanantar")

按来源统计数量

from collections import Counter sources = Counter(x["source"] for x in dataset) for src, count in sources.most_common(): print(f"{src}: {count:,}")

未收录的受限数据集

以下数据集已申请访问但仍未开放,后续可能合并:

数据集 行数 状态
oscar-corpus/OSCAR-2301 48,780 已申请,等待中
OdiaGenAIdata/pre_train_odia_data_processed 5,980,000 已申请,仍在等待

引用信息

bibtex @misc{odia_pretrain_dataset, author = {Saidutta Abhishek Dash}, title = {Odia Pre-training Dataset: What Happens When You Gate a Low-Resource Language}, year = {2025}, publisher = {Hugging Face}, note = {9.75M rows of Odia text, rebuilt from scratch because access requests went unanswered}, howpublished = {url{https://huggingface.co/datasets/saidutta69/odia_pretrain_dataset}}, }

搜集汇总
数据集介绍
odia_pretrain_dataset 数据集图片
构建方式
该数据集的构建源于一次未能获得现有奥里亚语预训练数据集的访问权限。为突破这一障碍,开发者通过爬取互联网上所有公开的奥里亚语语料库,整合了超过25个独立来源,包括IndicNLP语料库、自主爬取的网络文本、DailyHunt新闻语料、Samanantar平行语料、BigScience多语言数据等,并经过严格的去重处理(移除约80万行重复数据)、HTML标签清洗、短文本过滤以及基于奥里亚语内容比例的筛选,最终汇聚成包含975万行文本的大规模数据集。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,无需申请访问权限或填写表格。使用示例代码可加载全部训练数据,并支持按来源或类型进行筛选,例如过滤出新闻类或指令类数据。数据集包含'text'、'source'、'type'和'en_aligned'四个字段,便于下游任务中的灵活应用,如语言模型预训练、机器翻译或指令微调。
背景与挑战
背景概述
奥里亚语作为印度低资源语言,其自然语言处理研究长期受限于高质量语料库的匮乏。2025年,研究者Saidutta Abhishek Dash因原数据集访问请求长期未获批准,从零构建了包含975万行的奥里亚语预训练数据集(odia_pretrain_dataset),整合了25余个公开来源的语料,涵盖新闻、平行语料、指令数据等多类型文本。该数据集以CC-BY-4.0许可开放,无需访问申请,填补了低资源语言开放预训练数据的空白,对推动奥里亚语语言模型研究具有里程碑意义。
当前挑战
该数据集主要面临三重挑战:1)低资源语言语料挖掘的固有难题,包括网络内容稀疏、高质量源匮乏,需从25余个异构来源中提取并整合;2)构建过程中的技术障碍,如云端虚拟机频繁中断、上传限制、去重脚本需处理80万冗余行,并确保奥里亚语占比均值达80.6%;3)原始数据因机构设有访问门槛而不可得,倒逼完全自主重建,最终产出比原始数据集大63%的开放资源,凸显了学术共享与生态协作的紧迫性。
常用场景
经典使用场景
在低资源语言自然语言处理领域,odia_pretrain_dataset最为经典的使用场景是作为大规模无监督预训练语料库,用于训练奥里亚语的掩码语言模型(MLM)和因果语言模型(CLM)。该数据集汇聚了超过970万条高质量奥里亚语文本,涵盖新闻、百科、平行语料、问答数据及指令数据等多元来源,为从零构建奥里亚语的BERT、GPT等预训练模型提供了坚实的数据基础,尤其适用于那些受限于数据稀缺而难以开展预训练的学术研究与工业应用。
解决学术问题
该数据集直面低资源语言预训练数据匮乏这一核心学术难题。长期以来,奥里亚语因其使用者相对较少、数字化语料分散且多数数据集需申请审批,严重阻碍了相关语言学计算研究的发展。odia_pretrain_dataset通过公开访问的CC-BY-4.0许可,一键式开放超过970万行文本,解决了数据获取壁垒问题,使得研究人员能够聚焦于奥里亚语的词表示学习、语法结构建模、多语言迁移学习以及零样本跨语言理解等前沿课题。其意义在于大幅降低了低资源语言NLP研究的准入门槛,促进了语言多样化与包容性,并为全球学术社群提供了可复现、可扩展的基准数据资源。
实际应用
在实际产业与社会应用中,odia_pretrain_dataset可被直接用于构建奥里亚语的智能文本生成系统,如自动新闻摘要、智能客服对话以及教育领域的语法纠错工具。其包含的指令数据子集(alpaca_odia、dolly_odia)更使其成为微调指令跟随模型与对话AI的理想训练素材,助力开发面向奥里亚语社区的语音助手、内容推荐引擎及本地化翻译服务。此外,标注的类型字段允许开发者按需采样单语、平行或问答数据,灵活适配机器翻译、信息检索与情感分析等下游任务,从而真正将奥里亚语融入多语言AI生态。
数据集最近研究
最新研究方向
在低资源语言自然语言处理领域,该数据集(Odia Pre-training Dataset)的构建本身便是对当前研究热点的直接回应——即打破数据壁垒,推动开放科学。其起源故事揭示了一个关键问题:当研究机构对低资源语言数据实施访问限制时,不仅未能保护学术成果,反而催生了更大规模、更高质量的开源替代品。这一现象与当前学界对“数据殖民主义”和“资源不平等”的批判性讨论紧密相连。该数据集通过整合25个以上公开来源、实施严格的去重与质量筛选(最终质量评分高达99.5/100),为奥里亚语的预训练语言模型、文本生成及掩码填充任务提供了坚实的数据基础。其CC-BY-4.0许可协议进一步降低了商用与学术研究门槛,直接打破了传统上由少数机构垄断奥里亚语NLP资源的格局。这一案例不仅为其他低资源语言社区提供了可复现的范式(即通过社区协作与工程化手段绕过访问限制),更在宏观层面引发了关于“数据围墙是否真正有益于语言技术发展”的深刻思考——当访问请求被长期搁置时,开放协作与“以牙还牙”式的创造或许才是推动低资源语言NLP前行的真正动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务