遇见数据集

Odia-Web-Corpus-v5

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

该数据集是迄今为止最大且最干净的奥里亚语(Odia)文本语料库,版本为v5。它由四个来源(v4语料库、abhilash87的维基百科和新闻抓取、culturax-odia的Common Crawl子集、hemendra的网络文本集合)合并并经过严格清洗得到,总共包含4,162,804个去重文档,大小为7.74 GB。清洗流程包括精确MD5去重(移除30.2%)、移除短行(少于10字符,移除6.2%)、过滤非奥里亚语(移除0.7%)、过滤低奥里亚语比例文本(少于10%奥里亚语字符,移除0.01%),以及剥离HTML和URL标记,整体缩减37.2%。数据以28个分片的Parquet文件存储,仅包含一个文本字段(text),类型为字符串。该数据集适用于文本生成、掩码填充等自然语言处理任务,以及奥里亚语的语言模型预训练。许可证为CC-BY-SA-4.0。

This dataset is the largest and cleanest Odia text corpus to date, version v5. It is compiled from four sources (v4 corpus, abhilash87s Wikipedia and news crawls, the culturax-odia subset of Common Crawl, and hemendras web text collection) and rigorously cleaned, resulting in a total of 4,162,804 deduplicated documents totaling 7.74 GB. The cleaning process includes exact MD5 deduplication (removing 30.2%), removal of short lines (fewer than 10 characters, removing 6.2%), filtering non-Odia text (removing 0.7%), filtering low Odia ratio text (less than 10% Odia characters, removing 0.01%), and stripping HTML and URL tags, reducing the overall size by 37.2%. The data is stored in 28 sharded Parquet files, containing only one text field (text) of type string. This dataset is suitable for natural language processing tasks such as text generation and mask filling, as well as pretraining language models for Odia. The license is CC-BY-SA-4.0.

创建时间:
2026-07-18
原始信息汇总

数据集概述

Odia Web Corpus v5 是目前规模最大、质量最高的奥里亚语(Odia)文本语料库,包含 416万篇去重文档,总大小 7.74 GB。该数据集通过合并四个来源并进行严格清洗构建而成,适用于文本生成、掩码填充等自然语言处理任务。

基本信息

  • 语言:奥里亚语(Odia,ISO 639-3: or
  • 格式:28个分片Parquet文件
  • 总大小:7.74 GB
  • 总文档数:4,162,804
  • 许可证:CC-BY-SA-4.0
  • 任务类别:文本生成(text-generation)、掩码填充(fill-mask)
  • 数据规模:1M < n < 10M

数据字段

字段 类型 描述
text string 清洗、去重后的奥里亚语文本

数据划分

  • 训练集(train):4,162,804 个样本

清洗流程

数据通过多阶段管道进行清洗,整体减少了 37.2% 的数据量(原始输入为663万行、9.91 GB):

清洗阶段 移除比例 说明
去重 30.2% 基于MD5哈希精确匹配
短行过滤 6.2% 少于10个字符的行
非奥里亚语过滤 0.7% 不含奥里亚语Unicode字符
低奥里亚语占比过滤 0.01% 奥里亚语字符占比低于10%
HTML与URL清理 去除标记和链接

来源构成

数据源 描述 贡献量
v4语料库 精选的奥里亚语网络文本 约310万行
abhilash87 奥里亚语维基百科+新闻爬取 约90万行
culturax-odia Common Crawl奥里亚语子集 约50万行
hemendra 奥里亚语网络文本集合 约40万行

使用方式

该数据集可通过 Hugging Face datasets 库直接加载,示例如下:

python from datasets import load_dataset

ds = load_dataset("saidutta69/Odia-Web-Corpus-v5", split="train") print(f"Total documents: {len(ds)}") print(ds[0]["text"][:200])

引用方式

bibtex @misc{odia-web-corpus-v5, author = {Sai Dutta}, title = {Odia Web Corpus v5}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v5}} }

搜集汇总
数据集介绍
Odia-Web-Corpus-v5 数据集图片
构建方式
在低资源语言建模研究持续推进的背景下,奥迪亚语(Odia)作为印度宪法承认的古典语言之一,其大规模高质量语料的匮乏长期制约着相关语言技术的进步。Odia-Web-Corpus-v5的构建以四个来源语料为基础,通过汇聚v4精选网络文本、abhilash87维基百科与新闻抓取数据、culturax-odia的Common Crawl子集以及hemendra网络文本集合,形成初始约663万行、9.91GB的原始输入。随后实施多阶段清洗流水线:以MD5哈希精确匹配去除30.2%的重复文档,过滤不足10字符的短行、不含奥迪亚语Unicode字符及奥迪亚语字符占比低于10%的条目,并剥离HTML标记与URL链接,最终整体压缩率达37.2%,产出416万余篇去重文档。
使用方法
该数据集面向文本生成与掩码语言建模等任务,可直接通过Hugging Face datasets库进行加载与使用。研究人员可调用load_dataset接口指定数据集名称与train划分,获取包含text字段的文档集合,进而用于预训练、微调或语言模型评估。由于数据以Parquet分片形式发布,加载时支持流式与批量两种模式,能够适配不同显存与存储条件。使用中可结合分词器对text字段进行编码,并依据任务需求进行截断或拼接。鉴于其清洁度与规模优势,该语料尤其适合作为奥迪亚语预训练基座,或与其他印度语言语料联合用于多语言模型训练,使用时需遵循CC-BY-SA-4.0许可条款并引用相应文献。
背景与挑战
背景概述
低资源语言的文本资源匮乏长期制约着自然语言处理技术的均衡发展,奥里亚语作为印度宪法承认的古典语言之一,其数字化语料建设尤为滞后。Odia-Web-Corpus-v5由Sai Dutta于2026年发布,旨在构建迄今规模最大、质量最优的奥里亚语文本语料库。该数据集通过整合四个来源的原始网络文本,经严格清洗后形成416万余篇去重文档,总容量达7.74 GB,为奥里亚语的预训练语言建模、文本生成及掩码填充等任务提供了关键数据基础,显著缓解了该语言在低资源场景下的数据稀缺困境。
当前挑战
该数据集所面对的核心领域难题在于,奥里亚语网络文本普遍存在拼写变体繁多、语码混合严重及有效内容稀疏等固有缺陷,传统语料构建方法难以在规模与质量之间取得平衡。在构建过程中,研究者需应对多源异构数据的标准化整合、跨来源近重复文档的高效识别,以及奥里亚语Unicode字符的准确判定等技术挑战。此外,清洗流程中高达37.2%的数据削减率,也反映出原始网络爬取文本的噪声水平之高,如何在去噪过程中避免误删有价值的语言现象,构成了一项持续的方法论难题。
常用场景
经典使用场景
在低资源语言预训练领域,构建大规模单语语料库是提升语言模型能力的基石。Odia-Web-Corpus-v5汇聚了416万条去重后的奥迪亚语文本,涵盖维基百科、新闻以及Common Crawl等多源数据,经过严格的清洗流程,成为当前规模最大、质量最优的奥迪亚语单语语料。该数据集最经典的使用场景在于自监督预训练,研究者可借助掩码语言建模(Masked Language Modeling)与因果语言建模(Causal Language Modeling)任务,训练面向奥迪亚语的BERT、GPT等架构,从而弥补该语言在通用多语言模型中的表征不足。
解决学术问题
长期以来,奥迪亚语作为印度官方语言之一,在自然语言处理研究中面临数据稀缺、噪声严重的困境,导致词嵌入质量低下、模型泛化能力薄弱。该数据集通过系统化的清洗流水线,移除重复、短文本、非奥迪亚字符及低奥迪亚比例内容,整体缩减37.2%,显著缓解了数据稀疏与噪声干扰问题。其出现为低资源语言建模、跨语言迁移学习、分词器优化等学术议题提供了可靠的数据基础,推动了奥迪亚语在计算语言学领域的可复现研究。
实际应用
在实际应用中,Odia-Web-Corpus-v5可广泛服务于文本生成、自动补全、情感分析、新闻摘要以及机器翻译等下游任务。开发者可基于该语料微调预训练模型,构建面向奥迪亚语用户的智能写作助手、舆情监测系统或教育类语言学习工具。此外,该数据集还可用于训练领域自适应的分词器与词向量,为搜索引擎、推荐系统提供更精准的语义表示,从而提升奥迪亚语数字化产品的用户体验。
数据集最近研究
最新研究方向
在低资源语言建模与数字包容性浪潮的推动下,Odia-Web-Corpus-v5作为迄今规模最大且经过严格去重的奥里亚语语料库,正引领本领域前沿研究向高质量单语预训练与跨语言迁移方向纵深发展。面对印度众多低资源语言在主流大模型中代表性不足的困境,该数据集凭借416万文档、7.74GB的体量以及涵盖维基百科、新闻抓取和Common Crawl等多源融合的构成,为训练奥里亚语专属语言模型、开展掩码语言建模与文本生成任务提供了关键数据基座。当前研究热点集中于利用此类大规模清洗语料探索低资源语言的持续预训练、跨语言知识迁移及方言鲁棒性评估,其去重与过滤策略(整体缩减37.2%)亦为语料工程实践树立了可复用的方法论标杆。该数据集的发布不仅显著缓解了奥里亚语在自然语言处理中的资源稀缺瓶颈,更对维护语言多样性、推动印度本土语言技术生态建设具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务