遇见数据集

hplt

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

HPLT Indic Language Corpus 是一个多语言印度语料库,源自 HPLT Monolingual Dataset 3.0,由 CoRover 整理并托管,专为大规模生成式语言模型预训练和多语言自然语言处理研究设计。该数据集包含 12 种印度语言的原始网页文本数据,每种语言对应一个独立的拆分(split),覆盖孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、曼尼普尔语、奥里亚语、旁遮普语、泰米尔语、泰卢固语和乌尔都语,并采用各自的标准书写系统。每个样本包含丰富的元数据字段,如文本内容、语言标识、来源URL、时间戳、文档质量分数、去重信息、过滤标签、个人身份信息标记、以及21维的网页注册类别得分等。数据规模庞大,适用于因果语言建模、多语言模型训练、低资源语言研究、分词器开发等任务。数据来源于Common Crawl和Internet Archive等大规模网页抓取,经过HPLT处理流水线(包括文本提取、语言识别、质量过滤、去重等)生成。许可协议为CC0,但用户需自行评估底层网页内容的版权和合规性。

HPLT Indic Language Corpus is a multilingual Indian corpus derived from HPLT Monolingual Dataset 3.0, curated and hosted by CoRover, designed for large-scale generative language model pretraining and multilingual natural language processing research. The dataset contains raw web text data in 12 Indian languages, each with a separate split, covering Bengali, Gujarati, Hindi, Kannada, Malayalam, Marathi, Manipuri, Odia, Punjabi, Tamil, Telugu, and Urdu, using their respective standard writing systems. Each sample includes rich metadata fields such as text content, language identifier, source URL, timestamp, document quality score, deduplication information, filtering labels, personally identifiable information marks, and 21-dimensional web registration category scores. The data scale is large, suitable for tasks such as causal language modeling, multilingual model training, low-resource language research, and tokenizer development. The data originates from large-scale web crawls like Common Crawl and Internet Archive, processed through the HPLT pipeline (including text extraction, language identification, quality filtering, deduplication, etc.). The license is CC0, but users need to evaluate the copyright and compliance of the underlying web content themselves.

创建时间:
2026-08-25
原始信息汇总

HPLT 印度语言语料库

数据集概述

该数据集由 CoRover 整理并托管,包含从 HPLT 单语数据集 3.0 中精选的印度语言数据,专为大规模生成式语言模型预训练和多语言 NLP 研究设计。数据集包含多个印度语言及其文字的原始 HPLT 数据。

语言覆盖

数据集涵盖 12 种印度语言,具体如下:

语言 语言代码 文字 目录
孟加拉语 ben 孟加拉文 ben_Beng_raw
古吉拉特语 guj 古吉拉特文 guj_Gujr_raw
印地语 hin 天城文 hin_Deva_raw
卡纳达语 kan 卡纳达文 kan_Knda_raw
马拉雅拉姆语 mal 马拉雅拉姆文 mal_Mlym_raw
马拉地语 mar 天城文 mar_Deva_raw
曼尼普尔语 mni 孟加拉文 mni_Beng_raw
奥里亚语 ory 奥里亚文 ory_Orya_raw
旁遮普语 pan 古木基文 pan_Guru_raw
泰米尔语 tam 泰米尔文 tam_Taml_raw
泰卢固语 tel 泰卢固文 tel_Telu_raw
乌尔都语 urd 阿拉伯文 urd_Arab_raw

数据格式

每条数据记录包含以下字段:

  • f: 字符串类型
  • o: 整数类型
  • s: 整数类型
  • rs: 整数类型
  • u: 字符串类型
  • c: 字符串类型
  • ts: 时间戳类型
  • de: 字符串类型
  • crawl_id: 字符串类型
  • lang: 字符串序列
  • prob: 浮点数序列
  • text: 字符串类型(文档文本)
  • xml: 字符串类型
  • html_lang: 字符串序列
  • cluster_size: 整数类型
  • seg_langs: 字符串序列
  • id: 字符串类型
  • filter: 字符串类型
  • pii: 整数序列的序列
  • doc_scores: 浮点数序列
  • web-register: 包含 25 个浮点数子字段的结构体

预期用途

该数据集适用于以下场景:

  • 生成式语言模型预训练
  • 因果语言建模
  • 多语言语言模型训练
  • 印度语言模型训练
  • 继续预训练
  • 文本生成
  • NLP 研究
  • 分词器开发
  • 跨语言建模
  • 低资源语言研究

数据来源与处理

数据来源于 HPLT(高性能语言技术) 项目的 HPLT 单语数据集 3.0,主要基于大规模网络爬取数据(包括 Common Crawl 和 Internet Archive)。处理流程包括:

  • 文本提取
  • 语言识别
  • 质量过滤
  • 去重
  • 文档处理
  • 语言/文字分类

质量与使用建议

数据集中包含质量相关信息,用户在生产环境中进行模型训练时,可额外执行以下操作:

  • 语言过滤
  • 质量过滤
  • 文档去重
  • 领域过滤
  • 文本标准化
  • 文字验证
  • 有害性与安全性过滤

推荐的使用步骤:解压数据分片 → 提取文本 → 语言与文字验证 → 去重 → 质量过滤 → 文本标准化 → 分词 → 转换为训练格式。

许可与声明

  • 数据集打包采用 CC0 许可
  • 底层文本来源于网络,可能受原始内容的权利、许可、服务条款等限制
  • 用户需自行评估数据是否适用于其特定用途

引用

如使用该数据集,请引用 HPLT 项目:

bibtex @misc{hplt, title = {HPLT Monolingual Datasets}, author = {HPLT}, url = {https://hplt-project.org/datasets/v3.0} }

搜集汇总
数据集介绍
hplt 数据集图片
构建方式
HPLT Indic Language Corpus由CoRover基于HPLT Monolingual Dataset 3.0精选构建,涵盖孟加拉语、古吉拉特语、印地语等12种主要印度语言及其相应文字系统。数据源自Common Crawl和Internet Archive的大规模网络爬取,经过文本提取、语言识别、质量过滤、去重及文档处理等严谨流程,最终以JSONL格式按语言-文字划分存储,每个样本附带丰富的元数据,包括语言概率、来源URL、时间戳及质量评分等。
特点
该数据集专为大规模生成式语言模型预训练设计,支持因果语言建模与多语言研究。其特色在于提供了详尽的质量相关字段,如文本分数、语言识别置信度、网络注册类型分布,以及文档级PII标记,便于用户按需进行精细筛选。此外,涵盖多个低资源印度语言,为跨语言模型与分词器开发提供了宝贵资源。数据以CC0许可证发布,确保广泛的可复用性。
使用方法
使用时,用户可根据需求解压相应的语言分片,提取文本字段,并应用额外的语言验证、去重、质量过滤及文本规范化步骤。建议结合语言采样或加权策略,以平衡不同语料规模。数据可直接用于语言模型预训练、继续训练、文本生成及分词器训练,也支持低资源语言研究。用户需注意原始网页内容的版权与使用限制,并自行评估合规性。
背景与挑战
背景概述
HPLT Indic Language Corpus是由CoRover于近期发布的,源自HPLT Monolingual Dataset 3.0的多语种语料库,专为生成式语言模型预训练及多语种自然语言处理研究而设计。该数据集覆盖12种主要印度语言及其常用文字系统,包括孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、曼尼普尔语、奥里亚语、旁遮普语、泰米尔语、泰卢固语和乌尔都语,为低资源语言研究提供了大规模数据基础。其创建旨在应对印度语言在互联网资源中的稀缺性,通过整合Common Crawl和Internet Archive等大规模网络爬虫数据,采用精细化处理流程,包括文本提取、语言识别、质量过滤及去重,确保了数据的高质量和多样性。该语料库的发布对推动印度语言的生成式AI模型发展、跨语言建模及tokenizer开发具有重要影响,为多语种语言模型在资源和人口多样性上的均衡发展提供了关键支持。
当前挑战
该数据集面临的首要挑战是领域内数据稀缺与不平衡问题。印度语言众多,但各语言在互联网上的资源分布极不均衡,导致部分低资源语言(如曼尼普尔语、奥里亚语)的数据量远低于高资源语言(如印地语、孟加拉语),这直接影响多语种模型的训练效果和公平性。构建过程中的挑战尤为显著,包括从海量网络爬虫数据中精准识别和分离多种印度语言文本,处理复杂文字系统(如天城文、孟加拉文)的变体和拼写差异,以及实施高效的跨语言去重和内容质量评估。此外,原始web数据中可能存在的个人信息、有害内容及版权问题,要求构建者设计严格的安全过滤机制,同时保持数据代表性,确保合法合规用于模型训练。数据集的封装遵循CC0协议,但底层文本的第三方权利仍需用户自行评估,这为实际应用增添了额外合规负担。
常用场景
经典使用场景
HPLT Indic Language Corpus作为源自海量网络抓取的高质量多语种语料库,其经典使用场景集中于大型语言模型的预训练与因果语言建模。该数据集覆盖12种主要印度语言及其对应文字体系,为训练多语种生成式模型提供了丰富且均衡的数据资源。研究者常利用其原始文本进行去重、质量过滤及文本规范化后,直接用于模型的自回归训练目标,以提升模型对印度语言的理解与生成能力。此外,该数据集亦适用于tokenizer的开发与优化,通过其文本分布特性训练出高效的分词器,从而支撑跨语言模型的构建与低资源语言的持续预训练任务。
衍生相关工作
该数据集的发布催生了一系列衍生工作,包括多语种预训练模型的微调与适配、基于印度语言的评测基准构建,以及针对低资源语言的持续预训练方法研究。研究者基于此语料库训练出多个印度语系语言模型,并进一步探索了跨语言迁移学习、多任务学习及提示工程等前沿技术。此外,该数据集也促进了专用tokenizer的开发,以及面向印度语言的安全过滤与文本规范化工具,这些衍生成果共同构成了一套完整的印度语NLP研究生态,推动了相关领域的研究进程。
数据集最近研究
最新研究方向
在生成式语言模型迅猛发展的当前阶段,高质量多语种语料资源的构建成为推动多语言人工智能技术落地的关键要素。HPLT Indic Language Corpus以其覆盖印度次大陆12种主要语言及多种文字的宏大规模,为低资源语言的自然语言处理研究提供了前所未有的数据支撑。该语料源自海量网络爬虫数据,经由精细的语言识别、质量过滤与去重流程处理,确保了训练语料的纯净度与多样性。当前研究前沿聚焦于利用此类大规模语料进行跨语言预训练、持续预训练及多语言分词器的开发,旨在突破低资源语言模型性能瓶颈,促进语言技术的普惠发展。该数据集的出现,不仅有助于缓解特定语料匮乏的困境,更为构建真正多语言、多文化包容的人工智能系统奠定了坚实基础,其开源共享的精神亦将加速全球范围内印度诸语言自然语言处理研究的创新与合作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务