遇见数据集

Itau-Unibanco/Aurora-PT

收藏
Hugging Face2026-07-03 更新2026-05-10 收录
官方服务:

资源简介:

Aurora-PT是一个为葡萄牙语大型语言模型训练设计的精选语料库。现有研究大多集中在英语和汉语等高资源语言,并致力于开发多语言语料库,但开发低资源语言的大型数据集需求迫切。该工作旨在缩小这一差距,促进葡萄牙语最先进研究的发展。据我们所知,Aurora-PT是最大的公开单语葡萄牙语语料库,超越了所有先前资源。最终语料库是Itaú Unibanco和Itaú-Unibanco科学技术研究所(ICTi)研究人员共同工作的成果,其构建细节在论文“NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus”(PROPOR 2026)中描述。数据集开发者:Itaú Unibanco和Itaú-Unibanco科学技术研究所(ICTi)。数据集构建架构:受FineWeb v1的流程启发,但关键区别在于聚合了九个葡萄牙语或多语言数据集(CC100、mOSCAR、Aya、FineWeb v2、Blogset-br、Aroeira、mC4、Wikipedia和HPLT 2.0),而非仅依赖Common Crawl转储。预处理流程包括多个阶段:使用GlotLID进行语言过滤(葡萄牙语阈值0.799)、通过MinHash进行去重(14个桶中的112个哈希)、基于C4的质量启发式规则和FineWeb特定质量规则。所有处理步骤均使用Hugging Face的DataTrove库实现。支持语言:巴西葡萄牙语(PT-BR)和葡萄牙语(PT-PT)。数据集发布日期:2026年。状态:Aurora-PT包含约855 GB(未压缩)、2.649亿个文档和3310亿个令牌(GPT-2分词)/2260亿个令牌(语料训练分词器)。

Aurora-PT is a curated corpus designed for training large language models in the Portuguese language. Most existing research focuses on high-resource languages like English and Chinese, with considerable efforts made to develop multilingual corpora. However, there is a pressing need to develop large datasets for lower-resource languages. This work aims to make this gap smaller, contributing to the development of state-of-the-art research in Portuguese. Aurora-PT is, to our knowledge, the largest openly available monolingual Portuguese corpus, surpassing all previous resources. The final corpus is a result of the combined work of researchers at Itaú Unibanco and the Instituto de Ciência e Tecnologia Itaú-Unibanco (ICTi), and the details about how it was made are described in the paper "NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus" (PROPOR 2026). Dataset developer: Itaú Unibanco and Instituto de Ciência e Tecnologia Itaú-Unibanco (ICTi). Dataset Creation Architecture: The construction of Aurora-PT was inspired by the pipeline used in FineWeb v1, with a key distinction: instead of relying solely on Common Crawl dumps, nine Portuguese or multilingual datasets annotated by language were aggregated (CC100, mOSCAR, Aya, FineWeb v2, Blogset-br, Aroeira, mC4, Wikipedia, and HPLT 2.0). The preprocessing pipeline comprised several stages: language filtering using GlotLID (threshold 0.799 for Portuguese), deduplication via MinHash (112 hashes across 14 buckets), C4-based quality heuristics, and FineWeb-specific quality rules. All processing steps were implemented using the DataTrove library from Hugging Face. Supported languages: Brazilian Portuguese (PT-BR) and Portuguese (PT-PT). Dataset Release Date: 2026. Status: Aurora-PT contains approximately 855 GB (uncompressed), 264.9 million documents, and 331 billion tokens (GPT-2 tokenization) / 226 billion tokens (corpus-trained tokenizer).

提供机构:
Itau-Unibanco
搜集汇总
数据集介绍
Itau-Unibanco/Aurora-PT 数据集图片
构建方式
Aurora-PT的构建灵感源自FineWeb v1的数据处理管线,但创新性地摒弃了对Common Crawl单一数据源的依赖。研究团队整合了CC100、mOSCAR、Aya、FineWeb v2、Blogset-br、Aroeira、mC4、Wikipedia与HPLT 2.0这九个经语言标注的葡萄牙语或多语数据集。预处理流程精密而严苛:首先借助GlotLID语言识别工具(葡萄牙语阈值设为0.799)进行精准的语言筛选,继而通过MinHash算法(采用112个哈希函数与14个桶)实施去重处理,最后结合C4质量启发式规则与FineWeb专属质量标准进行内容净化。所有计算环节均依托Hugging Face的DataTrove库高效实现,最终孕育出这一规模空前的高质量葡萄牙语单语语料库。
特点
Aurora-PT作为迄今公开可用的最大葡萄牙语单语语料库,展现出多项卓越特性。其体量惊人,压缩前约855GB,囊括2.649亿份文档与3310亿个GPT-2分词标记,全面超越GigaVerbo、FineWeb-2等既有资源。语料覆盖巴西葡萄牙语与欧洲葡萄牙语两种变体,确保了语言地域多样性的充分体现。数据以Apache Parquet格式高效存储,每条记录均包含唯一标识符、纯文本内容、来源元数据及原始URL,结构规范且扩展性优异。源数据集标识清晰可溯,为研究者提供了灵活筛选与追溯的便利。
使用方法
研究者可通过Hugging Face的datasets库便捷调用Aurora-PT,仅需执行`load_dataset("Itau-Unibanco/Aurora-PT")`即可快速加载完整训练集。数据以Parquet格式组织,通过定义明确的schema(id、text、metadata、url四字段)简化了后续解析与预处理流程。该语料库专为非商业研究用途设计,适用于葡萄牙语大语言模型预训练、跨语言迁移学习及多语实验等场景。使用时需注意遵守CC-BY-NC-SA 4.0许可协议,并建议引用相关论文以尊重开发者贡献。
背景与挑战
背景概述
在自然语言处理领域,大规模预训练语言模型的发展高度依赖于高质量、大规模的训练语料库,然而这一资源分布极不均衡,英语和中文等“高资源语言”拥有丰富的数据集,而葡语等“低资源语言”则长期面临语料匮乏的困境,严重制约了其语言技术的研究与进步。为弥合这一差距,Itaú Unibanco与Instituto de Ciência e Tecnologia Itaú-Unibanco(ICTi)的研究团队于2026年联合发布了Aurora-PT数据集,该成果发表于PROPOR 2026会议论文《NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus》中。Aurora-PT是目前公开可用的最大规模单语葡语语料库,融合了CC100、mOSCAR、Aya、FineWeb v2、Blogset-br、Aroeira、mC4、Wikipedia及HPLT 2.0等九个标注数据集,经语言过滤(GlotLID)、MinHash去重、C4质量启发式及FineWeb规则等多阶段精炼管道构建而成,总计约855GB、264.9百万文档及3310亿令牌(GPT-2分词),为葡语自然语言处理研究提供了前所未有的数据基础,有力推动了低资源语言领域的前沿探索。
当前挑战
Aurora-PT所解决的核心领域问题在于低资源语言(葡语)大规模语料的稀缺性,现有研究多集中于英语、中文等语言,导致葡语大语言模型的训练与性能提升严重受阻,构建高质量的单语语料库成为突破瓶颈的关键。在数据构建过程中,团队面临多重挑战:首先,需从九个异质数据源(如通用爬虫数据与专业语料)中有效聚合,确保数据多样性与覆盖度;其次,语言过滤环节需精确识别并保留葡语文本(阈值0.799),避免其他语言污染;再次,大规模去重采用MinHash算法(112哈希/14分桶),在确保计算效率的同时最大限度消除冗余;最后,质量规则(C4启发式与FineWeb规则)的应用需在自动化与潜在误删之间取得平衡,尽管经过样本验证,仍无法完全排除少量噪声与版权风险,这要求使用者在实际应用中自行审查与过滤。
常用场景
经典使用场景
在自然语言处理领域,语料库的规模与质量直接决定了语言模型的性能边界。作为迄今规模最大的开源葡萄牙语单语语料库,Aurora-PT 汇聚了来自 CC100、mOSCAR、Wikipedia 等九个高质量数据源的约 855 GB 文本,经过精密清洗与去重后形成 3310 亿个令牌的庞大数据集。其核心应用场景在于预训练面向葡萄牙语的深度语言表征模型,尤其是以掩码语言建模为主的自监督学习任务,为后续的微调与迁移学习提供坚实的数据底座。
衍生相关工作
Aurora-PT 的出现催生了一系列具有里程碑意义的学术产出,其中最具代表性的当属论文《NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus》。该工作不仅详细阐述了语料库的构建方法与管道(基于 FineWeb v1 流程的改进),更直接利用了 Aurora-PT 训练出当前最先进的葡萄牙语 ModernBERT 模型,其在多项下游任务中的卓越表现验证了数据集的效用。此外,该语料库还为多语言对比研究、迁移学习以及低资源语言数据增强等前沿方向提供了标准化的实验基准。
数据集最近研究
最新研究方向
针对葡语等低资源语言,Aurora-PT数据集的前沿研究方向聚焦于构建迄今规模最大的纯葡语单语语料库,以弥合葡语与英语、汉语等丰富资源语言之间显著的数据鸿沟。研究团队创新性地融合了来自九个不同来源的葡语及多语言数据集,并借鉴FineWeb v1的管道架构,通过严格的语种过滤、MinHash去重以及多重质量启发式规则,构建出约855GB、含3310亿个词元的清洗语料。这一资源直接支撑了专门面向葡语的ModernBERT模型训练,显著推动了非英语大语言模型的本土化发展,为葡语自然语言处理领域树立了里程碑,并催生了关于数据质量与模型性能关联性的系列探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务