遇见数据集

leire-corpus

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Leire Corpus 是一个专为巴西葡萄牙语语言模型 Leire(343.7M 参数)设计的预训练语料库,模型从零开始训练于 Kaggle T4 GPU。该语料库包含约 150 亿个 token,由四个子集混合而成:70% 的葡萄牙语高质量文本(来自 GigaVerbo-v2)、15% 的 Python 代码(来自 Stack-Edu 镜像)、8% 的数学内容(来自 FineMath 的 finemath-4plus 子集)、7% 的教育性英语内容(来自 FineWeb-Edu 的 sample-10BT 子集)。数据使用自定义的 32,768 词表字节级 BPE 分词器进行分词,该分词器基于混合数据的分层抽样训练。数据以 uint16 小端序二进制分片形式存储,每个分片包含 250M token,文档由 eos 分隔。每 1000 个文档中有一个被分配到验证集。该语料库并非通用葡萄牙语语料,而是为特定实验(递归、条件记忆与诚实性相关研究)准备的燃料。各子集继承其上游来源的许可证,本仓库不添加额外限制。

The Leire Corpus is a pretraining corpus designed specifically for the Brazilian Portuguese language model Leire (343.7M parameters), trained from scratch on Kaggle T4 GPU. It contains approximately 15 billion tokens, composed of four subsets: 70% high-quality Portuguese text (from GigaVerbo-v2), 15% Python code (from Stack-Edu mirror), 8% mathematical content (from FineMaths finemath-4plus subset), and 7% educational English content (from FineWeb-Edus sample-10BT subset). The data is tokenized using a custom byte-level BPE tokenizer with a vocabulary of 32,768, trained on a stratified sample of the mixed data. The data is stored as uint16 little-endian binary shards, each containing 250M tokens, with documents separated by eos. One out of every 1000 documents is assigned to the validation set. This corpus is not a general-purpose Portuguese corpus but a fuel for specific experiments (related to recursion, conditional memory, and honesty). Subsets inherit their upstream source licenses, and this repository adds no additional restrictions.

创建时间:
2026-09-02
原始信息汇总

Leire Corpus 数据集详情

基本信息

  • 数据集名称:Leire Corpus
  • 语言:葡萄牙语(主要)与英语
  • 许可证:混合上游许可(mixed-upstream),各数据切片继承其上游来源的许可证
  • 任务类型:文本生成
  • 数据规模:100亿至1000亿 tokens(约15B tokens)
  • 用途:用于训练 Leire 模型——一个 343.7M 参数的巴西葡萄牙语语言模型,从零开始在 Kaggle T4 GPU 上训练

数据构成(混合比例)

切片 占比 来源 配置
葡萄牙语(高质量) 70% Polygl0t/gigaverbo-v2 默认
代码(Python) 15% zaydzuhri/stack-edu-python 默认,download_success=True
数学 8% HuggingFaceTB/finemath finemath-4plus
教育类英语 7% HuggingFaceFW/fineweb-edu sample-10BT

说明:代码来源原本计划使用 HuggingFaceTB/stack-edu(仅提供元数据),实际使用了上述带文本内容的镜像,该镜像包含与 Stack-Edu 相同的 25,300,000 行 Python 代码。

Tokenizer 信息

  • 采用 byte-level BPE,词表大小为 32,768
  • 基于数据混合物的 2GB 分层抽样进行训练(并非仅使用葡萄牙语)
  • 特殊标记:boseospad 以及 8 个保留标记
  • 压缩效率对比:
    • Leire tokenizer:葡萄牙语 1.692 tokens/词,代码 3.125 tokens/词
    • SmolLM2(49,152 词表):葡萄牙语 2.511,代码 3.137
    • Tucano(32,000 词表):葡萄牙语 1.620,代码 4.698
    • 该 tokenizer 在代码处理上比纯葡萄牙语 tokenizer 高效 50%

数据格式

  • 每个分片文件命名格式:{切片名}_train_{编号}.bin{切片名}_val_{编号}.bin
  • 内容为 uint16 小端序 token ID 二进制文件,文档间以 eos 分隔
  • 每个分片文件名唯一,不会被覆盖
  • 每 1000 个文档中约 1 个进入验证集(val),绝不进入训练集(train)
  • 同时提供 progress_{切片名}.json 文件记录可恢复的流水线进度

复现方法

位于项目仓库的 scripts/fase1_corpus.py 中提供完整流程:流式读取数据源 → 过滤(长度 ≥200)→ tokenization → 生成 2.5 亿 tokens 的分片 → 上传。

许可证详情

各切片的数据许可证继承自其上游来源:

  • GigaVerbo-v2 → other
  • Stack-Edu(源自 The Stack v2)→ other
  • FineMath 和 FineWeb-Edu → odc-by
  • 本仓库本身不附加额外限制

重要声明

该数据集并非通用葡萄牙语语料库,而是为特定语言模型实验(343.7M 参数规模下的递归、条件记忆与诚实性研究)专门准备的训练数据。其中代码数据的价值在于其推理能力的迁移,而非教授编程技能。

搜集汇总
数据集介绍
leire-corpus 数据集图片
构建方式
该数据集是为训练Leire模型而精心构建的预训练语料库,Leire是一个拥有3.437亿参数的巴西葡萄牙语语言模型,完全从零开始在Kaggle T4上训练。其构建过程遵循一套严谨的混合配比方案,即70%的高质量葡萄牙语文本、15%的Python代码、8%的数学内容及7%的英语教育材料,这一配比于2026年8月28日获批。为适配模型训练,研究者采用BPE分词器对约150亿个令牌进行编码,该分词器词表大小为32768,并基于混合语料的分层抽样训练而成,而非依赖单一语言的纯文本。语料以分片形式存储,每个分片包含250M个令牌的uint16二进制序列,并使用eos标记分隔文档,确保了数据的可复用性与处理效率。
使用方法
该数据集专为训练Leire模型而设计,其使用流程高度自动化,可完全复现于项目仓库中的scripts/fase1_corpus.py脚本。使用者需遵循预设的语料混合比例,通过流式下载各上游源(如GigaVerbo-v2、Stack-Edu Python镜像、FineMath与FineWeb-Edu),并应用长度过滤(不少于200个令牌)与BPE分词,最终将处理结果打包为每个250M令牌的分片文件,并上传至存储库。该数据集不适用于通用语言模型预训练,因其内容与结构高度针对Leire的实验架构,代码与数学部分旨在间接提升推理能力,而非教授编程。若需使用,建议直接采用已提供的bin分片文件,并通过eos分隔符正确处理文档边界,以适配自定义训练循环。
背景与挑战
背景概述
Leire Corpus 数据集诞生于2026年,由研究者 raulmodena 及其团队创建,旨在为巴西葡萄牙语语言模型 Leire(343.7M参数)提供预训练语料。该语料库包含约150亿个token,精心混合了70%的葡萄牙语高质量文本、15%的Python代码、8%的数学内容及7%的英语教育材料,并配套训练了自定义的32,768词元BPE分词器。其独特之处在于完全开源,不仅公开权重与代码,还公开了语料库本身,为低资源语言的大模型研究提供了宝贵资源。该数据集不仅支撑了针对递归、条件记忆等机制的特定实验,也填补了巴西葡萄牙语大规模预训练语料的空白,对推动多语言与低资源语言模型的发展具有显著意义。
当前挑战
Leire Corpus 的构建面临多重挑战。领域层面,低资源语言如巴西葡萄牙语的公开高质量文本稀缺,需从多源整合并保持比例平衡,同时代码与数学内容的加入旨在增强推理能力,但需精妙设计以避免偏离语言建模初衷。构建过程中,团队遭遇了上游数据集仅分发元数据(如Stack-Edu)而无实际文本的困境,不得不替换为镜像源并验证其一致性。此外,分词器的训练需在混合语料上进行,以平衡葡萄牙语和代码间的压缩效率,实测显示在代码上压缩率大幅提升,但同时保持PT的高效。数据流水线的实现也需处理流式加载、过滤、分词与分片存储,并确保验证集与训练集不重叠,这要求精细的工程设计与实现。
常用场景
经典使用场景
Leire Corpus作为针对巴西葡萄牙语预训练语言模型精心设计的语料库,其经典使用场景聚焦于从零训练一个约3.43亿参数规模的自回归语言模型。该语料库融合了高比例葡萄牙语文本、代码、数学推理及教育性英文内容,旨在为模型提供多维度、均衡的语言知识。研究者常利用此数据集复制或拓展Leire的训练流程,以探究在资源受限环境(如Kaggle T4 GPU)下,低资源语言模型的高效训练策略。
解决学术问题
在学术层面,Leire Corpus直面低资源语言模型预训练中数据稀缺与质量失衡的挑战。它通过构建一个包含15B tokens、混合多语言与多领域数据的语料库,为研究数据配比对模型性能的影响提供了实验基础。此外,该语料库的发布支持了关于递归机制、条件记忆及模型诚实性等前沿课题的探索,有助于解耦语言能力与推理能力,深化对小型模型能力边界与数据驱动因子的理解。
实际应用
实际应用中,Leire Corpus可用于开发面向巴西葡萄牙语的特定领域工具,例如教育辅导助手、代码辅助生成器或数学解题系统。其代码与数学数据占比虽小却关键,使基于此训练的模型能够处理逻辑推理任务,而教育性英文语料则赋予模型接触国际化知识的窗口。该数据集亦适用于多语言迁移学习研究,探索在资源受限条件下,如何利用语料配比实现跨语言能力的提升。
数据集最近研究
最新研究方向
在低资源语言模型构建领域,Leire语料库的发布标志着针对巴西葡萄牙语的预训练数据资源迈入精细化与透明化的新阶段。该语料库以约150亿token的规模,精心调配了葡萄牙语、代码、数学及教育类英语的比例,尤其通过自定义32,768词表的分词器,在代码理解上实现了相较于单一语言分词器高达50%的效率提升,这为多语言混合训练提供了全新视角。其开源策略不仅涵盖模型权重,更完整披露语料配方与数据流水线,呼应了当前对大模型数据可复现性与伦理透明度的迫切要求。此举有望推动葡语NLP社区在资源受限环境下开展更具挑战性的递归与记忆机制探索,为构建诚实、高效的小规模语言模型奠定数据基础,同时也对预训练语料构建中许可合规与数据溯源实践树立了新的参考标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务