遇见数据集

dataseek/ptbr-wiki

收藏
Hugging Face2026-05-12 更新2026-05-31 收录
官方服务:

资源简介:

PT-BR维基百科(已清理,仅百科全书)数据集是MagTina350m预训练语料库的一部分,包含108万篇巴西葡萄牙语维基百科文章。这些文章经过清理,去除了维基标记、模板、用户讨论欢迎横幅(如“Bem-vindo, X!”)、VfD投票讨论、eliminação通知模板、JS/CSS小工具页面和讨论页对话(通过内联HHhMMmin时间戳检测)。原始银层数据中有35%的MediaWiki内部内容被丢弃。该数据集在MagTina350m预训练中使用了约2个周期。清理过程包括:使用mwparserfromhell处理维基百科转储、去除模板和引用、NFKD标准化、通过langid=pt语言门控(捕捉错误的英语/西班牙语条目)、设置200字符的最小长度,以及v3清理过程(丢弃欢迎横幅、VfD投票、讨论页时间戳签名、eliminação通知模板和小工具JS/CSS页面)。数据集用于巴西葡萄牙语语言模型的预训练、继续预训练或领域适应,也可用于需要统计代表性公共网络/学术/法律/百科全书数据的巴西葡萄牙语NLP研究。数据集遵循CC-BY-SA 4.0许可。

--- 许可证:CC-BY-SA-4.0 语言: - pt 数据集名称:巴西葡萄牙语维基百科(已清洗,仅保留百科内容) 规模类别: - 100万 < 条目数 < 1000万 任务类别: - 文本生成 标签: - pt-br - 巴西葡萄牙语 - 维基百科 - 百科全书 - 预训练 配置: - 配置名称:default 数据文件: - 拆分:train 路径:data/*.parquet(帕奎特文件格式) --- # 巴西葡萄牙语维基百科(已清洗,仅保留百科内容) 本数据集是[Dataseek](https://dataseek.com.br)以Magestic.ai品牌发布的**MagTina350m预训练语料库**的一部分,是支撑`dataseek/magtina350m-base`模型训练的9个银级数据集之一。 ## 数据集概览 包含108万篇巴西葡萄牙语维基百科文章,已移除维基标记语言(wiki-markup)、模板、用户讨论页欢迎横幅("Bem-vindo, X!")、删除投票(VfD)讨论、删除通知模板、JS/CSS小工具页面以及讨论页会话(通过行内HHhMMmin时间戳识别)。原始银级数据中有35%因属于MediaWiki内部内容被剔除。该数据集在MagTina350m预训练中被使用约2个训练轮次(epoch)。 ## 来源与采集方法 数据来源:巴西葡萄牙语维基百科快照(2026年中版本),处理流程为:使用mwparserfromhell工具 → 剥离模板与引用 → 执行NFKD标准化 → 通过语言识别(langid='pt')筛选(过滤误标为英语/西班牙语的条目) → 过滤长度不足200字符的内容 → **2026年5月12日的第三次清洗流程(详见`scripts/release/cleanup_and_export_wiki.py`),该步骤进一步移除欢迎横幅、删除投票ballot、讨论页时间戳签名、删除通知模板以及小工具JS/CSS页面**。 **抽取-转换-加载(ETL)脚本(存放于MagTina1B仓库):** [`scripts/etl/recover_wikipt_cleaned.py`](https://huggingface.co/dataseek/magtina350m-base)(ETL脚本的公开发布已纳入规划,在此之前,下文的数据卡片将完整记录数据处理流程)。 ## 过滤与去重 在该数据集达到银级(可发布)状态前,已应用以下过滤规则: - 剥离维基模板、引用与信息框(初始ETL流程) - 使用FastText进行语言识别,筛选为葡萄牙语(langid='pt') - 第三次清洗:22种模式过滤器,覆盖欢迎横幅、讨论页、删除投票、删除通知、小工具JS/CSS以及重定向页面 - 行内`HHhMMmin de DD de MMM de YYYY`时间戳过滤器(覆盖未被前述规则处理的所有讨论页会话内容) - 文本长度≥200字符(银级筛选门槛,清洗流程中保留该规则) 对所有网页来源语料库(`webpages`、`news`、`blogs`)执行全局URL标准化去重,确保同一文章不会在这三个数据集内重复出现。 ## 数据结构 | 列名 | 数据类型 | 描述 | |---|---|---| | `id` | `int32` | 维基百科页面ID。 | | `text` | `string` | 清洗后的文章文本(已移除v2版模板冗余内容)。 | | `n_chars` | `int32` | `text`的字符总数。 | | `n_words` | `int32` | `text`按空格拆分后的单词总数。 | 导出时被移除的列(作为ETL内部细节保留为私有):`_part` ## 规模统计 | 指标 | 数值 | |---|---:| | 条目数 | 108万(1,084,716) | | 字符数 | 26.2亿(2,615,639,056) | | 预估Token数(巴西葡萄牙语,按字符数/4.5计算) | 5.8125亿 | | 磁盘上的压缩Parquet(帕奎特)文件大小 | 约1.46 GB | *采样约2.8个训练轮次(epoch)* — 该银级语料库包含5.8125亿个唯一Token,其中16.01亿个Token被用于MagTina350m的单次预训练流程。 **在MagTina350m预训练中的使用量**:16.01亿个Token,占MagTina350m总预训练Token预算(173.9亿个Token)的9.2%。 ## 加载方法 python from datasets import load_dataset ds = load_dataset("dataseek/ptbr-wiki", split="train", streaming=True) for row in ds.take(5): print(row["text"][:200]) 推荐对较大的配置使用流式加载。对于较小的数据集(如`ptbr-dou`、`ptbr-books-publicos`),可直接使用非流式加载。 ## 许可协议 CC-BY-SA 4.0协议:继承自维基百科的许可协议。任何包含本数据集的衍生作品必须采用兼容CC-BY-SA的许可协议。 **上游来源署名**:维基媒体基金会(Wikimedia Foundation),来源地址:https://dumps.wikimedia.org/ptwiki/;根据CC-BY-SA 4.0协议,个人贡献者保留其作品的版权。 ## 引用方式 若您使用本数据集,请同时引用上游来源与MagTina350m项目: bibtex @misc{magtina350m_pretrain_2026, title = {MagTina350m pretrain corpus — PT-BR Wikipedia (cleaned, encyclopedia only)}, author = {Frasson, Ricardo and {Dataseek Team}}, year = 2026, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/dataseek/ptbr-wiki} } 同时请遵守上游许可协议条款:对于基于CC-BY协议的数据,必须向上游创作者署名;对于CC-BY-SA协议的数据,下游衍生作品必须采用兼容CC-BY-SA的许可协议。 ## 预期用途 - 巴西葡萄牙语大语言模型的预训练、续预训练或领域自适应 - 需求具有统计代表性的公开网页、学术、法律或百科数据的巴西葡萄牙语自然语言处理(NLP)研究 - 复现或优化MagTina350m模型的训练结果 ## 已知局限性与个人可识别信息(PII)声明 - **未对文本执行个人可识别信息(PII)清洗**:源数据中出现的URL、电子邮件、电话号码与个人姓名可能仍保留在数据集中。我们仅移除了零宽字符并对Unicode进行标准化,但未执行命名实体识别(NER)流程。 - **爬取数据带有上游来源的偏见**:本数据集包含来自CommonCrawl、维基百科、新闻机构与学术机构的数据,因此带有这些来源的固有偏见,我们未对这些偏见进行审计。 - **仅应用了基础安全过滤**:除语言识别与基本字符比例筛选外,未进行额外的安全过滤。源数据中的仇恨言论、垃圾信息与成人内容可能仍保留,除非被意外过滤。 - **保留每条数据的来源溯源**:每条数据均包含`url`、`source`或`doc_id`列,可追溯至上游来源。该设计为有意为之,以便使用者可以重新授权、编辑或过滤数据。 ## 相关发布项目 - **模型**:[`dataseek/magtina350m-base`](https://huggingface.co/dataseek/magtina350m-base)(参数量3.546亿,基于本数据集与8个同源数据集预训练) - **指令微调模型**:[`dataseek/magtina350m-instruct`](https://huggingface.co/dataseek/magtina350m-instruct) - **同源数据集**:所有9个语料库均可通过搜索`dataseek/ptbr-*`获取 ## 许可协议 [CC-BY-SA-4.0](https://spdx.org/licenses/cc-by-sa-4.0.html)

提供机构:
dataseek
二维码
社区交流群
二维码
科研交流群
商业服务