遇见数据集

pustaka

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Pustaka是一个由MEA Ecosystem开发的大规模开放文本语料库,初始专注于印尼语,后扩展为包含多语种和多模态数据的资源库。印尼语部分整合了来自CulturaX、Indo4B、CC-News、Wikipedia、Kaskus论坛以及Kamus Alay俚语词典等多种高质量公开来源,经过严格的清洗管道(语言检测、长度过滤、模板/垃圾检测和精确去重)后,总计约4340万篇文档,约703亿字符。此外,语料库还包含:一个多语言源代码语料库(7.66GB),涵盖Python、JavaScript、TypeScript、HTML、CSS、Java、Go、C++、Rust和SQL共10种编程语言,仅保留宽松许可证且包含文档注释的文件;一个数学推理语料库(约86万道英文题目),包含GSM8K和NuminaMath-CoT,以JSONL格式存储,保留问题、解答和答案结构化字段;一个指令对话语料库(约56.7万条指令),包含英语的Dolly和OIG子集以及印尼语的Alpaca-cleaned-Indonesian,同样以JSONL格式存储。Pustaka还提供一个基于BPE的分词器(词汇量64000),专用于标准化统计token数量。数据集适用于语言模型预训练、NLP研究、指令微调、代码生成和数学推理等任务。所有子集遵循其上游许可,使用时需注意各自的许可证限制。

创建时间:
2026-09-03
搜集汇总
数据集介绍
pustaka 数据集图片
构建方式
Pustaka语料库依托MEA Ecosystem的开放数据理念,以印尼语为核心,整合多源公开文本构建而成。其构建流程遵循严格的清洗管线:先经由fastText语言检测筛选置信度不低于0.65的印尼语文本,继以文档长度过滤剔除过短或超长内容,再经符号比率、大写比率及重复行检测去除模板与垃圾信息,最终采用xxhash64哈希进行跨源精确去重。数据来源涵盖CulturaX、Indo4B、CC-News、维基百科、Kaskus论坛及Kamus Alay俚语词典,并延展至多语言代码、数学推理与指令对话语料,形成逾4340万文档、约703亿字符的复合型资源。
特点
该语料库以多语种、多模态的结构化组织为显著特征。除印尼语文本外,还包含7.66 GB的十种编程语言代码子集,要求宽松许可证且必须存在文档注释;数学推理由GSM8K与NuminaMath-CoT构成约86万道英文推理题,以JSONL格式保留问答三元组;指令对话部分则集成Dolly、Alpaca印尼语版与OIG,形成约56.7万条双语指令。所有文本子集均以.gz压缩的逐行文档存储,俚语词典采用TSV格式,并附带BPE分词器作为可复现的计量工具,整体兼顾预训练、指令微调与推理评测之需。
使用方法
数据集通过Hugging Face平台开放获取,使用者可借助datasets库以流式模式加载单一子集,例如指定Wikipedia印尼语路径并设定streaming为真即可迭代读取文本。对于Kamus Alay等小型文件,则可通过hf_hub_download获取后以pandas按制表符解析。代码、数学与指令子集分别存储于corpus-code、corpus-math及corpus-instruct目录,对应格式为逐行代码文本或JSONL记录,便于按需抽取。附带的BPE分词器vocab规模为64000,专用于统计全库token数量,并不面向生产模型,使用者应遵循各子集原始许可证,商用前须逐一核查。
背景与挑战
背景概述
印度尼西亚语作为东南亚地区使用人口逾两亿的重要语言,长期面临高质量开源预训练语料匮乏的困境,制约了该语言自然语言处理研究的纵深发展。Pustaka数据集由MEA Ecosystem机构的Evan(M. Evan Almunawar)主导构建,于Hugging Face平台公开发布,汇集CulturaX、Indo4B、维基百科、CC-News及Kaskus论坛等多源异构文本,经统一清洗管道处理后形成约4340万篇文档、逾700亿字符的大规模语料。该数据集不仅填补了印尼语开放语料的空白,更通过整合代码、数学推理与指令对话等多元子集,为多语言模型预训练与跨领域迁移研究提供了综合性基础设施,对推动东南亚低资源语言NLP生态建设具有深远影响。
当前挑战
该数据集所直面的核心领域问题在于印尼语及多语言预训练语料在规模、质量与多样性之间的结构性失衡,具体表现为网络爬取文本普遍夹杂噪音、模板化内容与重复片段,严重削弱模型学习的有效性。构建过程中的挑战同样错综复杂:多源异构数据的许可兼容性需逐一甄别,语言检测在印尼语与马来语等近缘语言间的边界模糊易致误判,跨源精确去重需在超大规模语料上兼顾计算效率与召回精度,而俚语词典与论坛文本的非规范表达进一步加剧了清洗难度。此外,代码与数学推理子集涉多语言混合、结构化格式保持及许可过滤等特殊要求,如何在质量筛选与语料多样性之间取得审慎平衡,构成持续存在的技术难题。
常用场景
经典使用场景
在自然语言处理领域,面向低资源语言的预训练语料库长期匮乏,Pustaka的诞生恰如甘霖之于旱土,为印尼语及多语言语言模型的预训练提供了坚实的数据基石。其最经典的使用场景在于以自回归语言建模为核心的预训练任务,研究者借助包含约4340万篇文档、逾703亿字符的庞大语料,训练具备印尼语理解与生成能力的基座模型,亦可将其与英语、日语、中文、韩语等多语种资源混合,构建跨语言迁移能力突出的多语言模型。此外,配套的BPE分词器为全语料库的token计量提供了可复现的标准化工具,使得不同研究之间的预训练成本与规模得以横向比较。
衍生相关工作
Pustaka的发布催生了一系列围绕印尼语及多语言建模的衍生研究。基于其语料训练的印尼语预训练模型在情感分析、命名实体识别、机器翻译等任务上展现出优于通用多语言模型的性能表现。其`corpus-instruct`子集为印尼语指令微调研究提供了标准化数据,推动了Alpaca风格模型在东南亚语言上的复现与改进。`corpus-math`中的GSM8K与NuminaMath子集则被用于数学推理能力的跨语言迁移实验,探索英语推理数据向印尼语模型的能力注入。此外,该语料库的多语言标签体系亦为跨语言检索与低资源语言对齐研究提供了新的实验素材。
数据集最近研究
最新研究方向
在东南亚低资源语言模型竞相发展的背景下,Pustaka作为面向印尼语及多语言的大规模开放语料库,其前沿研究方向集中于以数据为中心的预训练范式革新:一方面通过融合网络爬取、百科、新闻、论坛及俚语词典等多源异构文本,并借助语言检测、模板去噪与跨源精确去重等精细清洗流程,构建可复现、可量化的印尼语预训练基准;另一方面,该数据集前瞻性地将代码、数学推理与指令对话等结构化语料纳入同一开放体系,推动多语言模型在代码生成、思维链推理与指令遵循等能力上的联合研究。这一方向呼应了当前开放语料治理与多任务预训练融合的热点,为印尼语及东南亚语言社区的模型公平性与可复现性提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务