遇见数据集

sample_sanskrit_pile

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Sanskrit Pile v0 是一个面向梵语大语言模型(1B-3B规模概念验证)持续预训练的、分词器无关的可流式原始预训练语料库。该数据集包含约142.9万份文档,总计约61.9亿个字符,按平均每token约4字符估算,约合15.5亿token。数据以分片Parquet格式(zstd压缩)存储,采用类似FineWeb的风格。所有文本均使用天城文书写,并已通过`indic-transliteration`工具进行了IAST/SLP1/ITRANS标准化转写。数据集包含六个字段:唯一文档标识符(id)、未经任何分词处理的原始梵文文本(text)、数据来源标识(source)、原始URL(url)、文本字符长度(char_length)以及标准化前的原始文字脚本(raw_script)。数据主要来源于GRETIL、Sanskrit etexts、Digital Corpus of Sanskrit、Sanskrit Wikisource以及AI4Bharat Sangraha的已验证/未验证/合成梵语子集。其核心设计理念遵循The Pile/FineWeb方法:保持分词器无关性,支持任意BPE/WordPiece/词法分词器在此数据上进行训练;采用无损优先原则,当文字转换失败时保留原始文本;作为原始转储版本,有意保留了部分英文噪声和重复内容,精细清洗工作将留待v1版本在首个可读模型产出后进行。数据集许可证取决于各原始来源,此处仅为研究目的汇总。

Sanskrit Pile v0 is a tokenizer-agnostic, streamable raw pre-training corpus for continuous pre-training of Sanskrit large language models (proof-of-concept at 1B-3B scale). The dataset contains approximately 1.429 million documents, totaling about 6.19 billion characters, estimated at about 1.55 billion tokens based on an average of 4 characters per token. Data is stored in sharded Parquet format (zstd compressed), following a style similar to FineWeb. All text is written in Devanagari script and has been standardized through the `indic-transliteration` tool into IAST/SLP1/ITRANS transliterations. The dataset includes six fields: unique document identifier (id), raw Sanskrit text without any tokenization (text), data source identifier (source), original URL (url), text character length (char_length), and raw script before standardization (raw_script). Data is primarily sourced from GRETIL, Sanskrit etexts, Digital Corpus of Sanskrit, Sanskrit Wikisource, and the verified/unverified/synthetic Sanskrit subsets of AI4Bharat Sangraha. Its core design philosophy follows The Pile/FineWeb approach: maintaining tokenizer-agnosticism to support training with arbitrary BPE/WordPiece/lexical tokenizers; adhering to a lossless-first principle by retaining original text when conversion fails; and as a raw dump version, intentionally preserving some English noise and duplicates, with fine cleaning deferred to v1 after the first readable model is produced. Dataset licensing depends on the original sources, aggregated here for research purposes only.

创建时间:
2026-07-18
原始信息汇总

数据集概述:Sanskrit Pile v0

这是一个专为梵语大型语言模型(1B–3B概念验证)持续预训练而设计的原始预训练语料库,包含天城体梵文文本,支持流式读取且与分词器无关。

数据规模

  • 文档数量:1,429,519 篇
  • 字符数:约 61.9 亿字符
  • 预估词元数:约 15.5 亿词元(按每4字符1词元估算)
  • 数据格式:分片 Parquet(zstd 压缩),采用 FineWeb 风格

数据内容与结构

  • 脚本:天城体(已通过 indic-transliteration 进行 IAST/SLP1/ITRANS 归一化)
  • 数据字段
    字段 类型 描述
    id 字符串 文档唯一标识
    text 字符串 天城体文本(未应用分词)
    source 字符串 来源名称(如 gretil, sawikisource, sangraha/verified 等)
    url 字符串 源 URL
    char_length 整数 文本的字符/字节长度
    raw_script 字符串 归一化前的原始脚本

数据来源

  • GRETIL(INDOLOGY/GRETIL-mirror)
  • Sanskrit etexts(sanskrit/raw_etexts)
  • Digital Corpus of Sanskrit(OliverHellwig/sanskrit)
  • Sanskrit Wikisource(sawikisource 转储)
  • AI4Bharat Sangraha — 包含 verified/san、unverified/san、synthetic/san_Deva

设计理念

  • 无分词器介入:可直接用于训练任意 BPE、WordPiece 或形态分词器。
  • 无损优先:脚本转换失败时,保留原始文本不丢弃。
  • 原始转储:有意保留英语噪声和部分重叠内容,精细清理将在 v1 版本中进行。

使用示例

python from datasets import load_dataset ds = load_dataset("CodeIsAbstract/test_sanskrit_pile", split="train", streaming=True) for ex in ds: text = ex["text"] # 天城体文本,与分词器无关

许可协议

许可协议因来源而异,具体请参阅原始仓库条款。本数据集仅为研究目的聚合。

搜集汇总
数据集介绍
sample_sanskrit_pile 数据集图片
构建方式
Sanskrit Pile v0 是一个专为梵语大型语言模型(LLM)持续预训练而设计的原始语料库,其构建遵循了 The Pile 与 FineWeb 的设计理念,强调与分词器无关(tokenizer-agnostic)的流式处理能力。该数据集汇集了来自 GRETIL、Sanskrit etexts、Digital Corpus of Sanskrit、梵语维基文库以及 AI4Bharat Sangraha 等多个权威来源的天城文梵语文本,总计包含约 142.9 万篇文档、61.9 亿字符,并以分片 Parquet 格式进行存储,采用 zstd 压缩。在数据预处理阶段,通过 indic-transliteration 工具将 IAST、SLP1、ITRANS 等转写方案统一标准化为天城文字体,并保留了原始脚本字段以记录转换前的状态;当脚本转换失败时,则完整保留原始文本,以确保无损优先。
使用方法
研究者可通过 HuggingFace Datasets 库轻松加载该数据集,推荐采用流式模式(streaming=True)以降低内存占用。加载时指定数据集名称 'CodeIsAbstract/test_sanskrit_pile' 与训练集划分即可迭代获取每条样本,每个样本主要包含 'text' 字段,其中为已标准化的天城文文本。由于数据集以分片 Parquet 格式存储,支持高效的列式读取与分布式处理,非常适合用于持续预训练任务。若需训练自定义分词器,可直接基于 'text' 字段进行统计与词汇表构建;若用于语言模型训练,则可将文本序列直接输入模型,无需额外转换。值得注意的是,数据集中包含 'source' 与 'url' 字段,便于溯源与引用,而 'char_length' 字段则提供了无需分词器的长度信息,有助于批处理时的序列长度管理。
背景与挑战
背景概述
Sanskrit Pile v0(梵语语料库初版)于近年由研究团体创建,旨在解决低资源语言尤其是梵语在预训练语言模型中的数据匮乏问题。该数据集汇集了来自GRETIL、数字梵语语料库及AI4Bharat Sangraha等多个学术机构的约142万文档,涵盖6.19亿字符的梵语天城体文本。其核心研究问题在于为1B至3B参数规模的梵语大语言模型提供连续预训练基础,填补了印度古典语言在自然语言处理领域的数据空白。作为The Pile和FineWeb风格的开源资源,该数据集因其tokenizer无关的设计理念和流式加载能力,促进了梵语语言模型的民主化研究,对计算语言学和印度学领域产生了重要影响。
当前挑战
当前数据集面临的挑战主要体现在两方面。在领域问题层面,梵语作为形态丰富的低资源语言,其高度屈折的语法结构对语言模型的学习效率提出严峻考验,同时天城体转写方案的多样性(如IAST、SLP1)对跨模型泛化能力形成制约。在构建过程中,数据清洗面临保留原始文本的纯度与去除英语噪声之间的平衡难题;多源异构文档的脚本规范化依赖'indic-transliteration'工具,其转换失败率可能导致数据质量下降。此外,合成数据(如AI4Bharat的synthetic/san_Deva)原始内容的有效性尚未经人工验证,为后续模型的可靠训练增添了不确定性。
常用场景
经典使用场景
在梵语自然语言处理领域,数据资源的匮乏长期制约着该语种大规模语言模型的发展。Sanskrit Pile v0作为首个面向天城体梵语的流式预训练语料库,其经典使用场景聚焦于从头训练或持续预训练梵语大型语言模型。研究者可直接将未经切分的原始文本输入模型,通过自回归语言建模任务学习梵语的形态句法规律,为1B至3B参数规模的验证性模型提供训练基础。数据集的流式加载设计支持对超过140万文档的高效处理,而词元无关的存储模式则允许研究者根据实验需求自由选择BPE、WordPiece或形态学分词器。
解决学术问题
该数据集的核心学术价值在于系统性突破了梵语计算语言学的三大瓶颈:语料来源分散、格式不统一以及分词器适配受限。通过整合GRETIL、Sanskrit Wikisource、Digital Corpus of Sanskrit及AI4Bharat Sangraha等权威来源,解决了单源语料规模不足与领域覆盖单一的问题。保留原始脚本的完整性设计,既规避了转写错误造成的信息损失,又为跨脚本归一化研究保留了实验空间。特别值得关注的是,语料中包含的合成数据为验证数据增强策略在低资源语言上的有效性提供了基准测试平台。
实际应用
在实际应用中,Sanskrit Pile v0主要服务于三类研究场景:其一,支撑梵语文本生成任务,包括史诗文献的智能补全、吠陀经文的自动校勘以及古典诗律的韵律分析。其二,赋能传统文献数字化工程,通过预训练模型提升光学字符识别后文本校正的准确率。其三,为跨语言迁移学习提供桥接资源,例如训练梵语-印地语的形态分析器或构建梵语-英语的平行语料对齐工具。数据集在设计上刻意保留的英文噪声和内容重叠,恰为研究多语言混合训练中的领域自适应问题提供了天然实验场。
数据集最近研究
最新研究方向
基于Sanskrit Pile v0数据集的梵语大语言模型持续预训练研究正逐步兴起,该语料库汇集了来自GRETIL、梵语维基文库及AI4Bharat的Sangraha项目等多源数据,包含逾140万文档、约62亿字符,采用天城体梵文且未经分词处理,为1B至3B参数规模的证明性概念模型提供了无tokenizer依赖的原始训练素材。当前研究焦点在于利用该数据集探索低资源古典语言的神经语言建模方法,与跨语言迁移学习、古文献数字化保护及印度次大陆文化AI复原等热点紧密相连。其开源、可流式加载的设计继承了The Pile与FineWeb的工程理念,有望推动非拉丁字母传统语言在预训练阶段的数据层标准化,填补梵语NLP基础设施空白,为后续更精细的语料清洗和多模态模型范式的形成奠定基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务