遇见数据集

chronbmm/sanskrit-sandhi-split-sighum-filtered-new

收藏
Hugging Face2024-05-28 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: sentence dtype: string - name: unsandhied dtype: string splits: - name: train num_bytes: 10889800 num_examples: 98942 - name: validation num_bytes: 470628 num_examples: 4200 - name: test num_bytes: 470628 num_examples: 4200 - name: test_500 num_bytes: 58795 num_examples: 500 - name: validation_500 num_bytes: 58795 num_examples: 500 download_size: 7399131 dataset_size: 11948646 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* - split: test_500 path: data/test_500-* - split: validation_500 path: data/validation_500-* ---

数据集信息: 特征: - 名称:语句(sentence),数据类型:字符串 - 名称:非连音形式(unsandhied),数据类型:字符串 数据集划分: - 名称:训练集(train),字节占用量:10889800,样本数量:98942 - 名称:验证集(validation),字节占用量:470628,样本数量:4200 - 名称:测试集(test),字节占用量:470628,样本数量:4200 - 名称:500样本测试集(test_500),字节占用量:58795,样本数量:500 - 名称:500样本验证集(validation_500),字节占用量:58795,样本数量:500 下载总大小:7399131,数据集总存储大小:11948646 配置项: - 配置名称:默认配置(default),数据文件: - 划分集:训练集(train),数据路径:data/train-* - 划分集:验证集(validation),数据路径:data/validation-* - 划分集:测试集(test),数据路径:data/test-* - 划分集:500样本测试集(test_500),数据路径:data/test_500-* - 划分集:500样本验证集(validation_500),数据路径:data/validation_500-*

提供机构:
chronbmm
原始信息汇总

数据集概述

数据集特征

  • sentence:数据类型为字符串。
  • unsandhied:数据类型为字符串。

数据集分割

  • 训练集 (train):包含98942个样本,总大小为10889800字节。
  • 验证集 (validation):包含4200个样本,总大小为470628字节。
  • 测试集 (test):包含4200个样本,总大小为470628字节。
  • 测试集_500 (test_500):包含500个样本,总大小为58795字节。
  • 验证集_500 (validation_500):包含500个样本,总大小为58795字节。

数据集大小

  • 下载大小:7399131字节。
  • 数据集总大小:11948646字节。

数据文件配置

  • 默认配置 (default)
    • 训练集路径:data/train-*
    • 验证集路径:data/validation-*
    • 测试集路径:data/test-*
    • 测试集_500路径:data/test_500-*
    • 验证集_500路径:data/validation_500-*
搜集汇总
数据集介绍
chronbmm/sanskrit-sandhi-split-sighum-filtered-new 数据集图片
构建方式
在梵语自然语言处理领域,连音(Sandhi)现象的解析与还原是文本理解的关键挑战。该数据集以梵语文本中的连音现象为核心,构建了包含原始句子(sentence)与去连音后形式(unsandhied)的平行语料。数据通过筛选高质量语料并经过Sighum过滤流程精炼而成,确保样本的纯净度与语言学准确性。最终形成训练集98,942条、验证集4,200条、测试集4,200条,并额外提供500条规模的测试与验证子集,以适配不同规模的实验需求。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,指定default配置即可获取所有划分。加载后,每条样本包含sentence与unsandhied两个字段,前者作为模型输入,后者作为目标输出。适用于训练基于Transformer的序列转换模型,如用于梵语连音还原或连音生成的神经机器翻译任务。微型子集可优先用于模型调试与超参数调优,全量数据则用于最终训练与评估。
背景与挑战
背景概述
梵语作为印度-雅利安语支的古老语言,其语法体系以复杂的连音变化(Sandhi)为显著特征,即语素或词汇在连续发音时发生音变合并,形成形态上的融合。这一现象在梵语文献中极为普遍,却给自然语言处理任务带来严峻挑战——传统基于规则的方法难以覆盖所有连音模式,而人工标注又受限于语料规模与专家稀缺性。chronbmm/sanskrit-sandhi-split-sighum-filtered-new数据集应运而生,由计算语言学研究者构建,旨在为梵语连音切分(Sandhi Splitting)提供大规模、高质量的监督学习基准。该数据集包含近10万条训练样本及多个验证与测试子集,专注于从连音句还原其原始未连音形式的核心问题,填补了面向低资源古典语言的序列转换研究空白。其发布显著推动了梵语自动形态分析领域的发展,为后续基于深度学习的连音消歧模型提供了关键训练资源,并成为评估梵语NLP系统性能的标准化测试平台。
当前挑战
该数据集所应对的核心挑战在于梵语连音现象的复杂性与歧义性:同一连音形式可能对应多种合理的未连音拆分方案,且连音规则受音韵环境、词性边界及语用语境多重因素制约,传统有限状态机或规则库难以实现高泛化性的自动切分。构建过程中,研究者面临语料来源碎片化、古文献转录标准不统一等现实瓶颈,需从多源梵语文本中筛选并清洗连音句,同时借助专家知识对未连音标注进行一致性校验——即便经过过滤,仍存在因罕见连音模式或音变异常导致的标注噪声。此外,数据集规模虽已初具统计意义,但相较于现代语言资源仍显局促,且测试集仅含500至4200句,难以充分覆盖梵语文献中多样化的文体与时代变体,对模型在真实古籍场景下的鲁棒性构成潜在局限。
常用场景
经典使用场景
在梵语自然语言处理领域,连音变读(Sandhi)现象是文本解析与生成的核心挑战之一。该数据集聚焦于梵语句子的连音分割与还原任务,即给定一个经过连音变读的梵语句子,模型需将其切分为原始词序列并恢复未发生音变的形态。这一任务对于梵语语法的自动化分析、古典文献的数字化整理以及跨语言比较研究具有奠基性意义。数据集包含近十万条训练样本,覆盖多种连音规则,为序列到序列模型提供了高质量的标注数据,是评估模型在复杂音韵变化下语言理解能力的基准资源。
解决学术问题
该数据集系统性地解决了梵语连音变读自动还原这一长期困扰计算语言学界的基础问题。连音规则涉及词边界模糊、音素融合与音位交替,传统基于规则的方法难以覆盖所有例外与边缘情况。通过提供大规模、人工校验的平行语料,该数据集使得基于深度学习的端到端模型能够学习从连音形式到原始形式的映射,显著提升了还原准确率。这一突破不仅推动了梵语计算语法学的发展,也为其他具有音韵变体特征的语言(如古希腊语、阿拉伯语)提供了方法借鉴。
实际应用
在实际应用中,该数据集支撑了梵语古籍数字化平台中自动文本校勘与注释系统的构建。例如,针对《吠陀》《摩诃婆罗多》等大型文献,模型可自动将连音文本还原为词序列,大幅降低人工标注成本。此外,该技术可集成至梵语学习工具中,帮助学习者理解连音规则与词源关系。在印度文化数字化遗产保护项目中,该数据集已成为关键基础设施,助力实现从手稿扫描到结构化语料库的自动化流水线。
数据集最近研究
最新研究方向
在计算语言学和数字人文学科的前沿探索中,梵语连音(sandhi)拆分作为古印度文本数字化处理的核心瓶颈,正受到学界广泛关注。该数据集聚焦于梵语中因语音规则导致的词汇边界模糊问题,通过大规模标注语料(训练集近10万句)为序列到序列模型提供了高质量训练基准。近期研究趋势显示,基于Transformer架构的神经机器翻译模型与条件随机场等传统方法在此任务上展开激烈竞争,而该数据集的细粒度验证集(如validation_500)为模型鲁棒性评估提供了标准化测试平台。随着全球梵语数字化项目(如CEK、SARIT)的推进,精准的连音拆分不仅关乎《吠陀》《摩诃婆罗多》等经典文献的机器可读性,更与跨语言语义对齐、古印度哲学概念图谱构建等前沿方向深度耦合,其突破将加速南亚文明遗产的智能信息提取与全球共享。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务