遇见数据集

openpecha/tibetan-metadata-extracted

收藏
Hugging Face2026-06-12 更新2026-07-22 收录
官方服务:

资源简介:

--- license: cc-by-4.0 language: - bo task_categories: - token-classification tags: - tibetan - ner - metadata - bdrc size_categories: - 1K<n<10K --- # Tibetan Metadata Extracted Documents Raw BDRC outliner exports used to build [ganga4364/tibetan-metadata-detector](https://huggingface.co/datasets/ganga4364/tibetan-metadata-detector). ## Contents 3,794 approved documents with annotated title/author spans. Each row: | Field | Description | |-------|-------------| | `doc_id` | Document UUID | | `filename` | Source filename | | `text` | Full document text (UTF-8) | | `annotations_json` | JSON with `segments` and flat `annotations` (title/author spans) | ## Related repos - Window splits + model training data: [ganga4364/tibetan-metadata-detector](https://huggingface.co/datasets/ganga4364/tibetan-metadata-detector) - Fine-tuned model: [ganga4364/tibetan-metadata-roberta-ner](https://huggingface.co/ganga4364/tibetan-metadata-roberta-ner) - Demo: [ganga4364/tibetan-metadata-highlight](https://huggingface.co/spaces/ganga4364/tibetan-metadata-highlight) ## Usage ```python from datasets import load_dataset ds = load_dataset("ganga4364/tibetan-metadata-extracted") doc = ds["train"][0] ```

The dataset is named Tibetan Metadata Extracted Documents and contains 3,794 approved documents with annotated title and author spans. It is derived from raw BDRC (Buddhist Digital Resource Center) outliner exports and used to build a Tibetan metadata detection model. Each document includes the following fields: doc_id (document UUID), filename (source filename), text (full document text in UTF-8), and annotations_json (JSON with title and author span annotations). The dataset is in Tibetan language, falls under the token-classification task category, and is suitable for named entity recognition (NER) and metadata processing, with a size between 1,000 and 10,000 samples.

提供机构:
openpecha
搜集汇总
数据集介绍
openpecha/tibetan-metadata-extracted 数据集图片
构建方式
该数据集源自BDRC( Buddhist Digital Resource Center )的大纲导出文件,经过精心筛选与整理,最终收录了3,794份经过审核的藏文文献。每一份文档均包含标题与作者等核心元数据的标注信息。数据集的构建不仅涵盖了文档的唯一标识符、源文件名及完整的UTF-8编码文本,还通过`annotations_json`字段以JSON格式存储了文本片段与标题、作者的精确跨度标注。这一设计确保了数据在命名实体识别(NER)任务中的高质量与可用性。
使用方法
使用该数据集极为便捷,开发者可通过几行代码快速接入。借助`datasets`库中的`load_dataset`函数,指定数据集名称`"ganga4364/tibetan-metadata-extracted"`即可加载。默认情况下,数据以`"train"`分割形式提供,包含的字段可直接用于模型训练与评估。对于需要进一步处理的场景,数据集的JSON格式标注可以无缝对接常见的序列标注框架,如HuggingFace的Trainer或PyTorch,便于基于此数据集微调藏文NER模型。
背景与挑战
背景概述
该数据集由研究人员ganga4364构建,旨在推动藏文文档元数据提取领域的发展,特别是针对藏文文本中标题与作者实体的自动识别。创建于近期,主要依托BDRC( Buddhist Digital Resource Center )的资源,通过整理其outliner导出文件,形成包含3,794份经人工标注的藏文文档。核心研究问题聚焦于如何利用命名实体识别技术,从非结构化的藏文文献中精准抽取结构化元数据。该数据集为训练专用模型如tibetan-metadata-roberta-ner提供了基础,显著提升了藏文信息处理的自动化水平,对藏学研究、数字人文及低资源语言NLP具有重要推动力。
当前挑战
数据集面临的挑战主要体现在两方面。领域问题层面,藏文具有丰富的形态变化和复杂的语法结构,且传统文本中标题与作者标注缺乏统一规范,导致实体边界识别极为困难;同时,藏文NLP资源匮乏,预训练语言模型稀缺,增大了迁移学习难度。构建过程中,从BDRC原始导出文件中提取并清洗文本需处理多种格式歧义与编码问题,人工标注工作量大且需具备藏学专业知识,确保标注一致性亦是一大考验。此外,数据集规模仅数千样本,难以覆盖不同历史时期和地域的藏文文献变体,泛化能力受限。
常用场景
经典使用场景
在藏文自然语言处理领域,该数据集主要用于命名实体识别任务,尤其是针对藏文文献元数据的标题与作者信息抽取。研究者可基于3,794份经人工标注的BDRC大纲文档,训练能够自动识别文本中标题和作者位置的序列标注模型。数据集提供完整的UTF-8文本及标注JSON,支持构建基于窗口切分的训练数据,经典使用方式包括加载原始数据、提取标注跨度、生成模型输入格式,并配合相关仓库中的微调模型进行藏文文献的元数据识别。
解决学术问题
该数据集解决了藏文文献数字化过程中元数据自动提取这一关键学术难题。传统上,藏文文献的标题和作者信息需人工从扫描文档或文本中逐一摘录,效率低下且难以规模化。通过提供大规模、高质量的标注语料,该数据集使研究者能够训练精确的序列标注模型,从而自动化元数据抽取流程。其学术意义在于推动了低资源语言(尤其是藏语)在信息抽取领域的进展,为藏文古籍的数字化整理、编目和知识库构建提供了可靠的基础资源,显著提升了藏文文本处理的自动化水平。
实际应用
在实际应用中,该数据集驱动藏文文献元数据抽取系统的开发与部署,广泛应用于数字图书馆、佛学数据库和藏学研究中。例如,BDRC(佛教数字资源中心)可借助相关模型自动处理海量藏文典籍,提取标题与作者并存入结构化知识库。Hugging Face平台上的交互式演示空间允许用户上传藏文文本,实时高亮显示识别出的元数据片段,极大便利了学者和图书馆员的日常编目工作,加速了藏文文化遗产的数字化保存与共享进程。
数据集最近研究
最新研究方向
当前,藏文文献的数字化与信息化处理已成为计算语言学与数字人文领域的前沿热点。该数据集聚焦于藏文元数据提取任务,基于BDRC( Buddhist Digital Resource Center )的3794份已审批文档,构建了带有标题与作者跨度标注的高质量语料库。这一研究方向与藏文命名实体识别(NER)技术紧密结合,为古籍文献的自动化索引、知识图谱构建及跨语言信息检索提供了关键数据支撑。在热点事件方面,随着国际藏学研究的深入及藏文网络资源的激增,精准的元数据检测模型对于保护与传承藏文文化遗产具有深远意义。该数据集的出现推动了小语种NLP模型的突破,尤其是通过微调RoBERTa架构实现的藏文元数据识别系统,不仅提升了标注效率,更为后续低资源语言的AI应用树立了典范。其影响在于弥合了语言资源鸿沟,促进了民族语言数字生态的可持续发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务