遇见数据集

openpecha/tibetan-metadata-llm-sft-full

收藏
Hugging Face2026-06-19 更新2026-07-22 收录
官方服务:

资源简介:

这是一个完整的监督微调(SFT)JSONL数据集,专门用于从BDRC大纲片段中提取标题和作者跨度,旨在支持TiLamb-7B模型。数据集包含两个主要任务:标题提取和作者提取,每个任务都有训练、验证和测试文件,采用Alpaca格式以便与LLaMA-Factory兼容。数据行包括指令(固定任务提示)、输入(裁剪后的片段文本,通过TiLamb分词器限制在≤3584个token内)和输出(JSON格式的跨度信息,包含文本、起始和结束位置,使用裁剪相对偏移)。裁剪策略分为三种:完整(整个片段符合token预算)、正向(随机窗口包含黄金跨度,以减少位置偏差)和负向(随机窗口,该任务无跨度)。数据集来源于ganga4364/tibetan-metadata-extracted(共3794个文档),并使用OpenPecha/tibetan-text-meta-detection的llm_sft包构建。数据集语言为藏语(bo),标签包括藏语、元数据、标题、作者、llm-sft和tilamb,规模在10万到1百万之间,适用于文本生成任务。

This is a comprehensive Supervised Fine-Tuning (SFT) JSONL dataset dedicated to extracting title and author spans from BDRC outline fragments, tailored to support the TiLamb-7B model. The dataset encompasses two primary tasks: title extraction and author extraction. Each task has corresponding training, validation, and test files, formatted in Alpaca style for compatibility with LLaMA-Factory. Each data entry comprises three components: an instruction (fixed task prompt), input (cropped fragment text, restricted to ≤3584 tokens using the TiLamb tokenizer), and output (JSON-formatted span information including text, start and end positions, with cropped relative offsets). Three cropping strategies are employed: 1. Full: the entire fragment falls within the token budget 2. Forward: a random window that includes the gold span to mitigate positional bias 3. Negative: a random window with no target span for the given task The dataset is derived from ganga4364/tibetan-metadata-extracted (totaling 3794 documents) and constructed using the llm_sft package from OpenPecha/tibetan-text-meta-detection. The dataset is in Tibetan (bo), with tags including Tibetan, metadata, title, author, llm-sft, and tilamb. Its scale ranges from 100,000 to 1,000,000, and it is applicable to text generation tasks.

提供机构:
openpecha
搜集汇总
数据集介绍
openpecha/tibetan-metadata-llm-sft-full 数据集图片
构建方式
Tibetan-metadata-llm-sft-full数据集专为藏文文献元数据提取任务而构建,其数据源自BDRC大纲片段,聚焦于标题与作者信息的跨度提取。构建过程依托于ganga4364/tibetan-metadata-extracted中的3794份文档,采用裁剪策略以适配TiLamb-7B分词器的令牌预算(不超过3584个token)。具体而言,数据分为三种裁剪类型:完整片段(full)、包含目标跨度的正向随机窗口(positive)及不含相关跨度的负向窗口(negative),从而有效缓解位置偏差问题。最终数据以Alpaca格式组织,适用于LLaMA-Factory框架的监督微调。
特点
该数据集最显著的特点在于其针对藏文元数据任务的精细化设计。首先,数据涵盖标题与作者两类跨度提取任务,每条样本由固定指令、裁剪后的文本输入及包含相对偏移的JSON输出组成。其次,通过三种裁剪策略,数据集不仅保留了完整语义信息,还引入了随机窗口以增强模型对跨位置目标的泛化能力。此外,所有样本严格遵循TiLamb分词器的令牌预算,确保与目标模型的兼容性。这些特点共同使其成为训练鲁棒性藏文元数据抽取模型的高质量资源。
使用方法
数据集的使用非常直观,用户可直接将其加载至LLaMA-Factory框架中。数据按任务分为title和author两个子目录,每个子目录下包含train、val、test三个JSONL文件,并配有对应的元数据文件及dataset_info.json注册表。使用时,用户需将数据集路径指向主目录,LLaMA-Factory会自动识别配置。例如,对于标题提取任务,训练数据位于title/train.jsonl,每条样本可被直接用于指令微调。此外,10%的试点子集(tibetan-metadata-llm-sft)可用于快速实验验证流程。
背景与挑战
背景概述
该数据集由研究者ganga4364等人创建,旨在为藏文文本的元数据抽取任务构建指令微调数据。藏文文献数字化中,标题与作者等结构化元信息的自动提取是信息检索与知识组织的关键环节。数据集源自BDRC(佛教数字资源中心)的3794篇文献片段,通过裁剪策略生成监督微调样本,支撑TiLamb-7B模型的训练。其发布于HuggingFace平台,采用CC-BY-4.0许可,为藏文自然语言处理提供了高质量的训练资源,推动了低资源语言在指令微调与信息抽取领域的研究进展。
当前挑战
该领域面临的核心挑战在于藏文文本的元数据抽取,尤其是处理结构多变的文献片段时,模型需具备对标题、作者等实体边界的精准识别能力。由于藏文缺乏标准分词规范,且历史文献常存在拼写变体与稀疏字符,传统序列标注方法效果受限。构建过程中,数据来自片段而非完整文档,需设计裁剪策略以避免位置偏差,同时平衡正负样本比例。此外,受TiLamb分词器预算限制,长文本需截断至3584个token,可能丢失全局上下文信息,增加了模型泛化难度。
常用场景
经典使用场景
该数据集专为藏文文献元数据抽取任务而设计,核心用途在于对藏文文本片段中的标题与作者信息进行精细化识别与提取。通过提供结构化的监督微调数据,它支持大语言模型学习从非结构化的藏文文本中定位并输出特定元数据字段,从而在藏文自然语言处理领域开辟了针对低资源语言的元数据抽取新范式。
解决学术问题
该数据集着力攻克藏文文献数字化过程中元数据自动标注这一关键瓶颈,解决了因藏文语法复杂、语料稀缺而导致的标题与作者信息难以精准识别的问题。其出现极大推动了低资源语言场景下信息抽取技术的研究,为构建规模化藏文知识库奠定了数据基础,对藏文文献的传承、检索与智能分析具有深远学术意义。
衍生相关工作
该数据集衍生出了针对藏文大语言模型TiLamb-7B的指令微调流程,以及配套的文本元数据检测开源工具包。相关工作还包括基于不同采样策略(如正负例窗口裁剪)的元数据抽取实验,以及从BDRC藏文文献中大规模提取元数据的基础数据集,共同构建了从数据制备到模型训练、再到工具部署的完整藏文信息抽取生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务