ie-datasets
收藏资源简介:
该数据集包含用于藏文文本信息提取的训练数据,专注于通过电子书丰富化来获取高质量注释,以及低成本的注释者和数据管理员。数据集涵盖了多种类型的信息,如引用、术语定义等,这些信息在各个专业领域中都是最相关的。
This dataset comprises training data for Tibetan text information extraction, focusing on the enrichment of e-books to obtain high-quality annotations, as well as low-cost annotators and data administrators. The dataset encompasses various types of information, such as citations and term definitions, which are most relevant across various professional fields.
数据集概述
数据集名称
ie-datasets
数据集内容
该数据集包含用于信息提取的藏文电子文本训练数据。
背景研究
研究团队调查了藏传佛教学者,了解他们在使用专业文献时寻找的信息类型。通过分析数据,确定了各领域专业文献中最相关的信息类型,并开始专注于标注跨领域最常见的信息,如“引文”和“术语定义”。
训练模型
- ie-citations-sources - 引文 ལུང་། + 来源 ལུང་ཁུངས།
标注数据集
通用标注(临时标签)
-
引文 ལུང་། + 来源 ལུང་ཁུངས།;
(G<text>),(H<text>) -
定义 མཚན་ཉིད། + 定义的 མཚོན་བྱ། + 实例 མཚན་གཞི།;
(A<text>),(B<text>),(C<text>) -
枚举 + 枚举的 དབྱེ་གཞི། + དབྱེ་བ།;
(D<text>),(E<text>)- litghttag-training-NER-Enumeration-and-definition - འདིའི་ནང་མཚོན་བྱ་མཚན་ཉིད་དང་དབྱེ་གཞི་དབྱེ་བ་མཉམ་དུ་འདུག
- རྣམ་གྲངས། enumeration
- dudra
- grammar
-
词形态学 + 词 སྒྲ་བཤད། + སྒྲ་གཞི།;
(F<text>),(L<text>)
语法文本标注(临时标签)
-
一致性 1 + 一致性 2 འཇུག་ཡུལ། + འཇུག་བྱ།;
(P<text>),(P*<text>) -
非法一致性 1 + 非法一致性 2 མི་འཇུག་སའི་ཡུལ། + མི་འཇུག་ས།;
(S<text>),(S*<text>)
编辑标注(临时标签)
- 子标题 ཡིག་ཆུང་།;
(y<text>) - 卷标题 ཡིག་ཆའི་མཚན་བྱང་།;
(k2<text>) - 文本标题 ཡིག་ཆའི་མཚན་བྱང་།;
(k1<text>) - 章节标题 ཡིག་ཆའི་མཚན་བྱང་།;
(k3<text>) - 注释标记 བསྡུར་མཆན་ཨང་།;
<text>#<text># 用于 OCR 训练 - 潜在错误 ཡིག་ནོར་དོགས་གཞི།;
[<error>,<correction>]
NER 标注(临时标签)
- 人物 མི་སྣ།;
- 作者 མཛད་པ་པོ།;
(au<text>) - 地点 ས་གནས།;
- 日期 དུས་ཚིགས།;
词分割
POS 标记




