UD_v2_17_POS_LEMMA
收藏资源简介:
该数据集是一个用于法语词性标注和词形还原任务的多任务处理数据集,专门设计用于训练Airudit多任务模型。它整合了Universal Dependencies v2.17版本中的七个法语语料库:fr_gsd、fr_sequoia、fr_partut、fr_parisstories、fr_rhapsodie、fr_poitevindivital和fr_pud。每个数据样本包含四个字段:句子标识符(sent_id)、词元序列(tokens)、通用词性标注序列(upos)和词元原形序列(lemmas)。词性标注采用一套17个通用词性标签,覆盖名词、动词、形容词、副词、介词、标点等类别。数据集被划分为训练集(20,159个样本)、开发集(3,768个样本)以及七个独立的测试集(样本数从110到1,000不等),每个测试集对应一个源语料库。在预处理过程中,各语料库的训练集和开发集被合并为统一划分,而测试集则保持原划分并以源语料库命名;此外,对Partut语料库中的部分标签进行了标准化处理以确保标注一致性。该数据集适用于法语词性标注、词形还原及相关序列标注任务的研究与模型训练。
This dataset is a multi-task processing dataset for French part-of-speech tagging and lemmatization tasks, specifically designed for training the Airudit multi-task model. It integrates seven French corpora from Universal Dependencies v2.17: fr_gsd, fr_sequoia, fr_partut, fr_parisstories, fr_rhapsodie, fr_poitevindivital, and fr_pud. Each data sample includes four fields: sentence identifier (sent_id), token sequence (tokens), universal part-of-speech tag sequence (upos), and lemma sequence (lemmas). The part-of-speech tagging uses a set of 17 universal part-of-speech tags, covering categories such as nouns, verbs, adjectives, adverbs, prepositions, and punctuation. The dataset is divided into a training set (20,159 samples), a development set (3,768 samples), and seven independent test sets (ranging from 110 to 1,000 samples each), with each test set corresponding to a source corpus. During preprocessing, the training and development sets from each corpus were merged into unified splits, while the test sets retained their original splits and were named after their source corpora; additionally, some labels in the Partut corpus were standardized to ensure annotation consistency. This dataset is suitable for research and model training in French part-of-speech tagging, lemmatization, and related sequence labeling tasks.
数据集概述
该数据集专为词性标注(POS)和词形还原(Lemmatization)任务设计,用于训练Airudit多任务模型。
数据来源
数据集整合了Universal Dependencies v2.17版本的多个法语语料库,具体来源如下:
- fr_gsd
- fr_sequoia
- fr_partut
- fr_parisstories
- fr_rhapsodie
- fr_poitevindivital
- fr_pud
数据集结构
数据集包含以下数据划分(split):
| 划分名称 | 样本数量 | 字节大小 |
|---|---|---|
| train | 20,159 | 12,377,732 |
| dev | 3,768 | 1,857,210 |
| test_fr_gsd | 416 | 260,262 |
| test_fr_sequoia | 456 | 268,640 |
| test_fr_partut | 110 | 69,583 |
| test_fr_parisstories | 697 | 271,127 |
| test_fr_rhapsodie | 840 | 312,095 |
| test_fr_pud | 1,000 | 644,257 |
| test_fr_poitevindivital | 239 | 140,396 |
数据集总大小:16,201,302 字节(约15.45 MB),下载大小为3,928,400 字节(约3.75 MB)。
数据特征
每条数据包含以下字段:
- sent_id(字符串):句子标识符。
- tokens(字符串列表):句子中的词元(tokens)。
- lemmas(字符串列表):每个词元对应的词元(lemma)。
- upos(类别标签列表):每个词元的通用词性标签。
标签类别
词性标签(upos)共包含18个类别:
[NOUN, PUNCT, ADP, NUM, SYM, SCONJ, ADJ, PART, DET, CCONJ, PROPN, PRON, X, _, ADV, INTJ, VERB, AUX]
预处理说明
- 所有语料库的训练集和开发集被合并为统一的
train和dev划分。 - 各语料库的测试集被保留,并根据来源语料库重新命名(如
test_fr_gsd)。 - 仅保留了相关列:
["sent_id", "tokens", "upos", "lemmas"]。 - 在Partut数据集中,对“ne”和“n”等小品词原标注为
PART,为与其他UD语料库保持一致,已将其标签转换为ADV。 - 数据集通过脚本
multitask-nlp/src/multitask_nlp/datasets/pos_dataset_preparation.py生成。




