JudSacr/frenchNLI
收藏资源简介:
该数据集是一个拼接了法语自然语言推理(NLI)数据集的开源集合。总共有569,895行数据,其中555,798行用于训练,3,780行用于验证,10,317行用于测试。数据集由多个源数据集组成,包括xnli、MoritzLaurer/multilingual-NLI-26lang-2mil7(包含fr_anli、fr_fever、fr_ling、fr_mnli、fr_wanli等子集)、Lajavaness/SICK-fr、ssilwal/CASS-civile-nli、maximoss/rte3-french和maximoss/daccord-contradictions。在拼接过程中,已去除重复数据和潜在的数据泄漏问题,确保数据集的完整性。数据集中包含四列:premise(前提文本)、hypothesis(假设文本)、label(标签,0表示蕴含,1表示中性,2表示矛盾)和dataset(标识数据来源的原始数据集)。数据集分割为训练集、验证集和测试集,训练集由多个源数据集的训练部分拼接而成,验证集和测试集则主要来自xnli和SICK-fr。该数据集适用于文本分类任务,特别是自然语言推理,旨在支持法语NLP研究。
language: - 法语(fra) license: cc-by-4.0 size_categories: - 10万 < 样本数 < 100万 task_categories: - 文本分类 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* dataset_info: features: - name: premise dtype: 字符串 - name: hypothesis dtype: 字符串 - name: label dtype: 64位整数 - name: dataset dtype: 字符串 splits: - name: train num_bytes: 159494228 num_examples: 555798 - name: validation num_bytes: 880135 num_examples: 3780 - name: test num_bytes: 1930361 num_examples: 10317 download_size: 86535081 dataset_size: 162304724 # 数据集信息 **本数据集为开源法语自然语言推理(Natural Language Inference, NLI)数据集的拼接合集**。总共有**569,895**条数据,其中训练集555,798条,验证集3,780条,测试集10,317条。 # 使用方式 from datasets import load_dataset dataset = load_dataset("CATIE-AQ/frenchNLI") # 数据集详情 ## 数据行详情 | 原始数据集 | 拆分集 | 说明 | | ----------- | ----------- | ----------- | | [XNLI](https://huggingface.co/datasets/xnli) | 训练集392,574条 / 验证集2,490条 / 测试集5,010条 | 仅保留法语拆分子集 | | [MoritzLaurer/multilingual-NLI-26lang-2mil7 (fr_anli)](https://huggingface.co/datasets/MoritzLaurer/multilingual-NLI-26lang-2mil7/viewer/default/fr_anli) | 训练集24,973条 | 数据来源于机器翻译 | | [MoritzLaurer/multilingual-NLI-26lang-2mil7 (fr_fever)](https://huggingface.co/datasets/MoritzLaurer/multilingual-NLI-26lang-2mil7/viewer/default/fr_fever) | 训练集24,940条 | 数据来源于机器翻译 | | [MoritzLaurer/multilingual-NLI-26lang-2mil7 (fr_ling)](https://huggingface.co/datasets/MoritzLaurer/multilingual-NLI-26lang-2mil7/viewer/default/fr_ling) | 训练集5,000条 | 数据来源于机器翻译 | | [MoritzLaurer/multilingual-NLI-26lang-2mil7 (fr_mnli)](https://huggingface.co/datasets/MoritzLaurer/multilingual-NLI-26lang-2mil7/viewer/default/fr_mnli) | 训练集24,999条 | 数据来源于机器翻译 | | [MoritzLaurer/multilingual-NLI-26lang-2mil7 (fr_wanli)](https://huggingface.co/datasets/MoritzLaurer/multilingual-NLI-26lang-2mil7/viewer/default/fr_wanli) | 训练集24,996条 | 数据来源于机器翻译 | | [Lajavaness/SICK-fr](https://huggingface.co/datasets/Lajavaness/SICK-fr) | 训练集4,404条 / 验证集495条 / 测试集4,511条 | 数据来源于机器翻译 | | [ssilwal/CASS-civile-nli](https://huggingface.co/datasets/ssilwal/CASS-civile-nli) | 训练集53,140条 | 无额外说明 | | [maximoss/rte3-french](https://huggingface.co/datasets/maximoss/rte3-french) | 验证集800条 / 测试集800条 | 无额外说明 | | [maximoss/daccord-contradictions](https://huggingface.co/datasets/maximoss/daccord-contradictions) | 训练集1,034条 | 无额外说明 | ## 重复数据与数据泄露处理 此处列出的各数据集总和如下: DatasetDict({ train: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 556060 }) validation: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 3785 }) test: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 10321 }) }) 然而,训练集A中的某条数据可能不在A的测试集中,但却出现在B的测试集中,这会在拼接A+B数据集时引发数据泄露问题。重复数据也存在同样的逻辑隐患。因此我们需要对数据进行去重与清洗操作。 经过清理后,最终数据规模如下: DatasetDict({ train: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 555798 }) validation: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 3780 }) test: Dataset({ features: ['premise', 'hypothesis', 'label', 'dataset'], num_rows: 10317 }) }) ## 数据列说明 dataset_train = dataset['train'].to_pandas() dataset_train.head() premise hypothesis label dataset 0 L'écrémage conceptuel de la crème a deux dimen... Le produit et la géographie sont ce qui fait t... 1 xnli 1 Tu sais pendant la saison et je suppose qu'à t... Vous perdez les choses au niveau suivant si le... 0 xnli 2 Un de nos numéros vous fera suivre vos instruc... Un membre de mon équipe exécutera vos ordres a... 0 xnli 3 Qu'est-ce que tu en sais ? Tout ceci est à nou... Cette information leur appartient. 0 xnli 4 Ouais je te dis ce que si tu vas prix certaine... Les chaussures de tennis ont une gamme de prix. 1 xnli - `premise` 列:包含前提文本 - `hypothesis` 列:包含假设文本 - `label` 列:包含分类标签(0 → 蕴含,1 → 中立,2 → 矛盾) - `dataset` 列:标识该数据行的来源数据集,可用于后续筛选操作 ## 数据集拆分规则 - 训练集(train):由XNLI、fr_anli、fr_fever、fr_ling、fr_mnli、fr_wanli、SICK-fr、CASS-civile-nli拼接而成 - 验证集(validation):由XNLI与SICK-fr拼接而成 - 测试集(test):由XNLI与SICK-fr拼接而成 # 引用文献 ### Lajavaness/SICK-fr Dataset by Lajavaness (2023) https://huggingface.co/datasets/Lajavaness/SICK-fr by Lajavaness (2023) ### maximoss/daccord-contradictions Maximos Skandalis, Richard Moot, and Simon Robillard. 2023. DACCORD : un jeu de données pour la Détection Automatique d’énonCés COntRaDictoires en français. In Actes de CORIA-TALN 2023. Actes de la 30e Conférence sur le Traitement Automatique des Langues Naturelles (TALN), volume 1 : travaux de recherche originaux -- articles longs, pages 285–297, Paris, France. ATALA. ### maximoss/rte3-french Dataset by Maximos Skandalis (2023) https://huggingface.co/datasets/maximoss/rte3-french (2023) ### MoritzLaurer/multilingual-NLI-26lang-2mil7 @article{laurer_less_2022, title = {Less {Annotating}, {More} {Classifying} – {Addressing} the {Data} {Scarcity} {Issue} of {Supervised} {Machine} {Learning} with {Deep} {Transfer} {Learning} and {BERT} - {NLI}}, url = {https://osf.io/74b8k}, language = {en-us}, urldate = {2022-07-28}, journal = {Preprint}, author = {Laurer, Moritz and Atteveldt, Wouter van and Casas, Andreu Salleras and Welbers, Kasper}, month = jun, year = {2022}, note = {Publisher: Open Science Framework}, ### ssilwal/CASS-civile-nli Dataset by Silviya Silwal (2023) https://huggingface.co/datasets/ssilwal/CASS-civile-nli by Silviya Silwal (2023) ### XNLI @InProceedings{conneau2018xnli, author = {Conneau, Alexis and Rinott, Ruty and Lample, Guillaume and Williams, Adina and Bowman, Samuel R. and Schwenk, Holger and Stoyanov, Veselin}, title = {XNLI: Evaluating Cross-lingual Sentence Representations}, booktitle = {Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing}, year = {2018}, publisher = {Association for Computational Linguistics}, location = {Brussels, Belgium},} ### FrenchNLI @misc {frenchNLI_2025, author = { {BOURDOIS, Loïck} }, organization = { {Centre Aquitain des Technologies de l'Information et Electroniques} }, title = { frenchNLI (Revision 475d4f9) }, year = 2025, url = { https://huggingface.co/datasets/CATIE-AQ/frenchNLI }, doi = { 10.57967/hf/5943 }, publisher = { Hugging Face } } # 许可证 [cc-by-4.0](https://creativecommons.org/licenses/by/4.0/deed.en)



