遇见数据集

CATIE-AQ/newsquadfr_fr_prompt_question_generation_with_context

收藏
Hugging Face2025-02-10 更新2024-03-04 收录
官方服务:

资源简介:

newsquadfr_fr_prompt_question_generation_with_context是一个包含101,040行数据的数据集,专门设计用于带有上下文的问题生成任务。该数据集是Dataset of French Prompts (DFP)的子集,原始数据来自newsquadfr,并通过FrenchQA数据集中的问题进行增强。数据集使用了24个提示,这些提示旨在通过不同的语气和称呼方式生成问题。数据集分为训练集(79,200样本)和验证集(21,800样本),没有测试集。

newsquadfr_fr_prompt_question_generation_with_context是一个包含101,040行数据的数据集,专门设计用于带有上下文的问题生成任务。该数据集是Dataset of French Prompts (DFP)的子集,原始数据来自newsquadfr,并通过FrenchQA数据集中的问题进行增强。数据集使用了24个提示,这些提示旨在通过不同的语气和称呼方式生成问题。数据集分为训练集(79,200样本)和验证集(21,800样本),没有测试集。

提供机构:
CATIE-AQ
原始信息汇总

数据集概述

基本信息

  • 语言: 法语
  • 许可: CC BY-NC-SA 4.0
  • 数据规模: 100K<n<1M
  • 任务类别: 文本生成
  • 标签: DFP, french prompts
  • 注释创建者: found
  • 语言创建者: found
  • 多语言性: 单语种
  • 源数据集: newsquadfr

详细描述

newsquadfr_fr_prompt_question_generation_with_contextDataset of French Prompts (DFP) 的一个子集。
该数据集包含 101,040 行,可用于带上下文的问题生成任务。
原始数据(无提示)来自 newsquadfr 数据集,并通过 FrenchQA 数据集中的 SQUAD 2.0 格式问题进行了增强。
随后应用了一系列提示(见下文),以构建输入和目标列,从而获得与 Muennighoff 等人的 xP3 数据集相同的格式。

提示列表

该数据集使用了 24 个提示,逻辑上包括陈述语气、第二人称单数和第二人称复数形式。

plaintext "+context+" Générer une question à partir du texte ci-dessus : ,
"+context+" Génère une question à partir du texte ci-dessus : ,
"+context+" Générez une question à partir du texte ci-dessus : ,
"+context+" Trouver une question à partir du texte ci-dessus : ,
"+context+" Trouve une question à partir du texte ci-dessus : ,
"+context+" Trouvez une question à partir du texte ci-dessus : ,
"+context+" Créer une bonne question à partir du texte ci-dessus : ,
"+context+" Crée trouver une bonne question à partir du texte ci-dessus : ,
"+context+" Créez trouver une bonne question à partir du texte ci-dessus : ,
"+context+" Ecrire une bonne question à partir du texte ci-dessus : ,
"+context+" Ecris une bonne question à partir du texte ci-dessus : ,
"+context+" Ecrivez une bonne question à partir du texte ci-dessus : ,
Générer une bonne question pour le texte suivant : "+context+",
Génère une bonne question pour le texte suivant : "+context+",
Générez une bonne question pour le texte suivant : "+context+",
Trouver une bonne question pour le texte suivant : "+context+",
Trouve une bonne question pour le texte suivant : "+context+",
Trouvez trouver une bonne question pour le texte suivant : "+context+",
Créer une bonne question pour le texte suivant : "+context+",
Crée trouver une bonne question pour le texte suivant : "+context+",
Créez trouver une bonne question pour le texte suivant : "+context+",
Ecrire une bonne question pour le texte suivant : "+context+",
Ecris une bonne question pour le texte suivant : "+context+",
Ecrivez une bonne question pour le texte suivant : "+context+"

数据分割

  • train: 79,200 样本
  • valid: 21,800 样本
  • test 分割

使用方法

python from datasets import load_dataset dataset = load_dataset("CATIE-AQ/newsquadfr_fr_prompt_question_generation_with_context")

引用

原始数据

Hugging Face repository: https://huggingface.co/datasets/lincoln/newsquadfr

本数据集

@misc {centre_aquitain_des_technologies_de_linformation_et_electroniques_2023,
author = { {Centre Aquitain des Technologies de lInformation et Electroniques} },
title = { DFP (Revision 1d24c09) },
year = 2023,
url = { https://huggingface.co/datasets/CATIE-AQ/DFP },
doi = { 10.57967/hf/1200 },
publisher = { Hugging Face }
}

许可

CC BY-NC-SA 4.0

搜集汇总
数据集介绍
CATIE-AQ/newsquadfr_fr_prompt_question_generation_with_context 数据集图片
构建方式
该数据集源自法语文档理解领域,其构建基于对现有法语问答数据集的深度整合与改造。具体而言,以新闻领域问答数据集newsquadfr为原始语料,该语料已包含SQUAD 2.0格式的问题标注,并经由FrenchQA数据集增强。在此基础上,研究团队精心设计了24条法语提示模板,涵盖直陈式、敬语与非敬语等多种语言变体,将原始上下文与问题对转化为统一的输入-目标格式,最终形成与xP3数据集结构兼容的提示学习数据集,共计101,040条样本。
特点
该数据集的核心特色在于其独特的提示工程设计与法语语言适配性。通过系统性地融合直陈式、敬语与非敬语等24种提示变体,数据集能够有效覆盖法语中丰富的社交语用差异,为模型提供多样化的指令理解训练素材。此外,数据规模达到十万级,划分为训练集(79,200条)与验证集(21,800条),在保证充足训练数据的同时,也提供了可靠的性能评估基础。其基于新闻文本的领域特性,使得生成的问答任务具有真实语境与知识密度。
使用方法
该数据集的使用极为便捷,完全集成于HuggingFace生态系统之中。用户只需通过Python环境调用datasets库的load_dataset函数,指定数据集标识符'CATIE-AQ/newsquadfr_fr_prompt_question_generation_with_context',即可一键加载完整数据。加载后的数据集包含标准的训练集与验证集划分,可直接用于序列到序列模型的微调训练,或作为提示学习场景下的评估基准。建议研究者将其作为法语自然语言生成任务中,上下文相关问题生成能力的测试平台。
背景与挑战
背景概述
在自然语言处理领域,基于上下文的问句生成任务对于提升机器阅读理解与对话系统的交互能力至关重要。CATIE-AQ团队于2023年创建的newsquadfr_fr_prompt_question_generation_with_context数据集,依托法国阿基坦信息技术与电子中心的研究力量,旨在解决法语语境下问句生成的数据稀缺问题。该数据集源自NewsquadFR语料库,并融合了SQUAD 2.0格式的FrenchQA标注,通过精心设计的24条提示模板,构建了101,040条样本,覆盖了命令式与尊称式等多种语言变体。作为法语提示数据集(DFP)的重要子集,它为多任务学习与跨语言迁移研究提供了标准化资源,显著推动了法语自然语言生成领域的发展。
当前挑战
当前数据集面临的核心挑战包括:首先,法语问句生成任务需处理复杂的语法结构、时态一致性及语域差异,例如命令式与尊称式的正确使用,这对模型的语言理解能力提出高要求。其次,构建过程中,原始NewsquadFR数据需通过FrenchQA进行人工或半自动标注,确保问句与上下文的语义关联性,但标注质量与一致性难以完全保证。此外,提示模板的设计需平衡多样性与通用性,避免引入偏见或冗余。最后,数据集的训练集(79,200条)与验证集(21,800条)划分合理,但缺乏独立的测试集,可能影响模型泛化能力的客观评估,且法语领域特定术语的覆盖范围仍有待扩展。
常用场景
经典使用场景
在自然语言处理领域,基于上下文的法语问题生成任务一直是研究的热点与难点。该数据集专为法语语境下的问题生成而设计,提供了超过十万条经过精心构造的样本,每条样本均包含新闻文本上下文与对应的提示模板,使得模型能够学习如何根据给定段落自动生成合理且语义连贯的法语问题。其经典使用场景在于训练和评估基于Transformer架构的序列到序列模型,如T5、BART或mT5,以提升模型在法语问答系统中的问题生成能力。
衍生相关工作
该数据集作为法国提示数据集(DFP)的重要组成部分,衍生了一系列相关经典工作。其构建范式启发了后续对法语多任务提示学习的研究,例如将问题生成与摘要、翻译等任务结合的统一预训练模型。此外,基于该数据的提示模板设计思路,研究者进一步探索了法语中敬语与口语形式对生成质量的影响,催生了关于提示语言风格适配性的专项分析。该数据集还被用作基线评估,对比了不同模型在法语问题生成上的表现,为后续如FrenchQA等更复杂的问答数据集提供了数据基础与方法论参考。
数据集最近研究
最新研究方向
在自然语言处理领域,面向法语的提示学习与问题生成任务正成为多语言模型能力提升的关键突破口。newsquadfr_fr_prompt_question_generation_with_context数据集以新闻语料为基座,融合SQUAD 2.0格式的高质量问答对,并创新性地设计了涵盖敬语与平语、多种祈使句式在内的24种法语提示模板,构建了规模逾10万条的指令微调数据。该数据集直接服务于少样本学习与零样本泛化场景,其设计理念与xP3等跨语言提示数据集一脉相承,但聚焦法语单语场景,填补了高资源语言之外精细提示工程的研究空白。当前,围绕该数据集的前沿方向包括:探索提示多样性对生成问题质量与语义覆盖度的影响、评估不同复杂度提示下预训练语言模型的迁移表现,以及将其融入法语对话系统与教育问答工具链。这一数据资源的开源,为法语NLP社区提供了标准化的评测基准,推动了非英语语言在可控文本生成、指令遵循能力等热点议题上的实证研究,对弥合多语言AI发展中的资源鸿沟具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务