遇见数据集

JudSacr/piaf_fr_prompt_question_generation_with_context

收藏
Hugging Face2026-05-21 更新2026-05-31 收录
官方服务:

资源简介:

piaf_fr_prompt_question_generation_with_context 是法语提示数据集(DFP)的一个子集,包含442,752行数据,专门用于带上下文的问答生成任务。原始数据来自PIAF数据集,并通过FrenchQA数据集以SQUAD 2.0格式增强了问题。应用了24个法语提示模板(包括直陈式、你称呼和您称呼形式)来构建输入和目标列,使其格式与Muennighoff等人的xP3数据集保持一致。数据集仅提供训练集,无验证集和测试集。

语言: - 法语 许可证:MIT 规模类别: - 10万条 < 数据量 < 100万条 任务类别: - 文本生成 标签: - DFP(法语提示数据集,Dataset of French Prompts) - 法语提示 标注来源: - 公开采集 语言来源: - 公开采集 多语言属性: - 单语 源数据集: - etalab-ia/piaf # piaf_fr_prompt_question_generation_with_context ## 摘要 **piaf_fr_prompt_question_generation_with_context** 是**法语提示数据集(Dataset of French Prompts,简称DFP)**的子集,其Hugging Face数据集地址为https://huggingface.co/datasets/CATIE-AQ/DFP。该数据集包含442,752条样本,可用于带上下文的问题生成任务。其原始无提示数据源自数据集[PIAF](https://huggingface.co/datasets/etalab-ia/piaf),并通过[FrenchQA](https://huggingface.co/datasets/CATIE-AQ/frenchQA)数据集补充了符合斯坦福问答数据集2.0(SQuAD 2.0)格式的法语问题。随后通过应用一系列预设提示(详见下文)构建了输入列与目标列,使其格式与Muennighoff等人发布的[xP3](https://huggingface.co/datasets/bigscience/xP3)数据集保持一致。 ## 使用的提示词 ### 提示词列表 本数据集共设计24条提示词,设计逻辑涵盖直陈式时态,同时区分了法语中的亲昵式(使用tu称呼)与尊称式(使用vous称呼)两种表达形式。 '"'+context+'" Générer une question à partir du texte ci-dessus : ', '"'+context+'" Génère une question à partir du texte ci-dessus : ', '"'+context+'" Générez une question à partir du texte ci-dessus : ', '"'+context+'" Trouver une question à partir du texte ci-dessus : ', '"'+context+'" Trouve une question à partir du texte ci-dessus : ', '"'+context+'" Trouvez une question à partir du texte ci-dessus : ', '"'+context+'" Créer une bonne question à partir du texte ci-dessus : ', '"'+context+'" Crée trouver une bonne question à partir du texte ci-dessus : ', '"'+context+'" Créez trouver une bonne question à partir du texte ci-dessus : ', '"'+context+'" Ecrire une bonne question à partir du texte ci-dessus : ', '"'+context+'" Ecris une bonne question à partir du texte ci-dessus : ', '"'+context+'" Ecrivez une bonne question à partir du texte ci-dessus : ', 'Générer une bonne question pour le texte suivant : "'+context+'"', 'Génère une bonne question pour le texte suivant : "'+context+'"', 'Générez une bonne question pour le texte suivant : "'+context+'"', 'Trouver une bonne question pour le texte suivant : "'+context+'"', 'Trouve une bonne question pour le texte suivant : "'+context+'"', 'Trouvez trouver une bonne question pour le texte suivant : "'+context+'"', 'Créer une bonne question pour le texte suivant : "'+context+'"', 'Crée trouver une bonne question pour le texte suivant : "'+context+'"', 'Créez trouver une bonne question pour le texte suivant : "'+context+'"', 'Ecrire une bonne question pour le texte suivant : "'+context+'"', 'Ecris une bonne question pour le texte suivant : "'+context+'"', 'Ecrivez une bonne question pour le texte suivant : "'+context+'"' ## 数据集划分 - 训练集:共442,752条样本 - 无验证集划分 - 无测试集划分 ## 使用方法 from datasets import load_dataset dataset = load_dataset("CATIE-AQ/piaf_fr_prompt_question_generation_with_context") ## 引用 ### 原始数据引用 @InProceedings{keraron-EtAl:2020:LREC, author = {Keraron, Rachel and Lancrenon, Guillaume and Bras, Mathilde and Allary, Frédéric and Moyse, Gilles and Scialom, Thomas and Soriano-Morales, Edmundo-Pavel and Staiano, Jacopo}, title = {Project PIAF: Building a Native French Question-Answering Dataset}, booktitle = {Proceedings of The 12th Language Resources and Evaluation Conference}, month = {May}, year = {2020}, address = {Marseille, France}, publisher = {European Language Resources Association}, pages = {5483--5492}, url = {https://www.aclweb.org/anthology/2020.lrec-1.673} } ### 本数据集引用 @misc {centre_aquitain_des_technologies_de_l'information_et_electroniques_2023, author = { {BOURDOIS, Loïck} }, organization = { {Centre Aquitain des Technologies de l'Information et Electroniques} }, title = { Dataset of French Prompts (DFP) (Revision 1d24c09) }, year = 2023, url = { https://huggingface.co/datasets/CATIE-AQ/DFP }, doi = { 10.57967/hf/1200 }, publisher = { Hugging Face } } ## 许可证:MIT

提供机构:
JudSacr
二维码
社区交流群
二维码
科研交流群
商业服务