相关数据集
Chinese CQA Dataset
该数据集是一个精心构建的集合,包含了对话式的问答对,并对其进行了问题重构、关键词提取以及检索段落有用性的标注。此外,数据集还包括了重构后的问题、提取的关键词以及评估检索段落在对话式问答中的应用效果的特征。该数据集的规模为1229组问答对,旨在推动对话式问答(CQA)领域的研究,特别是针对RAG(一种问答系统)的增强研究。
arXiv700
TFTC
IWSLT2017-zh-en;WMT18-zh-en;CoQAThe IWSLT 2017 Multilingual Task addresses text translation, including zero-shot translation, with a single MT system across all directions including English, German, D
DataCite Commons2024-11-07 更新290
CoQA Conversational Question Answering Dataset 🦄
127k+ questions with answers collected from 8k+ conversations from Stanford NLP
kaggle2020-01-25 更新110
Conversational QA Dataset
Conversational QA Dataset是一个自动生成的对话式问答数据集,由韩国浦项科技大学人工智能研究生院创建。该数据集通过从输入文本中提取有价值的问题短语,并结合先前的对话历史来生成问答对。数据集的创建过程包括上下文答案提取和对话式问题生成两个阶段,旨在通过简单的答案修订方法显著提高合成数据的质量。该数据集主要应用于对话式问答系统的领域适应性研究,以解决特定领域内构建健壮问答系统所需
arXiv2022-09-23 更新290
AlderleyAI/squad_chat
Squad_Chat数据集是SQuAD2.0数据集的修改版本,旨在通过将问答对转换为更对话式的格式,支持大型语言模型在上下文问答或文档问答任务中的微调训练。该数据集结合了SQuAD1.1的10万个问题和SQuAD2.0的5万个无法回答的问题,要求系统不仅能在有答案时提供准确答案,还能在段落不支持答案时判断并避免回答。数据集包含CSV和JSONL两种格式,数据字段包括id、title、context
Hugging Face2023-06-28 更新150



