ParlAI/blended_skill_talk
收藏资源简介:
BlendedSkillTalk数据集包含7k个对话,旨在展示多种对话模式,如展示个性、表达同理心和展示知识。数据集的语言为英语,数据来源于原始数据,标注由众包完成。数据集的结构包括训练集、验证集和测试集,分别包含4819、1009和980个样本。数据集的字段包括personas、additional_context、previous_utterance、context、free_messages、guided_messages、suggestions、guided_chosen_suggestions和label_candidates。
The BlendedSkillTalk dataset comprises 7,000 dialogues, designed to showcase a variety of dialogue patterns including expressing personality, conveying empathy, and demonstrating knowledge. The dataset is in English, with data sourced from original materials and annotations completed via crowdsourcing. Its structure includes training, validation, and test sets, which contain 4,819, 1,009, and 980 samples respectively. The fields of the dataset are personas, additional_context, previous_utterance, context, free_messages, guided_messages, suggestions, guided_chosen_suggestions, and label_candidates.
数据集概述
基本信息
- 数据集名称: BlendedSkillTalk
- 语言: 英语
- 许可: 未知
- 多语言性: 单语种
- 数据集大小: 1K<n<10K
- 源数据: 原始数据
- 任务类别: 对话生成
- 任务ID: dialogue-generation
- 论文ID: blended-skill-talk
数据集结构
特征
- personas: 字符串序列
- additional_context: 字符串
- previous_utterance: 字符串序列
- context: 字符串
- free_messages: 字符串序列
- guided_messages: 字符串序列
- suggestions: 包含以下字段的字典:
- convai2: 字符串
- empathetic_dialogues: 字符串
- wizard_of_wikipedia: 字符串
- guided_chosen_suggestions: 字符串序列
- label_candidates: 字符串序列的序列
数据分割
- 训练集: 4819个样本, 10830670字节
- 验证集: 1009个样本, 43961447字节
- 测试集: 980个样本, 44449895字节
下载和数据集大小
- 下载大小: 10897644字节
- 数据集大小: 99242012字节
配置
- 配置名称: default
- 数据文件:
- 训练集: data/train-*
- 验证集: data/validation-*
- 测试集: data/test-*




