passing2961/dialogcc
收藏资源简介:
DialogCC是一个公开的高质量、多样化的多模态对话数据集,包含每个对话和发言的多种图像。数据集通过自动化的框架创建,涉及收集源对话数据集和图像-描述对数据集,利用GPT-4和CLIP技术进行图像与对话的对齐,并通过CLIP相似性过滤不合适的图像。数据集的结构包括对话ID、对话内容、分割信息等字段,且每个对话条目包含多个字典,每个字典包含发言、发言人、理由、共享图像和描述等信息。数据集主要用于学术和研究目的,且由于包含来自DailyDialog数据集的内容,因此共享在CC-BY-NC-SA 4.0许可证下。
DialogCC is a publicly available high-quality and diverse multi-modal dialogue dataset that contains various images per dialogue and utterance, respectively. The dataset is created through an automated framework that involves collecting source dialogue datasets and image-caption pair datasets, aligning the most appropriate images to the dialogue using GPT-4 and CLIP, and filtering inappropriate images based on CLIP similarity. The dataset structure includes fields such as dialogue ID, dialogue content, and split information, with each dialogue entry containing multiple dictionaries that include utterance, speaker, rationale, shared image, and description. The dataset is primarily intended for academic and research purposes and is shared under the CC-BY-NC-SA 4.0 license due to its incorporation of content from the DailyDialog dataset.
数据集概述
数据集名称
DialogCC
数据集描述
DialogCC是一个公开的高质量、多样化的多模态对话数据集,每个对话和话语都包含多种图像。
语言
英语
数据集结构
字段
dialogue_id: 对话标识符,包含原始文本对话类型(如bst)和索引。dialogue: 对话列表,每个条目包括{utterance_idx, utterance, speaker, rationale, shared_image, description}。split: 分割信息,包括{train, valid, test}。
对话类型
- "bst" (BlendedSkillTalk)
- "empathy" (EmpatheticDialogues)
- "daily" (DailyDialog)
- "wow" (Wizard-of-Wikipedia)
- "persona" (Persona-Chat)
图像信息
- 共享图像字段是一个字典列表,每个条目包含"image_url"和"caption",均来自CC3M数据集。
数据集创建
数据集通过自动化框架创建,包括收集源对话数据集和图像-标题对数据集,利用GPT-4和CLIP对齐最合适的图像,并基于CLIP相似性过滤不适当的图像。
数据集大小
- 数据集总大小: 83,370
- 训练集: 68,402
- 验证集: 7,644
- 测试集: 7,324
许可证
CC-BY-NC-SA-4.0




