OpenViDial 2.0
收藏官方服务:
资源简介:
OpenViDial 2.0 包含从不同资源的电影或电视剧中提取的总共 560 万个对话轮次,每个对话轮次都与其对应的视觉上下文配对。我们希望这个大规模的数据集可以帮助促进未来对开放域多模态对话生成的研究,例如用于对话生成的多模态预训练。
OpenViDial 2.0 contains a total of 5.6 million dialogue turns extracted from movies and TV series across diverse sources, with each dialogue turn paired with its corresponding visual context. We anticipate that this large-scale dataset will facilitate future research on open-domain multimodal dialogue generation, such as multimodal pre-training for dialogue generation.
提供机构:
OpenDataLab创建时间:
2022-06-07
搜集汇总
数据集介绍

背景与挑战
背景概述
OpenViDial 2.0是一个大规模多模态对话数据集,包含从影视资源中提取的560万个对话轮次,每个轮次均配有视觉上下文。该数据集旨在支持开放域多模态对话生成的研究与应用,由北京大学、浙江大学和香侬科技于2021年联合发布。
以上内容由遇见数据集搜集并总结生成



