McQueen
收藏资源简介:
McQueen数据集是由中国香港中文大学和阿里巴巴集团联合创建的大规模数据集,包含15,000个视觉对话和超过80,000个查询,每个查询都配有完整指定的重写版本。数据集通过手动注释收集,旨在支持多模态会话查询重写(McQR)任务,解决对话中信息省略和指代问题。此外,数据集还提供了重写中出现的实体的图像框注释,以辅助下游任务如实体指代检测。McQueen数据集的应用领域主要集中在改进多轮对话模型,通过重写查询来消除指代和省略,从而将复杂的对话模型问题简化为单轮版本。
The McQueen Dataset is a large-scale dataset jointly created by The Chinese University of Hong Kong and Alibaba Group. It contains 15,000 visual dialogues and over 80,000 queries, each paired with a fully specified rewritten version. Collected via manual annotation, it aims to support the multimodal conversational query rewriting (McQR) task, addressing the issues of information omission and reference resolution in dialogues. Additionally, the dataset provides image bounding box annotations for entities appearing in the rewritten queries to assist downstream tasks such as entity reference detection. The main application scenarios of the McQueen Dataset focus on improving multi-turn dialogue models: by rewriting queries to eliminate references and omissions, complex multi-turn dialogue modeling problems can be simplified to single-turn ones.

- 1McQueen: a Benchmark for Multimodal Conversational Query Rewrite中国香港中文大学 · 2022年



