MultiCaption
收藏资源简介:
MultiCaption是由圣地亚哥德孔波斯特拉大学等机构联合构建的多模态多语言矛盾检测数据集,包含64种语言的11,088对视觉声明(图像/视频配文)。该数据集通过专业事实核查员标注和大型语言模型验证,构建了声明间的矛盾关系标签。数据源自社交媒体真实谣言案例,采用人工校验、声明-帖子关联和自扩展三重标注策略,涵盖单语和跨语言场景。其核心价值在于为多语言环境下的虚假信息检测提供基准,尤其针对视觉内容被恶意重利用的典型谣言传播场景,推动跨模态矛盾识别技术的发展。
MultiCaption is a multimodal and multilingual contradiction detection dataset jointly constructed by the University of Santiago de Compostela and other institutions. It contains 11,088 pairs of visual claims (image/video with paired captions) across 64 languages. The dataset establishes contradiction relationship labels between claims through annotation by professional fact-checkers and validation via large language models. Its data originates from real social media rumor cases, and adopts a triple annotation strategy consisting of manual verification, claim-post association and self-expansion, covering both monolingual and cross-lingual scenarios. Its core value lies in providing a benchmark for disinformation detection in multilingual environments, especially targeting the typical rumor propagation scenario where visual content is maliciously repurposed, so as to promote the development of cross-modal contradiction recognition technology.
MultiCaption: Dataset for detecting disinformation using multilingual visual claims
基本信息
- 数据集名称: MultiCaption: Dataset for detecting disinformation using multilingual visual claims
- 发布日期: 2026年1月13日
- 版本: v1
- 访问状态: 数据集文件受限制访问(记录公开,但文件仅限有权限的用户访问)
- 资源类型: 数据集
- 发布者: Zenodo
- DOI: 10.5281/zenodo.18230659
- 许可证: Creative Commons Attribution 4.0 International
创建者
- Rafael Martins, Frade (Researcher)
- Panchendrarajan, Rrubaa (Researcher)
- Arkaitz Zubiaga (Supervisor)
所属机构
- Universidade de Santiago de Compostela
- Queen Mary University of London
- National University of Distance Education
数据集描述
MultiCaption 是一个多语言数据集,旨在通过矛盾的视觉声明来识别虚假信息。该数据集包含指向同一图像或视频的声明对,并通过多种策略进行标注,以确定它们是否相互矛盾。最终的数据集包含 64 种语言的 11,088 个视觉声明,为在真正的多模态和多语言环境中构建和评估虚假信息检测系统提供了独特的资源。
数据集构成
数据集包含训练集和测试集两个部分,具体构成如下:
| 集别 | 矛盾对数量 | 非矛盾对数量 | 总对数 | 语言数量 |
|---|---|---|---|---|
| 训练集 | 4020 | 4767 | 8795 | 59 |
| 测试集 | 2415 | 2505 | 4920 | 52 |
数据内容字段
- cid_1, cid_2: 原始数据集 MultiClaim v2 中的事实核查声明ID。
- claim_1, claim_2: 原始语言的声明。
- claim_1_en, claim_2_en: 声明的英文翻译。
- type_1, type_2: 声明类型,包括
claim(原始声明)、title(从相应事实核查文章标题中检索的声明)或synthetic_title/synthetic_claim(使用 GPT5 从title或claim生成的释义)。 - language_1, language_2: 声明的语言。
- label_name: 标签名称,指示
contradicting(矛盾)或non-contradicting(非矛盾)。 - label: 数值标签,1 表示
contradicting,0 表示non-contradicting。 - label_strategy: 用于标注的策略,包括
Manual、Self-Expansion、Claim-Pair-Link、LLM-Annotation、GP5-paraphrase。
相关资源
-
预印本: https://arxiv.org/abs/2601.11220
-
引用文献:
@misc{frade2026multicaption, title={MultiCaption: Detecting disinformation using multilingual visual claims}, author={Rafael Martins Frade and Rrubaa Panchendrarajan and Arkaitz Zubiaga}, year={2026}, eprint={2601.11220}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2601.11220}, }
访问条件
请求访问数据集文件需满足以下条件:
- 仅将数据集严格用于研究目的。访问请求必须来自相关大学、院系或其他科学或研究机构的官方且现有的电子邮件地址(用于验证)。
- 不得将数据集(或其任何部分)重新分享给未包含在此请求中的任何人。
- 在任何使用此数据集的出版物、项目或工具中,必须适当引用数据集描述中提到的论文。
- 理解数据集的创建方式,并且手动或自动预测的标注可能并非 100% 正确。
- 承认对数据集(数据)的使用以及因超出预期目的使用而可能产生的任何第三方权利(特别是版权)侵权负全部责任。
资助信息
- 资助方: European Commission
- 项目: HYBRIDS - Hybrid Intelligence to monitor, promote and analyse transformations in good democracy practices
- 项目编号: 101073351
统计信息(截至本版本)
- 总浏览量: 18
- 总下载量: 7
- 总数据量: 13.1 MB
索引与社区
- 索引于: OpenAIRE
- 所属社区: HYBRIDS HORIZON-MSCA-2021-DN
- 属于: EU Open Research Repository




