COSMMIC
收藏资源简介:
COSMMIC是一个创新的多模态多语言数据集,包含印度九种主要语言的4,959篇文章图像对和24,484条读者评论,所有语言都提供人工撰写的真实摘要。该数据集是印度语言资源领域的先驱,旨在推动NLP研究和促进包容性。它涵盖了Bengali、Hindi、Gujarati、Marathi、Malayalam、Odia、Tamil、Telugu和Kannada等九种主要语言,数据量相较于现有印度语言数据集具有显著优势。
COSMMIC is an innovative multimodal and multilingual dataset that contains 4,959 article-image pairs and 24,484 reader comments across nine major Indian languages, with human-written ground-truth summaries available for all languages. As a pioneering resource in the field of Indian language resources, this dataset aims to advance NLP research and promote inclusivity. It covers nine prominent Indian languages including Bengali, Hindi, Gujarati, Marathi, Malayalam, Odia, Tamil, Telugu, and Kannada, and features a significantly larger scale compared to existing Indian language datasets.
COSMMIC数据集概述
基本信息
- 全称: Comment-Sensitive Multimodal Multilingual Indian Corpus
- 类型: 多模态多语言数据集
- 主要用途: 摘要生成和标题生成
- 覆盖语言: 9种印度主要语言(孟加拉语、印地语、泰米尔语、泰卢固语、马拉地语、古吉拉特语、卡纳达语、马拉雅拉姆语、奥里亚语)
数据集规模
- 文章-图像对: 4,959个
- 用户评论: 24,484条
数据结构
- 每个语言文件夹包含:
Reference Summary: 每篇文章的真实摘要Headline: 每篇文章的真实标题
关键特性
- 多模态性: 每篇文章关联一个图像
- 评论敏感性: 整合读者评论以增强上下文摘要
- 人工标注: 所有语言的文章均有人工标注的摘要和标题
研究贡献
- 多语言多模态整合: 统一整合文章文本、图像和用户评论
- 评论感知摘要: 使用IndicBERT分类器筛选支持性和无噪声评论
- 图像在NLG中的效用: 使用多语言CLIP提取图像的语义信息
- 四种配置评估:
- 仅文章文本
- 文章+评论
- 文章+图像
- 文章+评论+图像
- 基准测试: 使用LLama3、GPT-4等先进模型进行标题生成和摘要评估
使用工具
- IndicBERT: 用于评论分类
- 多语言CLIP: 用于图像特征提取
- LLama3、GPT-4: 用于NLG基准测试
- 自定义指标: 用于评估评论效用和摘要质量
引用信息
bibtex @inproceedings{your2025cosmmic, title={COSMMIC: A Comment-Sensitive Multimodal Multilingual Corpus for Indian Language Summarization}, author={Raghvendra Kumar, Mohammed Salman S A, Aryan Sahu, Tridib Nandi, Pragathi Y P, Sriparna Saha, Jose G Moreno}, booktitle={Proceedings of ACL 2025}, year={2025} }
目标
- 促进印度多样化语言社区的公平和丰富建模
- 推动包容性和可访问的人工智能发展




