coderchen01/MMSD2.0
收藏资源简介:
--- language: - en license: unknown size_categories: - 10K<n<100K task_categories: - feature-extraction - text-classification - image-classification - image-feature-extraction - zero-shot-classification - zero-shot-image-classification pretty_name: multimodal-sarcasm-dataset tags: - sarcasm - sarcasm-detection - mulitmodal-sarcasm-detection - sarcasm detection - multimodao sarcasm detection - tweets dataset_info: - config_name: mmsd-original features: - name: image dtype: image - name: text dtype: string - name: label dtype: int64 - name: id dtype: string splits: - name: train num_bytes: 1816845826.384 num_examples: 19816 - name: validation num_bytes: 260077790.0 num_examples: 2410 - name: test num_bytes: 262679920.717 num_examples: 2409 download_size: 2690517598 dataset_size: 2339603537.101 - config_name: mmsd-v1 features: - name: image dtype: image - name: text dtype: string - name: label dtype: int64 - name: id dtype: string splits: - name: train num_bytes: 1797951865.232 num_examples: 19557 - name: validation num_bytes: 259504817.817 num_examples: 2387 - name: test num_bytes: 261609842.749 num_examples: 2373 download_size: 2668004199 dataset_size: 2319066525.798 - config_name: mmsd-v2 features: - name: image dtype: image - name: text dtype: string - name: label dtype: int64 - name: id dtype: string splits: - name: train num_bytes: 1816541209.384 num_examples: 19816 - name: validation num_bytes: 260043003.0 num_examples: 2410 - name: test num_bytes: 262641462.717 num_examples: 2409 download_size: 2690267623 dataset_size: 2339225675.101 configs: - config_name: mmsd-original data_files: - split: train path: mmsd-original/train-* - split: validation path: mmsd-original/validation-* - split: test path: mmsd-original/test-* - config_name: mmsd-v1 data_files: - split: train path: mmsd-v1/train-* - split: validation path: mmsd-v1/validation-* - split: test path: mmsd-v1/test-* - config_name: mmsd-v2 data_files: - split: train path: mmsd-v2/train-* - split: validation path: mmsd-v2/validation-* - split: test path: mmsd-v2/test-* --- # MMSD2.0: Towards a Reliable Multi-modal Sarcasm Detection System This is a copy of the dataset uploaded on Hugging Face for easy access. The original data comes from this [work](https://aclanthology.org/2023.findings-acl.689/), which is an improvement upon a [previous study](https://aclanthology.org/P19-1239). ## Usage ```python from typing import TypedDict, cast import pytorch_lightning as pl from datasets import Dataset, load_dataset from torch import Tensor from torch.utils.data import DataLoader from transformers import CLIPProcessor class MMSDModelInput(TypedDict): pixel_values: Tensor input_ids: Tensor attention_mask: Tensor label: Tensor id: list[str] class MMSDDatasetModule(pl.LightningDataModule): def __init__( self, clip_ckpt_name: str = "openai/clip-vit-base-patch32", dataset_version: str = "mmsd-v2", max_length: int = 77, train_batch_size: int = 32, val_batch_size: int = 32, test_batch_size: int = 32, num_workers: int = 19, ) -> None: super().__init__() self.clip_ckpt_name = clip_ckpt_name self.dataset_version = dataset_version self.train_batch_size = train_batch_size self.val_batch_size = val_batch_size self.test_batch_size = test_batch_size self.num_workers = num_workers self.max_length = max_length def setup(self, stage: str) -> None: processor = CLIPProcessor.from_pretrained(self.clip_ckpt_name) def preprocess(example): inputs = processor( text=example["text"], images=example["image"], return_tensors="pt", padding="max_length", truncation=True, max_length=self.max_length, ) return { "pixel_values": inputs["pixel_values"], "input_ids": inputs["input_ids"], "attention_mask": inputs["attention_mask"], "label": example["label"], } self.raw_dataset = cast( Dataset, load_dataset("coderchen01/MMSD2.0", name=self.dataset_version), ) self.dataset = self.raw_dataset.map( preprocess, batched=True, remove_columns=["text", "image"], ) def train_dataloader(self) -> DataLoader: return DataLoader( self.dataset["train"], batch_size=self.train_batch_size, shuffle=True, num_workers=self.num_workers, ) def val_dataloader(self) -> DataLoader: return DataLoader( self.dataset["validation"], batch_size=self.val_batch_size, num_workers=self.num_workers, ) def test_dataloader(self) -> DataLoader: return DataLoader( self.dataset["test"], batch_size=self.test_batch_size, num_workers=self.num_workers, ) ``` ## References [1] Yitao Cai, Huiyu Cai, and Xiaojun Wan. 2019. Multi-Modal Sarcasm Detection in Twitter with Hierarchical Fusion Model. In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 2506–2515, Florence, Italy. Association for Computational Linguistics. [2] Libo Qin, Shijue Huang, Qiguang Chen, Chenran Cai, Yudi Zhang, Bin Liang, Wanxiang Che, and Ruifeng Xu. 2023. MMSD2.0: Towards a Reliable Multi-modal Sarcasm Detection System. In Findings of the Association for Computational Linguistics: ACL 2023, pages 10834–10845, Toronto, Canada. Association for Computational Linguistics.
language: - 英语(en) license: 未知 size_categories: - 10000 < 样本量 < 100000 task_categories: - 特征提取 - 文本分类 - 图像分类 - 图像特征提取 - 零样本分类(zero-shot-classification) - 零样本图像分类(zero-shot-image-classification) pretty_name: 多模态讽刺数据集(multimodal-sarcasm-dataset) tags: - 讽刺(sarcasm) - 讽刺检测(sarcasm-detection) - 多模态讽刺检测(multimodal-sarcasm-detection) - 讽刺检测(sarcasm detection) - 多模态讽刺检测(multimodal sarcasm detection) - 推文(tweets) dataset_info: - config_name: mmsd-original features: - name: 图像(image) dtype: 图像类型 - name: 文本(text) dtype: 字符串类型 - name: 标签(label) dtype: 64位整数类型 - name: 编号(id) dtype: 字符串类型 splits: - name: 训练集(train) num_bytes: 1816845826.384 num_examples: 19816 - name: 验证集(validation) num_bytes: 260077790.0 num_examples: 2410 - name: 测试集(test) num_bytes: 262679920.717 num_examples: 2409 download_size: 2690517598 dataset_size: 2339603537.101 - config_name: mmsd-v1 features: - name: 图像(image) dtype: 图像类型 - name: 文本(text) dtype: 字符串类型 - name: 标签(label) dtype: 64位整数类型 - name: 编号(id) dtype: 字符串类型 splits: - name: 训练集(train) num_bytes: 1797951865.232 num_examples: 19557 - name: 验证集(validation) num_bytes: 259504817.817 num_examples: 2387 - name: 测试集(test) num_bytes: 261609842.749 num_examples: 2373 download_size: 2668004199 dataset_size: 2319066525.798 - config_name: mmsd-v2 features: - name: 图像(image) dtype: 图像类型 - name: 文本(text) dtype: 字符串类型 - name: 标签(label) dtype: 64位整数类型 - name: 编号(id) dtype: 字符串类型 splits: - name: 训练集(train) num_bytes: 1816541209.384 num_examples: 19816 - name: 验证集(validation) num_bytes: 260043003.0 num_examples: 2410 - name: 测试集(test) num_bytes: 262641462.717 num_examples: 2409 download_size: 2690267623 dataset_size: 2339225675.101 configs: - config_name: mmsd-original data_files: - split: 训练集(train) path: mmsd-original/train-* - split: 验证集(validation) path: mmsd-original/validation-* - split: 测试集(test) path: mmsd-original/test-* - config_name: mmsd-v1 data_files: - split: 训练集(train) path: mmsd-v1/train-* - split: 验证集(validation) path: mmsd-v1/validation-* - split: 测试集(test) path: mmsd-v1/test-* - config_name: mmsd-v2 data_files: - split: 训练集(train) path: mmsd-v2/train-* - split: 验证集(validation) path: mmsd-v2/validation-* - split: 测试集(test) path: mmsd-v2/test-* # MMSD2.0:迈向可靠的多模态讽刺检测系统 本数据集为上传至Hugging Face的副本,旨在便于获取。原始数据源自此项[研究](https://aclanthology.org/2023.findings-acl.689/),该研究是对此前一项[研究](https://aclanthology.org/P19-1239)的改进。 ## 使用方法 python from typing import TypedDict, cast import pytorch_lightning as pl from datasets import Dataset, load_dataset from torch import Tensor from torch.utils.data import DataLoader from transformers import CLIPProcessor class MMSDModelInput(TypedDict): pixel_values: Tensor input_ids: Tensor attention_mask: Tensor label: Tensor id: list[str] class MMSDDatasetModule(pl.LightningDataModule): def __init__( self, clip_ckpt_name: str = "openai/clip-vit-base-patch32", dataset_version: str = "mmsd-v2", max_length: int = 77, train_batch_size: int = 32, val_batch_size: int = 32, test_batch_size: int = 32, num_workers: int = 19, ) -> None: super().__init__() self.clip_ckpt_name = clip_ckpt_name self.dataset_version = dataset_version self.train_batch_size = train_batch_size self.val_batch_size = val_batch_size self.test_batch_size = test_batch_size self.num_workers = num_workers self.max_length = max_length def setup(self, stage: str) -> None: processor = CLIPProcessor.from_pretrained(self.clip_ckpt_name) def preprocess(example): inputs = processor( text=example["text"], images=example["image"], return_tensors="pt", padding="max_length", truncation=True, max_length=self.max_length, ) return { "pixel_values": inputs["pixel_values"], "input_ids": inputs["input_ids"], "attention_mask": inputs["attention_mask"], "label": example["label"], } self.raw_dataset = cast( Dataset, load_dataset("coderchen01/MMSD2.0", name=self.dataset_version), ) self.dataset = self.raw_dataset.map( preprocess, batched=True, remove_columns=["text", "image"], ) def train_dataloader(self) -> DataLoader: return DataLoader( self.dataset["train"], batch_size=self.train_batch_size, shuffle=True, num_workers=self.num_workers, ) def val_dataloader(self) -> DataLoader: return DataLoader( self.dataset["validation"], batch_size=self.val_batch_size, num_workers=self.num_workers, ) def test_dataloader(self) -> DataLoader: return DataLoader( self.dataset["test"], batch_size=self.test_batch_size, num_workers=self.num_workers, ) ## 参考文献 [1] 蔡一涛, 蔡惠宇, 万小俊. 2019. 基于分层融合模型的Twitter多模态讽刺检测. 见:第57届国际计算语言学协会年会会议录, 意大利佛罗伦萨, 国际计算语言学协会, 第2506–2515页. [2] 秦立博, 黄诗珏, 陈启光, 蔡陈然, 张宇迪, 梁斌, 车万翔, 徐睿峰. 2023. MMSD2.0:迈向可靠的多模态讽刺检测系统. 见:国际计算语言学协会2023年研究发现, 加拿大多伦多, 国际计算语言学协会, 第10834–10845页.
数据集概述
基本信息
- 名称: multimodal-sarcasm-dataset
- 标签:
- sarcasm
- sarcasm-detection
- mulitmodal-sarcasm-detection
- sarcasm detection
- multimodao sarcasm detection
- tweets
- 任务类别:
- feature-extraction
- text-classification
- image-classification
- image-feature-extraction
- zero-shot-classification
- zero-shot-image-classification
- 大小范围: 10K<n<100K
- 语言: en
- 许可证: unknown
数据集配置
-
mmsd-original
- 特征:
- image: dtype: image
- text: dtype: string
- label: dtype: int64
- id: dtype: string
- 分割:
- train: num_examples: 19816, num_bytes: 1816845826.384
- validation: num_examples: 2410, num_bytes: 260077790.0
- test: num_examples: 2409, num_bytes: 262679920.717
- 下载大小: 2690517598
- 数据集大小: 2339603537.101
- 特征:
-
mmsd-v1
- 特征:
- image: dtype: image
- text: dtype: string
- label: dtype: int64
- id: dtype: string
- 分割:
- train: num_examples: 19557, num_bytes: 1797951865.232
- validation: num_examples: 2387, num_bytes: 259504817.817
- test: num_examples: 2373, num_bytes: 261609842.749
- 下载大小: 2668004199
- 数据集大小: 2319066525.798
- 特征:
-
mmsd-v2
- 特征:
- image: dtype: image
- text: dtype: string
- label: dtype: int64
- id: dtype: string
- 分割:
- train: num_examples: 19816, num_bytes: 1816541209.384
- validation: num_examples: 2410, num_bytes: 260043003.0
- test: num_examples: 2409, num_bytes: 262641462.717
- 下载大小: 2690267623
- 数据集大小: 2339225675.101
- 特征:
数据文件配置
-
mmsd-original
- 训练数据: mmsd-original/train-*
- 验证数据: mmsd-original/validation-*
- 测试数据: mmsd-original/test-*
-
mmsd-v1
- 训练数据: mmsd-v1/train-*
- 验证数据: mmsd-v1/validation-*
- 测试数据: mmsd-v1/test-*
-
mmsd-v2
- 训练数据: mmsd-v2/train-*
- 验证数据: mmsd-v2/validation-*
- 测试数据: mmsd-v2/test-*




