遇见数据集

MMDS-Bench

收藏
arXiv2026-08-31 更新2026-09-02 收录
官方服务:

资源简介:

MMDS-Bench是一个专为社交媒体多模态动态立场分类设计的诊断基准,由武汉大学与上海创新研究院联合构建。该数据集包含3,482个多模态父-回复实例,覆盖七类立场标签,并额外设有800个实例的推理诊断子集。数据源自X平台,通过多领域关键词收集,经严格筛选与人工标注,定义了多模态融合、父消息框架等五类挑战因子。该基准旨在评估多模态大语言模型在复杂交互场景下的立场推理能力,尤其关注跨模态信号理解与关系推断的协同挑战。

MMDS-Bench is a diagnostic benchmark specifically designed for multimodal dynamic stance classification on social media, jointly developed by Wuhan University and Shanghai Institute of Innovation. This dataset includes 3,482 multimodal parent-reply instances covering seven stance categories, and additionally features an inference diagnostic subset of 800 instances. The data is sourced from X platform, collected through multi-domain keywords, and subjected to strict screening and manual annotation. The dataset defines five challenge factors including multimodal fusion and parent message framing. This benchmark aims to evaluate the stance reasoning ability of multimodal large language models in complex interactive scenarios, with a particular focus on the collaborative challenges of cross-modal signal understanding and relational inference.

创建时间:
2026-08-31
原始信息汇总

MMDS-Bench 数据集详情

MMDS-Bench 是一个用于评估多模态大语言模型在社交媒体互动中动态立场识别能力的基准数据集。

核心信息

  • 数据集名称:MMDS-Bench
  • 所属领域:多模态大语言模型评估、社交媒体分析、立场检测
  • 核心任务:动态立场(Dynamic Stance)识别,即在社交媒体互动情境中,评估模型对立场变化的理解与推理能力
  • 数据特性:多模态(Multimodal),涵盖文本及可能的图像等非文本信息;动态性(Dynamic),关注互动过程中立场的演变而非静态判断

适用场景

该基准主要用于检验多模态大语言模型在复杂社交互动语境下的立场分析能力,适用于模型性能评测、立场检测算法研究及社交媒体舆情分析等相关任务。

搜集汇总
数据集介绍
MMDS-Bench 数据集图片
构建方式
MMDS-Bench的构建源于对社交媒体中多模态动态立场分类需求的深刻洞察。研究者通过X平台API,依据涵盖政治、公共卫生、气候等多元议题的关键词,系统采集了带有多模态内容的父子回复对。在严格的数据清洗流程中,剔除了缺失链接、媒体不可用或重复的样本,并确保每一实例中父母消息与回复消息均至少包含一张图像,从而聚焦于纯粹的多模态交互。最终,3,482个高质量实例被保留,并辅以两阶段人工标注:首先,标注者根据七标签动态立场分类体系对全部实例进行立场判定,同时标记五项挑战因子;其次,从全集中按挑战因子数量分层抽样出800个实例,构建诊断性子集,并为其编写结构化的参考解释,以支持深层次的推理评估。
特点
MMDS-Bench的核心特色在于其诊断导向的设计与多维度挑战因子的精细标注。该基准不仅包含3,482个多模态父子回复对,覆盖图像、文本及其组合的多种模态配置,更通过五项挑战因子(多模态融合、父消息框架、非字面回复、交互推理、标签边界模糊)对每个实例的难度源进行了系统刻画。此外,该基准设计了双任务评估体系:任务一为整体立场分类,任务二则在800个诊断子集上要求模型输出父消息理解、回复消息理解及立场推理的中间步骤,从而精准定位错误来源。这种结构化设计使得MMDS-Bench能够深入剖析模型在跨模态理解与交互推理上的真实瓶颈,超越了传统仅关注最终标签准确率的评估范式。
使用方法
MMDS-Bench的使用方法旨在引导多模态大语言模型(MLLMs)进行动态立场分类与推理诊断。研究者需依照提供的提示模板,向模型输入包含父消息文本、父消息图像、回复文本及回复图像的完整多模态上下文,并明确要求模型判断回复针对其直接父消息的立场,而非针对全局话题。在任务一中,模型须输出七类立场标签之一;在任务二中,模型则需额外生成三个结构化的推理字段(父消息理解、回复消息理解、立场推理),每个字段限制于50词内,并最终给出立场标签。评估时,任务一采用准确率与宏平均F1作为主要指标;任务二则引入基于参考解释的LLM-as-a-judge协议,通过多个评判模型对推理质量进行1-5分的打分,综合计算过程分数与瓶颈分数,从而实现对模型语义理解与关系推断能力的细致量化。
背景与挑战
背景概述
MMDS-Bench由武汉大学网络空间安全学院的研究团队于2026年推出,旨在填补多模态动态立场分类领域的空白。该基准聚焦于社交媒体中父子消息交互的动态立场,即回复如何针对直接父消息表达赞同、反对、补充等立场,而非传统静态主题立场。随着社交媒体日益依赖图像、截图、表情包等多模态内容,现有文本中心的研究难以应对。团队构建了包含3,482个多模态实例的基准,并设计了七类立场标签和五类挑战因素,推动了多模态大语言模型在交互理解方面的评测发展。
当前挑战
当前多模态大语言模型(MLLMs)在此任务上表现不佳,核心挑战在于模型常能分别理解父消息与回复,但难以推断回复对父消息的动态立场关系,尤其在需要跨模态融合、非字面表达(如讽刺、梗图)和交互推理的场景中。此外,五类挑战因素(多模态融合、父消息框架、非字面回复、交互推理、标签边界模糊)常共同作用,导致模型性能随因素叠加而显著下降。数据构建亦面临标注复杂性与标签边界不清晰等难题,要求精细的标注协议和严格的质量控制。
常用场景
经典使用场景
MMDS-Bench作为多模态动态立场分类的基准测试集,其最经典的使用场景在于评估多模态大语言模型(MLLMs)在社交媒体父子互动中理解回复对直接父消息立场的能力。该数据集通过构造包含文本、图像、截图、梗图及反应图像的3482个多模态实例,并采用七标签动态立场分类体系,为研究者提供了一个标准化的评测平台。其诊断性子集(800实例)进一步要求模型输出父理解、回复理解及立场推理的结构化分析,从而精准定位模型在多模态社会互动理解中的薄弱环节。
解决学术问题
该数据集有效解决了现有立场检测研究主要聚焦于文本或目标导向、忽视多模态互动中动态立场建模的学术难题。它突破了传统静态立场检测的局限,将立场定义为回复与直接父消息之间的局部关系,填补了多模态动态立场分类研究的空白。通过细粒度的五类挑战因素标注和参考锚定的LLM评判协议,MMDS-Bench揭示了当前MLLMs在跨模态关系推理、非字面表达理解及标签边界模糊处理等方面的显著不足,为多模态社会计算领域提供了关键的诊断工具和评测基准。
衍生相关工作
MMDS-Bench的发布推动了多模态立场检测领域的系列衍生研究。其七标签动态立场分类体系被后续工作采纳并扩展至更多平台和语言场景。诊断性子集的设计促进了结构化推理评估方法的发展,催生了多款参考锚定的LLM评判协议改进方案。同时,基于该数据集的挑战因素分析启发了针对多模态融合、非字面表达及交互推理的专项模型优化研究,如跨模态注意力增强和对话上下文建模等方向。此外,该基准还为人机协同的社交媒体理解系统提供了评测标准,成为该领域学术研究的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务