遇见数据集

MT2-CSD

收藏
arXiv2025-06-26 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

MT2-CSD是一个针对多目标、多轮对话立场检测的综合数据集,由深圳技术大学大数据与互联网学院的研究团队创建。该数据集包含24,457个精心标注的实例,是目前为止最大的此类数据集,展现了最大的对话深度,为立场检测带来了新的挑战。MT2-CSD的创建旨在解决传统立场检测数据集的局限性,如回复轮次较少、标注质量不佳、数据量有限等问题。该数据集的应用领域主要包括社交媒体的立场检测、意见挖掘等,旨在帮助研究人员更好地理解用户在不同话题上的观点和态度,从而提高社交媒体分析的准确性和有效性。

MT2-CSD is a comprehensive dataset for multi-target, multi-turn conversational stance detection, developed by the research team from the School of Big Data and Internet, Shenzhen Technology University. It contains 24,457 carefully annotated instances, making it the largest dataset of this kind to date with the maximum conversational depth, which introduces new challenges for stance detection. This dataset was created to address the limitations of traditional stance detection datasets, such as limited conversational turns, poor annotation quality, and insufficient data scale. Its main application scenarios include social media stance detection, opinion mining and other related fields, aiming to help researchers better understand users' viewpoints and attitudes towards different topics, thereby improving the accuracy and effectiveness of social media analysis.

创建时间:
2025-06-26
搜集汇总
数据集介绍
MT2-CSD 数据集图片
构建方式
在社交媒体的广阔领域中,立场检测对于挖掘公众舆论至关重要。传统研究多聚焦于单句分析,难以捕捉真实社交互动中的多轮对话动态。为此,我们构建了MT2-CSD数据集,从Reddit平台通过官方API收集帖子与评论,严格筛选出与指定目标(如Bitcoin、Tesla等)高度相关、评论超过200条且文本长度适中的内容,最终获得24,457个精心标注的实例,确保了数据的真实性与丰富性。
特点
MT2-CSD数据集独树一帜,拥有最深广的对话层次,其中67.47%的实例对话轮次超过四轮,远超现有数据集。它支持多目标与多轮对话,涵盖六种目标类型,包括以帖子本身为目标的Post-T。数据集通过多人独立标注与共识投票机制,实现了高一致性(kappa值平均74%),为多轮复杂对话中的立场检测提出了全新挑战。
使用方法
使用MT2-CSD数据集时,研究者可将完整对话序列与目标文本拼接为输入,利用其丰富的对话上下文和注释标签。数据集按65/15/20比例划分为训练、验证和测试集,适用于训练基于深度神经网络或预训练模型的方法。尤其适合结合逻辑关系与对话行为等语义知识,以提升模型在复杂多轮对话中的立场预测能力,涵盖领域内与跨领域等多种检测场景。
背景与挑战
背景概述
在现代社交媒体环境中,立场检测作为意见挖掘的核心任务,旨在从争议性话题中解析用户观点,揭示舆论趋势。然而,现有研究多聚焦于单一句子层面的分析,忽视了真实社交场景中多轮对话的复杂性,这主要源于缺乏能够真实反映互动动态的高质量数据集。为填补这一空白,2024年由深圳技术大学、华盛顿大学及中国科学技术大学的研究团队共同构建了MT2-CSD数据集。该数据集是目前规模最大的多目标多轮对话立场检测数据集,包含24,457条人工标注实例,覆盖比特币、特斯拉、SpaceX、特朗普、拜登及帖子文本六大目标,其中67.47%的对话深度超过4轮,远超以往数据集。MT2-CSD的发布不仅为立场检测领域提供了更具挑战性的基准,还推动了对话式立场建模从浅层交互向深层语义理解的演进。
当前挑战
MT2-CSD数据集引入了多维度挑战。其一,在领域问题层面,传统立场检测忽略对话中的隐性语义关联,例如局部讨论中隐含的立场需依赖上下文推理;而多轮对话中评论间的逻辑关系(如对比、因果)与对话行为(如赞同、反驳)交织,使立场判定需同时解析文本语义与对话结构。其二,在数据集构建过程中,研究者面临数据筛选与标注质量的权衡:需确保帖子与目标高度相关、评论深度充足,并人工标注24,457条实例的立场标签(支持/反对/中立),其间经历了多轮标注者培训与一致性校验(kappa值达0.74)。此外,现有数据集普遍存在对话轮次浅、自动标注噪声大等缺陷,MT2-CSD需在规模扩展的同时保持标注可靠性,这对数据采集与质量控制提出了严苛要求。
常用场景
经典使用场景
在社交媒体的喧嚣语境中,MT2-CSD数据集被广泛运用于对话立场检测(Conversational Stance Detection, CSD)领域,其经典用途在于精准识别用户在复杂多轮讨论中对特定目标(如政治人物、科技企业或社会议题)所表达的态度倾向。与传统基于单句的立场分析方法不同,该数据集通过捕捉对话的上下文结构、回复关系及隐含逻辑,使得模型能够在自然流动的对话中区分“支持”、“反对”或“中立”等立场标签,尤其擅长处理那些隐晦提及目标、或通过反驳与类比表达观点的深层评论节点。这种场景聚焦于将立场识别从孤立文本拓展至动态会话图景,为理解网络舆情提供了更为立体的分析路径。
衍生相关工作
围绕MT2-CSD数据集已衍生出一系列经典工作,其中最具代表性的是作者团队提出的LLM-CRAN模型,该模型创新性地利用大语言模型零样本提取对话中的逻辑关系(如因果、对比)与对话行为(如同意、反驳),并通过多跳注意力网络融合局部语境、图结构及语义知识,在跨目标与跨领域实验中均取得领先性能。此外,GLAN(Global Local Attention Network)作为前序工作,首次采用全局-局部卷积与图卷积结合的架构,奠定了该方向的技术基线。后续研究进一步探索了检索增强生成(如DEEM动态专家模型)与思维链提示在复杂对话中的适配性,这些工作共同构成了对话立场检测从数据集构建到模型优化的完整生态闭环。
数据集最近研究
最新研究方向
随着社交媒体中多轮对话场景的日益复杂,当前立场检测领域的前沿研究正聚焦于构建大规模、多目标、多轮次的对话立场检测数据集,并探索利用大语言模型(LLM)自动提取对话中的逻辑关系与对话行为等语义知识,以增强模型对深层对话结构的理解能力。MT2-CSD数据集作为迄今规模最大、对话深度最高的人工标注英语对话立场数据集,填补了现有数据集中单轮次、低深度与标注质量不足的空白,有效推动了对话立场检测从单句分析向复杂交互情境的迁移。基于该数据集提出的LLM-CRAN框架,通过将LLM生成的逻辑关系与对话行为知识融入多跳注意力网络,显著提升了模型在多目标、跨目标及深层对话场景中的立场检测准确性,为构建具备泛化能力的实际应用系统奠定了重要基础。
相关研究论文
  • 1
    通过深圳技术大学大数据与互联网学院, 中国 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务