遇见数据集

EAPO-EmoPrefer

收藏
github2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

EAPO-EmoPrefer是基于错误增强偏好优化(EAPO)引入的受控错误增强偏好数据集。它是EmoPrefer的扩展:从其人工标注的多模态偏好对出发,构建了流畅但故意不可靠的描述,涵盖四种受控错误类型。

EAPO-EmoPrefer is a controlled error-augmented preference dataset developed based on Error-Augmented Preference Optimization (EAPO). It is an extension of EmoPrefer: starting from its manually annotated multimodal preference pairs, it constructs fluent but intentionally unreliable descriptions that cover four types of controlled errors.

创建时间:
2026-08-10
原始信息汇总

EAPO-EmoPrefer 数据集详情

数据集概述

EAPO-EmoPrefer 是一个受控错误增强(Error-Augmented)的多模态情绪偏好数据集,源自 Error-Augmented Preference Optimization (EAPO) 论文,发表于 ACM-MM 2026 Workshop(MRAC 26)。该数据集在 EmoPrefer 基础上构建,通过引入四类受控错误类型的描述,用于增强多模态大模型在情感偏好判断中的可靠性。

数据来源与访问要求

该数据集并非独立的源媒体数据集,需要结合以下资源使用:

  • EmoPrefer / EmoPrefer-Data-V2:提供原始候选描述和人工偏好标注,需遵循上游仓库许可。
  • MER2025:提供音频和视频片段,需通过门控学术访问申请,接受 EULA 并获得批准。
  • EAPO-EmoPrefer:新增四类受控错误负样本及其构建/验证元数据,受上游媒体资源限制约束。

注意:本仓库不重新分发 MER2025 的音视频内容,用户需通过 sample_id 自行关联媒体数据。

数据集构成

数据集 角色 偏好对数量
EmoPrefer-Data-V2 正常训练 1,618
Error-Aug Train-Set 错误增强训练 2,908
EmoPrefer-Data 原始验证 563
Error-Aug Val-Set 受控错误验证 944
MER-Prefer Test Stage 1 官方测试 379
MER-Prefer Test Stage 2 官方测试 515

四类受控错误类型

  1. 情感翻转(Emotion Flip):改变推断的情感类别或效价,保留引用的多模态证据。
  2. 强度不匹配(Intensity Mismatch):仅改变情感或线索的程度,保留类别。
  3. 证据矛盾(Evidence Contradiction):反转某一模态的一个或多个相关观察,保留整体解释。
  4. 模态遗漏(Modality Omission):移除某一模态的一个独立证据子句,不添加新事实。

构建流程

  1. 偏好锚点选择:从原始偏好对中选择人工偏好的描述并分段编号。
  2. Qwen3 编辑规划:使用 Qwen3-30B-A3B-Instruct-2507 模型提出结构化局部编辑方案。
  3. 程序化构建:仅应用局部替换,冻结非目标文本。
  4. 规则验证:检查类型特定约束、引号、局部性、长度、句子数和词汇重叠。
  5. 独立 Qwen3 验证:验证错误类型、非目标保留、流畅性和构建质量,仅接受通过的候选。

主要实验结果

验证集加权 F1(WAF,%)

模型 训练设置 Orig. Val 4-Error Avg
MiniCPM-o-2.6-8B 零样本 61.53 69.46
MiniCPM-o-2.6-8B Error-Aug SFT+DPO 73.89 86.09
Qwen2.5-Omni-7B 零样本 68.17 58.01
Qwen2.5-Omni-7B Error-Aug SFT+DPO 78.29 76.89
Qwen3-Omni-30B-A3B 零样本 73.43 70.15
Qwen3-Omni-30B-A3B Error-Aug SFT+DPO 79.04 83.91
EAPO 校准融合 融合 Judges 11+14+21 80.31 85.35

官方测试集结果

系统 融合方式 Stage 1 Stage 2 Macro
最佳单模型 Judge 21 90.25 68.56 79.40
EAPO 归一化融合 Judges 11+16+21 91.30 69.17 80.23

数据文件

  • controlled_negatives.jsonl:标准发布格式,含嵌套编辑和验证元数据。
  • controlled_negatives.csv:扁平化版本。
  • preference_pairs.csv:配对偏好格式。
  • preference_pairs_position_balanced.csv:含双向候选顺序以控制位置偏差。

质量与局限说明

当前发布版本采用自动化质量控制和独立的文本 Qwen3 验证,未经过详尽的人工审核。验证器可能接受错误的错误类型、遗漏非预期的语义变化,或与编辑规划器共享系统性偏差(两者使用同一检查点)。因此,本数据集应视为模型审计标注的研究数据集,而非无错误的人工验证真值。计划在未来更新中添加针对性人工审核和修订版本。

许可证

  • 代码:MIT 许可证
  • 数据:CC BY-NC 4.0(详见 DATA_LICENSE.md)
  • 源音视频不重新分发,样本 ID 仅作为合法访问用户的连接键。
搜集汇总
数据集介绍
EAPO-EmoPrefer 数据集图片
构建方式
EAPO-EmoPrefer数据集的构建源于对情感偏好理解中模型可靠性问题的深入洞察,其设计精巧地结合了人类注释与自动化编辑。该数据集以EmoPrefer的人工标注偏好对为基础,选取人类更偏好的描述作为锚点,继而利用Qwen3-30B-A3B-Instruct模型进行结构化局部编辑规划,精准注入四种受控错误类型:情感翻转、强度失配、证据矛盾与模态遗漏。编辑过程遵循程序化构造原则,仅替换目标短语而冻结其余文本,随后通过规则校验与独立的模型验证双重保障,确保错误类型准确、非目标内容完整以及文本流畅性,最终形成带有丰富编辑与验证元数据的高质量数据集。
特点
EAPO-EmoPrefer数据集的独特之处在于其受控错误注入机制,该机制系统性地模拟了模型在情感偏好判断中可能出现的典型失误,为鲁棒性训练提供了宝贵的对抗样本。数据集不仅包含标准偏好对,还提供位置平衡版本以控制候选顺序偏差,其错误类型覆盖了从情感类别到证据引用的多层次语义变换,使得模型能够学习辨别细微的语义差异。此外,数据集的构建过程透明可复现,附带详尽的构建管线、提示模板及验证脚本,支持研究者深入理解错误生成的逻辑,并据此调整训练策略,从而显著提升多模态情感理解模型的可靠性与泛化能力。
使用方法
使用EAPO-EmoPrefer数据集时,研究者需遵循其依赖的媒体访问协议,因该数据集不直接包含音视频,需通过采样ID关联MER2025数据源。数据集以JSONL与CSV格式提供,可通过Python标准库便捷加载。典型应用场景为情感偏好优化(EAPO)的训练与评估,即将受控错误对与原始偏好对结合,用于SFT与DPO阶段,以增强模型对错误描述的辨识力。同时,数据集支持多模态评判器的独立校准与融合,通过提供的验证集与测试集,研究者可复现论文中的诊断结果,并利用附带脚本复现整个构建流程,或对发布数据进行本地验证,确保实验的可重复性与公平性。
背景与挑战
背景概述
EAPO-EmoPrefer数据集诞生于2026年,由黄子龙等研究者在MRAC '26 Workshop(与ACM Multimedia 2026同期举办)中提出,旨在解决多模态情感偏好判断中模型对非目标描述鲁棒性不足的问题。该数据集基于EmoPrefer构建,通过引入四种受控错误类型(情感翻转、强度不匹配、证据矛盾、模态遗漏)生成错误增强的偏好对,从而训练模型识别不可靠描述。其核心研究问题在于提升多模态大模型在情感偏好对齐中的判别力,特别是对错误信息的感知能力。该数据集为情感计算领域提供了首个控制错误类型的偏好数据集,推动了多模态情感理解与偏好优化方向的发展,其提出的EAPO方法在官方测试集上取得了显著性能提升(Macro WAF 80.23%),对相关研究具有重要参考价值。
当前挑战
EAPO-EmoPrefer面临的挑战可从领域问题和构建过程两方面来看。领域方面,情感偏好判断本身存在主观性和歧义性,模型需识别细微的情感差异,而现有数据集中非目标描述往往具有流畅性但隐含着逻辑或感知错误,如何使模型鲁棒地抵抗这类干扰是核心难题。构建过程中,需在保持描述流畅的前提下系统性地植入精确错误,对编辑规划、程序化替换和独立验证提出高要求。此外,数据来源于受限制的MER2025媒体(需授权访问),且生成质量依赖于单一Qwen3检查点的自动验证,可能引入系统性偏差。当前版本缺乏大规模人工审查,存在错误类型误判或无意语义改变未被完全捕捉的风险,如何确保标注的可靠性和扩展性仍是持续挑战。
常用场景
经典使用场景
EAPO-EmoPrefer数据集以其精心设计的受控错误增强偏好对,成为多模态情感偏好优化研究领域的标杆性资源。该数据集的核心应用场景在于训练与评估多模态大语言模型对人类情感偏好的精确理解与抉择能力,尤其是在面对描述中蕴含的微妙语义扰动时,模型能否保持稳健的偏好判断。研究者可依托其结构化的错误类型体系,系统性地探究模型在情感翻转、强度错配、证据矛盾及模态遗漏等复杂情境下的行为表现,从而深入剖析模型在情感认知层面的鲁棒性边界。
实际应用
在实际应用层面,EAPO-EmoPrefer数据集的价值体现在对多模态情感智能系统可靠性的直接提升上。其衍生训练范式可被用于增强情感对话代理、智能内容审核与推荐系统等产品在复杂、含混场景下的判断一致性,减少因对用户情感表达的误读而产生的错误反馈。此外,通过校准融合策略,该数据集能够助力构建更精准的多模态情感问答助手,提升人机交互的自然度与信任感,在心理健康支持、舆情监控及辅助决策等对情感理解精度有高要求的应用领域展现出广阔的应用前景。
衍生相关工作
该数据集的发布催生了一系列围绕受控错误注入与偏好对齐的拓展研究。首先,其构建管线中采用的编程式局部替换与独立验证机制,启发了后续研究者探索更为细粒度的、可解释的合成数据生成方法,用于其他非情感领域的偏好学习。其次,基于该数据集提出的校准融合策略,引发了关于多裁判模型集成时置信度归一化的深入探讨,促进了多智能体协作推理框架的演变。此外,该工作亦为情感偏好优化与多模态大型语言模型的鲁棒性评估树立了新的基准,引导后续工作关注模型在对抗性描述下的行为偏差,从而推动了该方向理论与实践的持续深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务