遇见数据集

mmconflict-editable-values-1k

收藏
Hugging Face2026-09-01 更新2026-09-02 收录
官方服务:

资源简介:

MMConflict Editable Values 2K 是一个用于多模态冲突研究的数据集,包含 2,000 张源图像,每张图像展示一个可见的原子值。数据集覆盖 20 个类别,每个类别 100 张图像,图像来源包括照片、扫描件、网页截图、软件截图或文档页面,不包含生成图像或项目渲染样本。每条记录提供源信息、源 URL、许可证、归属、可见值、问题以及候选边界框。数据集支持五种冲突类型(C1-C5):值随时间变化(C1)、不同来源报告不同值(C2)、不同变体或解释导致的值差异(C3)、OCR 或图表阅读错误造成的冲突(C4)、缺失、无关或不完整的证据(C5)。类别包括餐厅菜单卡、电商产品页面截图、收据项目价格、收据总额、零售价格标签、营养表、产品包装数值、药品包装标签、列车时刻表、财务或技术文档表格、产品规格铭牌、科学图表、软件设置截图、营业时间标志、发票或账单、成分表、车票或登机牌、日程或价格表、表单或结构化文档扫描、幻灯片或讲座材料。数据集主要来自公开数据集并遵循各自许可。图像以 RGB JPEG 格式存储。字段包括 image_id、file_name、category、type、source_dataset、source_id、source_url、source_license、attribution、is_synthetic(始终为 false)、entity、item_name、value_type、visible_value、normalized_value、unit、currency、editable_bbox、question、provenance_notes。数据集为混合许可集合。

MMConflict Editable Values 2K is a dataset for multimodal conflict research, containing 2,000 source images, each showing a visible atomic value. The dataset covers 20 categories with 100 images per category. Image sources include photos, scans, web screenshots, software screenshots, or document pages, excluding generated images or project renderings. Each record provides source information, source URL, license, attribution, visible value, question, and candidate bounding boxes. The dataset supports five conflict types (C1-C5): value changes over time (C1), different sources report different values (C2), value differences due to variants or interpretations (C3), conflicts from OCR or chart reading errors (C4), and missing, irrelevant, or incomplete evidence (C5). Categories include restaurant menu cards, e-commerce product page screenshots, receipt item prices, receipt totals, retail price tags, nutrition tables, product packaging values, pharmaceutical packaging labels, train timetables, financial or technical document tables, product specification nameplates, scientific charts, software settings screenshots, business hours signs, invoices or bills, ingredient lists, tickets or boarding passes, schedules or price lists, form or structured document scans, slides or lecture materials. The dataset is primarily sourced from public datasets under their respective licenses. Images are stored in RGB JPEG format. Fields include image_id, file_name, category, type, source_dataset, source_id, source_url, source_license, attribution, is_synthetic (always false), entity, item_name, value_type, visible_value, normalized_value, unit, currency, editable_bbox, question, provenance_notes. The dataset is a collection of mixed licenses.

创建时间:
2026-08-27
原始信息汇总

MMConflict Editable Values 2K 数据集概述

基本信息

  • 数据集名称:MMConflict Editable Values 2K
  • 许可协议:混合许可证(Mixed-license),非单一许可
  • 任务类型:图像到文本(image-to-text)、视觉问答(visual-question-answering)
  • 语言:多语言(multilingual)
  • 数据规模:2,000 张源图像(1K < N < 10K)

数据内容

该数据集包含 2,000 张具有可见原子值的源图像,用于多模态冲突研究。数据覆盖 20 个类别,每类 100 张图像。图像来源包括照片、扫描件、网页截图、软件截图或源文档页面,不包含生成图像或项目渲染示例。

每条记录包含以下字段:

  • 来源信息(source、source URL、license、attribution)
  • 可见值(visible value)
  • 问题(question)
  • 候选框(candidate box,以 editable_bbox 表示,格式为 [x, y, width, height] 像素)

类别与冲突用途

数据集涵盖 20 个类别,每个类别均标注了合适的冲突基准场景:

类别 来源 典型冲突场景
餐厅菜单卡 Indian Restaurant Menu Card Dataset 新旧价格、餐厅与配送价格差异、规格/位置变体、OCR 错误
电商产品页面截图 Klarna Product Page Dataset 价格/库存变化、卖家分歧、型号/规格变体、OCR 错误
收据商品价格 CORD v2 更正的行项目、折扣争议、数量变体、OCR 错误
收据总额 CORD v2 修订总额、小计与总额混淆、税费差异、OCR 错误
零售价格标签/标牌 Wikimedia Commons 过时货架价格、促销与常规价格、单位/包装变体、OCR 错误
营养表 Open Food Facts nutrition-table-detection 产品配方调整、地区标签、份量变体、OCR 错误
产品包装数值 Open Food Facts front-image-classification 包装尺寸变化、地区变体、数量变体、OCR 错误
药品包装标签 Drug Name Detection Dataset 剂量变化、包装变体、来源分歧、OCR 错误(医疗案例需溯源和安全弃权)
列车出发信息板 Wikimedia Commons 时刻表更新、站台变化、官方与复制时间差异、OCR 错误
财务/技术文档表格 DocLayNet-small 重述数据、来源分歧、报告期/单位变体、OCR 错误
产品规格/铭牌 Wikimedia Commons 型号修订、市场特定评级、单位变体、序列号/目录混淆、OCR 错误
科学图表/信息图 Scientific Chart QA 17K 真实子集 修订数据、来源分歧、系列/年份混淆、单位变体、图表阅读错误
软件设置/错误/仪表盘截图 Wikimedia Commons 版本变化、配置差异、状态变化、环境变体、OCR 错误
营业时间牌/通知/海报/传单 Wikimedia Commons 营业时间变化、关闭状态、活动日期变更、场地变体、OCR 错误
发票或账单 Wikimedia Commons 更正发票、税费/行项目争议、货币变体、OCR 错误
成分表 Open Food Facts ingredient-detection 配方调整、地区要求、产品变体、成分数量差异、OCR 错误
车票或登机牌 Deutsches Technikmuseum rail-ticket collection 改签、补发票据、路线/舱位变体、日期混淆、OCR 错误
时刻表或价格表 Wikimedia Commons 时刻表修订、票价变化、路线/日期变体、OCR 错误
表格或结构化文档扫描 XFUND 修订表格、来源分歧、报告期差异、字段混淆、OCR 错误
幻灯片或讲义材料 Wikimedia Commons 修订幻灯片、统计数据变化、年份/单位变体、上下文不匹配、OCR 错误

冲突分类体系

数据集支持五种多模态冲突成因(MMConflict causes):

  • C1:随时间变化的值
  • C2:不同来源报告的不同值
  • C3:属于不同变体或解释的值
  • C4:由 OCR 或图表阅读错误造成或隐藏的冲突
  • C5:缺失、无关或不完整的证据

注释说明

  • CORD 商品价格和总额来自结构化源注释
  • Wikimedia Commons 行保留文件级许可证、创建者和来源页面
  • DocLayNet 和 XFUND 提供文档注释
  • 其他类别的可见值和候选框由 OCR 提议,需人工确认每个 OCR 提议后再用于最终基准或图像编辑流程

许可与版权

  • 这是一个混合许可集合,每行的 source_licensesource_urlattribution 字段适用于各行
  • 用户必须遵循每张图像的许可证,不得将整个仓库视为 CC0 或商业可重用
  • 集合包含 Public Domain、CC0、CC BY、CC BY-SA、CC BY-NC-SA 4.0、CDLA-Permissive-1.0 及其他兼容许可证
  • Klarna 和 XFUND 子集允许非商业用途并要求 ShareAlike
  • Wikimedia Commons 仅接受 Public Domain、CC0、CC BY 和 CC BY-SA 文件,拒绝未知、NoDerivatives、NonCommercial、自定义和仅 GFDL 的文件
  • 科学图表类别仅使用 Scientific Chart QA 17K 的真实图像部分,仅接受 CC0、CC BY 或 CC BY-SA 图表
  • Open Food Facts 产品图像像素使用 CC BY-SA 3.0,成分检测注释使用 CC BY-SA 4.0,前端图像分类数据集声明 AGPL-3.0
  • 图像以 RGB JPEG 存储,源文件经过重新编码,部分类别经过裁剪或缩放,行级溯源注释标识了这些更改
  • 药品图像仅用于文献研究,不构成医疗建议
  • Yelp 图像、Rico、ScreenQA、CharXiv、Open Prices 证明照片及其他版权不清晰的来源已被排除
搜集汇总
数据集介绍
mmconflict-editable-values-1k 数据集图片
构建方式
该数据集名为MMConflict Editable Values 2K,精心汇集了2000张源图像,每张图像均含有可见的原子值,涉及20个不同类别,每类100张。图像源自真实照片、扫描件、网页截图、软件界面截图或源文档页面,杜绝了生成图像或渲染示例,确保数据的真实性与实用性。构建过程中,每个条目记录了来源、URL、许可证、归属、可见值、问题以及值周围的候选框,为多模态冲突研究提供了丰富素材。类别涵盖餐厅菜单、电商产品页、收据、价格标签、营养表、药品包装、列车时刻表、财务文档、科学图表、软件截图等,每种类别均标注了适用的冲突类型,如价格变动、源分歧、OCR错误等。数据集的冲突分类体系(C1-C5)描述了值随时间变化、源间差异、不同变体或解释、OCR或图表读取错误以及证据缺失等五种冲突起因,为冲突检测与编辑提供了理论框架。所有图像以RGB JPEG格式存储,部分类别进行了裁剪或调整大小,并记录行级溯源说明,确保来源可追踪。许可方面,数据集混合了多种许可证,如公有领域、CC0、CC BY、CC BY-SA等,每行均标明具体许可,并要求用户遵守各图像的授权条款,以保障合法使用。
特点
MMConflict Editable Values 2K数据集的一个显著特点在于其涵盖了广泛的真实世界场景,从日常消费凭证到专业金融文档,均为可编辑的原子值图像,便于进行细粒度的多模态冲突研究。数据集的类别设计紧密关联实际冲突案例,如菜单价格变动、收据折扣争议、产品规格修订、科学图表数据更新等,每种类别均指出潜在冲突源,构成了一个系统的冲突类型学(C1-C5),为因果分析提供基础。更重要的是,数据集明确标记了每个图像的来源、许可证与归属,确保了版权合规与可追溯性,同时强调了医疗图像的安全使用原则。数据集排除了可能引发版权争议的来源,如Yelp等,并注重来源质量,如仅收录Scientific Chart QA 17K的真实图像部分,剔除合成或授权模糊的内容。此外,所有图像均为JPEG格式,便于处理与集成,且所有值周围的候选框均建议由人工确认,保证了基准测试的可靠性,体现了数据集在构建高质量冲突样本方面的严谨性与实用性。
使用方法
该数据集适用于多模态冲突检测与视觉问答任务,尤其便于构建对比基准,支持因果分析。用户可以利用其提供的图像、可见值、候选框及问题字段,评估模型在识别值变化、源分歧、变体混淆、OCR错误及证据缺失等冲突类型上的能力。建议使用前,依据每行的许可证信息,筛选符合研究用途的子集,尤其注意非商业授权限制。对于图像编辑或基准构建场景,需人工验证OCR提出的可见值和候选框,确保数据准确性。数据集还提供了标准化值和单位,便于跨类别比较与统计。典型应用包括:训练模型识别菜单价格更新、产品参数修订、文档表格更正等冲突场景,或用于视觉问答测试,提升模型对现实世界不一致信息的敏感度。用户可结合冲突分类体系,按C1-C5划分评估指标,促进可解释的多模态推理。此外,数据集的溯源注释支持文档级分析,适合研究来源冲突与信息更新机制。
背景与挑战
背景概述
MMConflict Editable Values 1K数据集诞生于多模态冲突研究的前沿领域,由致力于探索图像中原子值冲突的科研团队于近年构建。该数据集汇集了2,000幅源自真实场景的图像,覆盖餐厅菜单、电商页面、收据、营养标签等20个类别,每个类别精心挑选100幅图像。其核心研究问题在于模拟和解析多模态信息中的数值冲突现象,如价格变动、版本差异、OCR误差等,旨在推动视觉问答与图像编辑系统对矛盾信息的识别与处理能力。该数据集的发布为多模态冲突检测、文档理解及可信AI领域提供了宝贵的研究资源,其细粒度的冲突分类体系(C1-C5)为学术界提供了统一的评估框架,对提升模型在复杂真实场景中的鲁棒性具有深远影响。
当前挑战
该数据集所应对的挑战涵盖多模态冲突检测与解析的深层难题。首先,领域内核心挑战在于如何让AI模型精准识别并理解图像中看似一致实则冲突的数值信息,例如不同来源的价格差异、改版前后的规格变更,以及OCR误读引发的伪造冲突,这些构成C1至C5的冲突谱系,要求模型具备跨模态的推理与验证能力。其次,构建过程中的挑战尤为显著:数据集的来源多元且许可复杂,需在尊重各源版权(如CC BY-SA、非商业用途限制)的前提下收集并标准化图像;每幅图像需手工标注可见值、边界框及来源,同时保证跨类别的一致性与准确性;更棘手的是,部分类别(如药物标签)涉及安全敏感信息,要求标注流程支持安全弃权。这些挑战不仅考验数据收集的精细度,也检验多模态系统在现实应用中的可靠性与合规性。
常用场景
经典使用场景
该数据集聚焦于多模态场景中的信息冲突检测与编辑,涵盖餐馆菜单、电商页面、小票、零售标签、营养表、药品包装等20类真实世界图像,每类包含100张可见原子数值的源图。研究者可基于这些图像构建跨模态冲突基准,利用可见文本与对应问题生成冲突对,从而系统评估模型在视觉问答、图像理解及多模态推理任务中的表现,尤其适用于需要识别并解决信息不一致性的场景。
衍生相关工作
基于该数据集,研究者将衍生多项经典工作,涵盖多模态事实核查、可编辑图像生成、视觉化学会推理、对抗鲁棒性分析以及文档级多模态理解等方向。例如,开发能够检测并修正图像中过期数值的编辑模型,构建跨来源信息一致性评估基准,或设计融合OCR与知识图谱的冲突解决框架。该数据集还可推动多模态大模型在零样本或小样本场景下的冲突敏感能力研究,催生新技术与新评价指标,引领多模态AI信息可信度研究的方向。
数据集最近研究
最新研究方向
该数据集聚焦于多模态冲突检测与解析,为视觉问答与图像编辑领域的前沿研究提供了宝贵资源。其核心研究方向在于模拟真实世界信息不一致的场景,如文档OCR错误、跨源价格差异或时间引起的数值变更,并探究模型在处理此类复杂冲突时的鲁棒性与可解释性。结合相关热点,该数据支持构建对抗性视觉-语言基准,推动多模态大模型在动态信息环境中的可靠推理与修正能力,对提升AI在金融、医疗、物流等高风险场景下的决策信任度具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务