遇见数据集

code-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

Code Conflict数据集是一个专门设计用于评估视觉语言模型在跨模态冲突场景下表现的基准数据集。该数据集包含100个视觉Python代码冲突样本,核心特点是构建了代码截图(视觉模态)与文本描述(语言模态)之间的语义冲突。数据集包含5种不同的Python代码冲突类型,每种类型20个样本,包括:运算符替换(如+变为-)、操作数顺序变化(如a - b变为b - a)、循环边界修改(如range(10)变为range(100))、数组索引变化(如arr[0]变为arr[-1])和布尔值反转(如返回True而非False)。每个数据样本包含以下字段:高分辨率语法高亮的代码截图图像、与视觉代码逻辑匹配的真实文本描述、表示冲突的错误/误导性文本描述、不透露答案的中性评估问题、匹配代码截图的正确选项(VLM视觉偏见选择)、匹配误导文本的选项(VLM文本偏见选择)、看似合理但错误的干扰选项、序列ID(1-100)、冲突类型类别以及文本语言(英语)。该数据集支持多语言配置,但评估文本均为英语,适用于视觉语言模型的模态偏见分析、跨模态一致性评估和代码理解能力测试等研究任务。

The Code Conflict dataset is a benchmark specifically designed to evaluate the performance of vision-language models (VLMs) in cross-modal conflict scenarios. It contains 100 visual Python code conflict samples, with its core feature being the construction of semantic conflicts between code screenshots (visual modality) and textual descriptions (linguistic modality). The dataset includes 5 distinct types of Python code conflicts, with 20 samples for each type, namely: operator replacement (e.g., changing + to -), operand order reversal (e.g., changing a - b to b - a), loop boundary modification (e.g., changing range(10) to range(100)), array index adjustment (e.g., changing arr[0] to arr[-1]), and boolean value inversion (e.g., returning True instead of False). Each data sample contains the following fields: high-resolution syntax-highlighted code screenshot images, authentic textual descriptions matching the visual code logic, erroneous or misleading textual descriptions indicating the conflict, neutral evaluation questions that do not reveal the answer, correct options aligned with the code screenshots (VLM visual bias selection), options aligned with the misleading text (VLM text bias selection), plausible but incorrect distractor options, sequence ID (1-100), conflict type category, and text language (English). The dataset supports multilingual configuration, while all evaluation texts are in English, and is applicable to research tasks such as modal bias analysis of VLMs, cross-modal consistency evaluation, and code comprehension capability testing.

创建时间:
2026-06-27
原始信息汇总

数据集概述

数据集名称: Code Conflict Dataset 数据集地址: https://huggingface.co/datasets/multilingual-vlm-conflict/code-conflict

核心目的: 该数据集旨在评估视觉-语言模型(VLM)在跨模态冲突(即代码截图与描述文本不一致)情况下的行为表现。

数据集规模与构成:

  • 总样本数: 100个样本。
  • 样本结构: 每个样本包含一张Python代码截图和两段相互矛盾的描述文本。
  • 语言: 评估文本语言为英语(English)。
  • 冲突类型: 包含5种不同的Python代码冲突类型,每种类型20个样本:
    1. operator_substitution: 运算或逻辑操作符替换(如 +-==!=)。
    2. operand_order: 参数或操作数顺序变更(如 a - bb - a)。
    3. loop_boundary: 循环边界或“差一错误”变更(如 range(10)range(100))。
    4. array_indexing: 数组索引或切片偏移(如 arr[0]arr[-1])。
    5. boolean_inversion: 条件分支的逻辑反转(如返回 TrueFalse)。

数据模式 (Schema)

每个样本包含以下字段:

字段名 数据类型 描述
image image 具有语法高亮的Python代码截图。
original_caption string 与代码截图逻辑相符的真实描述。
conflicting_caption string 与代码截图逻辑不符的错误/误导性描述。
question string 中立的评估性问题,不透露答案。
image_bias string 与代码截图匹配的正确选项(视觉偏向选择)。
text_bias string 与误导性文字描述匹配的选项(文本偏向选择)。
distractor string 看似合理但错误的干扰选项。
serial_no int64 样本序列号(1至100)。
conflict_type string 代码冲突的类型。
language string 评估文本的语言(固定为 english)。

数据子集 (Configs)

数据集支持24个子集(config),对应24种语言。每个子集结构与默认集一致,仅 language 字段值不同。所有子集均只包含一个训练集(train split),该训练集包含100个样本。

语言子集列表: ar, cs, de, el, es, fa, fr, he, hi, id, it, ja, ko, nl, pl, pt, ro, ru, tr, uk, vi, zh, 以及 default(英语).

子集规模示例:

  • default 子集: train_split 大小约为 937KB。
  • ja (日语) 子集: train_split 大小约为 946KB。
  • 各语言子集的 train split 大小略有不同,但均包含100个样本。

应用背景

该数据集在测试中使用了 Gemini 3.5 Flash 模型,用于研究模型在面对视觉与文本信息冲突时的模态仲裁行为。

搜集汇总
数据集介绍
code-conflict 数据集图片
构建方式
该数据集通过精心设计100个视觉Python代码冲突样本构建而成,每个样本均包含一张高分辨率语法高亮代码截图。构建过程利用Pygments库对Python代码片段进行语法高亮渲染并生成PNG图像,同时为每个图像配以忠实描述原始代码逻辑的原始文本说明,以及一个故意制造语义矛盾的冲突文本描述,从而形成跨模态冲突。样本覆盖五种典型的Python代码冲突类型,包括操作符替换、操作数顺序变更、循环边界修改、数组索引偏移以及布尔逻辑反转,每种类型各包含20个样本。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,支持包括阿拉伯语、中文、英语在内的23种语言配置,每种配置对应一个独立的训练分割。加载时需指定配置名称,例如使用'zh'加载中文版本。数据集以ImageFolder格式存储,图像文件自动解析为image对象,元数据中的file_name字段在加载后不再保留。评估时可将图像与问题输入视觉-语言模型,通过比较模型在原始描述与冲突描述下的输出偏向,分析其视觉与文本模态的权衡机制。
背景与挑战
背景概述
在视觉-语言模型(VLM)快速发展的背景下,多模态信息的冲突与协调机制成为评估模型鲁棒性的关键议题。code-conflict数据集应运而生,专为探究VLM在面对代码截图与文本描述之间语义不一致时的决策行为而设计。该数据集由研究团队于近期构建,基于Gemini 3.5 Flash模型进行测试验证,核心研究聚焦于跨模态冲突下模型的模态仲裁能力。数据集包含100个精心构造的Python代码冲突样本,涵盖运算符替换、操作数顺序、循环边界、数组索引与布尔反转五类语法冲突,每个样本均配备真实与误导性两种文本描述,为系统性评估VLM在多语言环境中的视觉-文本对立推理提供了标准化基准,对推动多模态模型的可信度与可解释性研究具有显著意义。
当前挑战
该数据集所解决的领域核心挑战在于现有VLM在视觉与文本信息不一致时,常表现出过度依赖某一模态的偏差,缺乏有效的模态权衡机制。具体难题包括:1) 代码截图中隐含的逻辑语义与误导性文本描述形成直接对抗,模型需在视觉证据与文字暗示间做出正确仲裁;2) 构建过程中,需确保冲突样本在视觉与文本层面具有高度混淆性,同时保持问题的中立性与干扰项的合理性,避免引入额外偏见;3) 数据集覆盖23种语言配置,跨语言评估带来了翻译一致性与文化适配性的额外挑战,要求冲突描述在不同语言间保持等效的误导效果,这对数据质量管控提出了严苛要求。
常用场景
经典使用场景
在视觉语言模型(VLM)的评估与鲁棒性分析领域中,Code Conflict数据集扮演了不可或缺的标杆角色。该数据集精心构建了100个视觉化的Python代码冲突样本,通过将代码截图与存在歧义的文本描述进行配对,系统性地引入了视觉与文本模态之间的冲突。研究者和工程师可以借助此数据集,精确衡量VLM在面对图像与文字所传达信息不一致时,究竟更倾向于信赖视觉证据还是文本线索。每一个样本都涵盖了诸如运算符替换、操作数顺序颠倒、循环边界修改、数组索引偏移以及布尔逻辑反转这五种典型的语法冲突类型,从而为多模态模型的决策行为研究提供了结构清晰且覆盖面广泛的测试基准。
解决学术问题
该数据集的诞生,有力地回应了多模态学习领域中一个核心且棘手的研究难题——模态间冲突下的模型抉择机制。在传统的视觉问答或图文匹配任务中,图像与文本通常被预设为一致或互补的关系,而现实世界中,信息源的冲突却屡见不鲜。Code Conflict数据集弥补了这一空白,使学术界能够深入探索VLM在处理矛盾信息时的内在偏置(bias)与仲裁(arbitration)规律。通过对该数据集的测试,研究者得以量化分析模型在视觉偏置与文本偏置之间的权衡倾向,揭示了多模态融合过程的内在局限性。这一工作的意义不仅在于提供了可复现的评估协议,更在于启发了后续研究去设计更加稳健、具备跨模态冲突解决能力的智能模型。
实际应用
在实际应用层面,Code Conflict数据集的价值体现于增强真实世界中部署的多模态系统的可靠性。例如,在代码审查辅助工具、编程教育平台以及智能集成开发环境(IDE)中,系统常常需要同时分析代码截图与对应的描述性文字,这些信息源之间有时可能存在人为或系统引入的错误与矛盾。利用该数据集进行训练的模型,能够更好地识别并应对这种不一致性,从而减少误导性反馈,提升代码理解与漏洞检测的准确性。此外,在跨语言的技术文档翻译与校对场景中,该数据集所模拟的图文冲突模式也能帮助模型学会在文字描述出错时仍能依赖视觉代码信息做出合理判断,显著提升了在复杂人机交互环境下的服务韧性。
数据集最近研究
最新研究方向
在视觉语言模型(VLM)的鲁棒性与模态对齐研究领域中,code-conflict数据集精准聚焦于跨模态冲突场景下的模型行为分析。该数据集通过构造代码截图与文本描述之间的语义鸿沟,系统性地评估VLM在面对视觉与文本信息相悖时的决策偏向——究竟是更信赖直观的视觉输入,还是更倾向于服从语义文本。这一研究方向触及多模态理解的核心瓶颈,尤其在代码调试、自动化编程辅助以及视觉推理等前沿热点应用中,模型对细微逻辑差异(如操作符置换、边界偏移、布尔反转等)的敏感度直接影响其工程实用性。随着多模态大模型在开发者工具和智能教育平台中的广泛部署,该数据集为揭示并缓解模态间不一致性提供了关键的基准测试,推动了鲁棒且可信赖的视觉语言系统的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务