遇见数据集

MM-IssueLoc

收藏
arXiv2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MM-IssueLoc是由清华大学与京东联合创建的一个受控多模态仓库级问题定位基准数据集,旨在系统评估视觉证据在软件工程问题定位中的作用。该数据集包含652个基于真实GitHub问题的实例,覆盖23种编程语言,涉及1050张标注图像,并提供文件级和函数级的黄金标签,数据来源于608个开源仓库的星标中位数为202的存储库。其构建过程结合了人工标注与AI辅助扩展,并引入了有害图像控制以增强鲁棒性测试。该数据集主要应用于多模态软件工程领域,旨在解决现有文本主导基准无法准确衡量视觉输入对代码定位贡献的问题,为开发更有效的多模态定位系统提供标准化评估工具。

MM-IssueLoc is a controlled multi-modal repository-level bug localization benchmark dataset jointly developed by Tsinghua University and JD.com, which aims to systematically evaluate the role of visual evidence in software engineering bug localization. This dataset consists of 652 instances derived from real GitHub issues, covering 23 programming languages, and includes 1050 annotated images. It provides gold-standard labels at both file-level and function-level, with data sourced from 608 open-source repositories that have a median star count of 202. The construction of this dataset combines manual annotation and AI-assisted expansion, and incorporates harmful image controls to enhance robustness testing. Primarily applied in the field of multi-modal software engineering, this dataset addresses the limitation that existing text-dominated benchmarks fail to accurately quantify the contribution of visual inputs to code localization, thus serving as a standardized evaluation tool for developing more effective multi-modal bug localization systems.

提供机构:
清华大学; 京东
创建时间:
2026-07-17
原始信息汇总

数据集概述

MM-IssueLoc 是一个用于评估多模态仓库级问题定位中视觉证据作用的受控基准数据集。该数据集旨在隔离视觉证据(如截图、错误对话框、渲染的UI界面和日志)在问题定位中的作用,检索需要修改的文件和函数,并与补丁合成过程解耦。

数据集规模与构成

  • 总实例数:652 个问题-拉取请求实例
  • 覆盖语言:23 种编程语言
  • 标注粒度
    • 所有实例均提供文件级金标签
    • 343 个实例额外提供函数级金标签
  • 图像标注:每个图像包含 7 个证据类别和 4 个相关级别的标注

数据获取

数据集托管于 Hugging Face Hub,地址为:Jasaxion/MM-IssueLocBench。包含两个配置:

  • canonical:652 条实例
  • function_level:343 条实例

首次加载时,问题图像会嵌入行中并缓存到本地。

数据加载示例

python from mm_issueloc import load_dataset, filter_instances

instances = load_dataset("canonical") # 652 个实例 with_images = filter_instances(instances, has_images=True)

inst = instances[0] inst.problem_statement # 问题标题和正文(查询) inst.edit_files # 需要定位的金文件 inst.edit_functions # 金函数(function_level 配置) inst.image_paths # 材料化截图的绝对路径

离线使用时,可指定包含 JSONL 分割文件和 images/ 目录的本地路径。

评估流程

  1. 生成预测文件:为每个实例输出一条 JSON 记录,格式如下: json {"instance_id": "owner__repo__123", "predicted_files": ["src/app.py"], "predicted_functions": ["src/app.py:App.run"]}

  2. 评分: bash mm-issueloc-eval --predictions preds.jsonl --config canonical --output metrics.json

    函数级评估:

    mm-issueloc-eval --predictions preds.jsonl --config function_level --level function

    分层分析:

    mm-issueloc-eval --predictions preds.jsonl --stratify image_category difficulty relevance_score

  3. 聚合结果: bash mm-issueloc-aggregate --results-dir results --out results/_summary

评估指标

在 K ∈ {1, 3, 5, 10} 下报告文件和函数粒度的指标:

指标 含义
*_mrr 第一个正确命中的平均倒数排名
*_recall@K 金项目在 Top-K 中的比例
*_hit@K Top-K 中是否包含任何金项目
*_accuracy@K Top-K 中是否包含所有金项目(严格 Acc@K)
*_map@K Top-K 的平均精确率
*_ndcg@K Top-K 的归一化折损累计增益

路径比较已规范化;函数匹配为松弛匹配(file:func 匹配 file:Class.func)。修复中添加的文件和函数(base_commit 中不存在)不计入评分。函数级指标仅对具有金函数的实例取平均值。

引用

bibtex @article{zhan2026mm, title={MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization}, author={Zhan, Shaoxiong and Hu, Shi and Feng, Boyu and Lin, Hai and Gong, Andrew and Zhou, Zhengda and Zhou, Jiaying and Hou, Yunyun and Su, Hao and Zheng, Hai-Tao}, journal={arXiv preprint arXiv:2607.15205}, year={2026} }

搜集汇总
数据集介绍
MM-IssueLoc 数据集图片
构建方式
在软件工程领域,真实仓库的问题报告常包含截图、错误对话框、渲染界面状态及日志等多模态视觉证据。然而,现有仓库级别的问题定位评估多局限于纯文本设定。为此,我们构建了MM-IssueLoc基准数据集。其构建过程严谨而系统:首先,从公开GitHub仓库中筛选出星标至少50、已合并拉取请求且非机器人提交的问题-拉取请求实例,经过去重、API信息丰富化及问题-PR链接后,获取修复前仓库快照。随后,数据经人工与AI辅助双轨标注:六名标注员耗时约20小时完成450实例的标注,涵盖7种图像类别与4级相关性评分;AI辅助阶段则通过四阶段视觉语言模型门控机制新增202实例。最终,数据集包含652个实例、1,050张图像及608个仓库,横跨23种编程语言,并提供文件级与函数级金标标签。
特点
MM-IssueLoc具备若干显著特点,使其成为评估多模态问题定位能力的独特工具。首先,它实现了对视觉证据的显式控制:每张图像均被标注为七种证据类别之一,并赋予从有害到至关重要的四档相关性评分,其中包含55个人工审核的有害图像实例作为鲁棒性压力测试。其次,数据集支持四种对照输入模式——纯文本、含图像、视觉内容证据及其组合,从而能够分离视觉信息的影响与原始图像条件效应的贡献。再者,它同时提供文件级与函数级金标,函数级标签通过tree-sitter解析抽象语法树提取,并排除了拉取请求中新增的函数,确保定位任务的纯粹性。此外,跨基准对比表明,在文本主导的SWE基准上的高定位分数并不能直接迁移至多模态场景,凸显了MM-IssueLoc作为诊断工具的必要性。
使用方法
MM-IssueLoc被设计为评估工具而非单模型排行榜,支持基于检索与基于大型语言模型的两类定位范式。使用时应严格遵循其评估协议:系统需输入问题标题、正文及可选图像集合,输出按可能性排序的文件或函数候选列表,并采用严格的Acc@K指标衡量——仅当所有金标文件或函数均出现在前K个候选内才算成功。数据集支持四种输入模式,研究者可通过切换图像存在与否、替换为结构化视觉文本等方式,精细剖析视觉证据的实际贡献。此外,配套的MM-IssueLoc-VL-Embedding作为受控检索器,其训练数据与基准实例互斥,采用文件到函数的两阶段课程学习与同仓库硬负样本挖掘策略。评估时需注意排除新增函数,并利用发布的JSONL文件中的注释来源、难度桶等字段进行分层分析。
背景与挑战
背景概述
在自动化软件工程领域,仓库级问题定位是修复流程中的关键前提,其准确性直接影响后续补丁生成的质量。然而,现有基准如SWE-bench及其多语言扩展大多仅聚焦于纯文本场景,忽略了真实仓库问题中普遍存在的视觉证据,如截图、错误对话框、渲染状态和日志输出。由清华大学与京东集团的研究人员于2026年提出的MM-IssueLoc基准,旨在填补这一空白。该数据集包含652个真实问题-拉取请求实例,覆盖23种编程语言与1050张图像,每张图像均被标注为七类视觉证据之一,并依据其对定位的贡献程度划分为四个相关性等级。通过提供文件级与函数级黄金标签、配对文本及图像评估模式,以及基于视觉内容提取的诊断机制,MM-IssueLoc将视觉证据确立为显式评估变量,为多模态仓库级问题定位研究奠定了可量化分析的基础。
当前挑战
MM-IssueLoc所应对的核心挑战在于:现有系统在多模态仓库级问题定位上远未达到可靠水平。在文件级定位中,最强代理的Acc@5仅为38.96%,而函数级Acc@10最高仅为22.45%,这意味着超过六成的实例中,正确文件未能进入前五候选。跨基准对比进一步揭示,在纯文本主导的SWE基准上表现优异的系统,其能力无法平滑迁移至多模态场景。构建过程中亦面临诸多难题:自然存在的误导性图像极为稀少(不足1%),需通过同仓库图文错配、TF-IDF相似问题结合不相关编辑文件等策略进行合成;函数级黄金标签需依赖树形解析器的精确提取,对于宏、模板等语言特性可能存在噪声;此外,需确保训练集与评估集在实例级别严格分离,并通过同仓库硬负样本挖掘保证对比学习的有效性。
常用场景
经典使用场景
在软件工程领域,随着多模态信息的激增,传统的文本驱动代码定位方法日益显露出其局限性。MM-IssueLoc作为一项专门针对仓库级多模态问题定位而构建的受控基准,旨在系统性地评估视觉证据在定位过程中的实际贡献。该数据集最经典的使用场景是作为评测平台,用于判别基于大语言模型的智能体与基于检索的系统是否能够有效利用截图、错误对话框、UI渲染状态等视觉信息,准确锁定待修改的代码文件和函数,从而实现对多模态问题定位能力的全面度量。
解决学术问题
既往研究多聚焦于纯文本环境下的问题定位,视觉因素往往被剥离或混入端到端的补丁生成任务中,致使视觉信息的独立作用难以被精准衡量。MM-IssueLoc直面这一核心难题,通过提供包含图像类别、相关性等级及有害图像控制的细粒度标注,以及文本-only、with-image、VCE等多模态输入模式,首次将视觉证据从辅助变量转化为显式的评估变量。这一设计使得学术界能够清晰理解视觉信息在何种条件下提升或干扰定位性能,填补了多模态代码定位研究中的关键空白。
衍生相关工作
基于MM-IssueLoc提供的受控框架与丰富标注,研究人员已开展一系列具有启发性的探索工作。例如,MM-IssueLoc-VL-Embedding作为与其配套的对比学习检索器,通过课程式训练策略验证了视觉信息对检索排序的增益效果。此外,VCE侧通道诊断机制的引入,催生了将图像内容结构化转化为文本线索的新型表示范式,促使后续工作更深入地探讨视觉推理与代码定位之间的内在耦合关系。这些衍生工作共同推动了多模态软件工程研究从宏观端到端评估向微观可控分析的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务