遇见数据集

HOI-Edit

收藏
arXiv2026-06-17 更新2026-06-19 收录
官方服务:

资源简介:

HOI-Edit是由北京大学研究团队构建的专用于评估人-物交互图像编辑任务的多层次认知基准数据集。该数据集包含705个精心标注的高质量样本,涵盖丰富的交互类别,数据来源于HOI视频数据集的高分辨率帧,并经过严格的人工标注与指令设计。其创建过程涉及三个核心步骤:基于场景上下文的手动指令编写、针对交互主体与客体的系统化区域边界框标注,以及面向评估需求的多维度问题构建。该数据集主要应用于计算机视觉与人工智能领域,旨在解决现有图像编辑方法在动态人-物交互建模上的不足,通过分层认知评估(基础编辑、空间理解、因果与物理推理)推动模型在保持实体身份一致性的同时,精确合成符合逻辑与物理规律的动态交互过程。

HOI-Edit is a multi-level cognitive benchmark dataset dedicated to evaluating human-object interaction (HOI) image editing tasks, developed by a research team from Peking University. This dataset comprises 705 high-quality, meticulously annotated samples spanning diverse interaction categories, with its data sourced from high-resolution frames of HOI video datasets and subjected to rigorous manual annotation and instruction design. Its development involves three core steps: manual instruction writing based on scene context, systematic regional bounding box annotation for interaction subjects and objects, and multi-dimensional question construction tailored to evaluation requirements. Primarily applied in the fields of computer vision and artificial intelligence, this dataset aims to address the shortcomings of existing image editing methods in dynamic human-object interaction modeling. It advances model capabilities to accurately synthesize dynamic interaction processes that conform to logical and physical laws while maintaining entity identity consistency through hierarchical cognitive evaluations including basic editing, spatial understanding, causal and physical reasoning.

创建时间:
2026-06-17
原始信息汇总

数据集:HOI-Edit

概述

HOI-Edit 是一个专注于人-物交互(Human-Object Interactions, HOI) 图像编辑的综合性基准数据集。它针对现有图像编辑方法在处理动态交互关系时的不足而构建,强调对动态交互有效性人-物对保存的综合评估。

核心特征

  • 三个渐进式认知层级:数据集按难度划分,用于测试模型在不同复杂度下的交互编辑能力。
  • 自动化评估指标 HOI-Eval:首次通过视觉语言模型(VLM) 对包含定位人-物对的图像进行“思考后问答”,从而可靠地评估实例级别的交互有效性。

基准测试定位

  • 挑战现有方法:指出当前图像编辑方法擅长静态属性编辑,但在复杂人-物交互编辑上表现不佳。
  • 提出新框架 SCPE:基于数据集的评测,提出了自校正流程编辑(Self-Correcting Process Editing, SCPE) 框架。该框架利用图像到视频(I2V)模型的时序生成能力进行动态编辑,并通过迭代优化提示词(prompts)自我纠正错误,最终从生成视频中提取帧作为编辑结果。

数据集资源

  • 论文下载assets/HOIEdit_ICML_2026_CR_submission.pdf
  • 概览图下载assets/fig1_v3.pdf
  • 示例概览图assets/fig1_v3.png

注意:当前数据集尚未发布(标记为“Coming Soon”)。

搜集汇总
数据集介绍
HOI-Edit 数据集图片
构建方式
HOI-Edit的构建源于对现有图像编辑基准中人类-物体交互(HOI)动态性缺失的深刻洞察。研究者精心从HOI视频数据集中提取高分辨率帧,并实施严格的三阶段手动标注流程:首先,针对特定场景语境手工设计指令,确保交互的合理性与实体的物理存在性;其次,系统性地标注交互主体与客体的边界框,并为高级推理任务定义辅助上下文区域;最后,构建基于定位的多维度问答套件,以分别评估主体/客体身份保留、交互状态以及空间、逻辑与物理约束的遵循程度。该数据集最终包含705个样本,横跨三个递进的认知层级。
特点
该数据集的核心特征在于其首创的“层级化认知评估”范式,将HOI编辑能力解构为三个递进层次:基础编辑(L1)评估动态交互的创建、移除或修改能力;上下文空间理解(L2)考察在空间歧义中准确锚定起始实体与终态位置的能力;因果与物理推理(L3)则要求模型能演绎隐含的操作步骤并遵循光照、形变等物理定律。此外,HOI-Edit引入了HOI-Eval自动评估协议,基于“成对区域思考”范式,利用边界框锚点实现对抗实体漂移的严格身份验证与上下文感知的交互合理性评判。
使用方法
使用HOI-Edit时,研究员可借助其公开的基准代码库与705个标注样本,系统性地评测各类图像或视频编辑模型。评估流程遵循HOI-Eval三步法:首先通过追踪或检测技术将原图标注框关联至编辑结果;然后利用裁剪拼接的对比图像让VLM验证主体与客体身份的一致性;最后基于上下文感知的问答验证交互是否发生及其空间、逻辑与物理合理性。数据集为每个样本提供了原始图像、编辑指令、边界框标注及配套问题,便于复现综合评估结果。
背景与挑战
背景概述
HOI-Edit 数据集由北京大学王选计算机技术研究所与健康医疗大数据国家研究院的研究人员于2026年联合创建,旨在填补面向人-物交互动态编辑的专用基准测试空白。不同于传统图像编辑方法聚焦于静态属性修改,HOI-Edit 的核心研究问题在于评估模型能否在严格保持场景中既有主体与客体身份一致性的前提下,合理重构动态交互关系。该数据集创新性地将评价维度划分为基础状态转换、场景上下文理解与因果物理推理三个递进认知层级,为验证编辑模型对复杂动态语义的建模能力提供了系统框架。通过引入首款面向实例级交互正确性的自动化评估指标 HOI-Eval,该工作对推动图像编辑从静态像素修补向动态世界模拟演进具有里程碑意义。
当前挑战
HOI-Edit 所应对的核心领域挑战在于:现有编辑基准普遍将人-物交互混同为静态属性,缺乏能同时评估互动有效性及纠缠性人-物对保持能力的细粒度评价指标,全局性度量无法胜任对动态关系合理性的判定。在构建过程中,数据集面临三重难点:其一,需要为每一场景手工设计兼具上下文合理性与多样性的人-物交互指令,确保涉及实体在场且互动动作合乎逻辑;其二,必须系统性标注交互主体与客体的边界框,并针对高层次推理需求增设辅助上下文区域,为空间细粒度评估奠定结构化基础;其三,需针对不同认知层级构建差异化的问题集,包括基础配对身份验证、空间终态校验以及潜在过程推理,以全面覆盖交互正确性验证的多维需求。
常用场景
经典使用场景
在图像编辑与计算机视觉的交叉领域,HOI-Edit被广泛用作评估模型对动态人物-物体交互关系编辑能力的权威基准。该数据集通过精心构建的三级认知难度体系,从基础的状态转换(如将‘握持’编辑为‘骑乘’),到空间理解(如精确选定‘最顶端的苹果’),再到因果与物理推理(如推断‘搅拌’前须‘揭开锅盖’),全面衡量编辑模型对场景上下文、空间逻辑及物理规律的把握。研究者们利用其分层的样本结构与细致的成对区域标注,系统性地剖析模型在动态关系重塑中的表现瓶颈,是目前该领域内最具挑战性的评测标尺。
解决学术问题
该数据集解决了此前缺乏专门针对动态人物-物体交互编辑评测标准的学术空白。传统基准多将交互视为静态属性,依赖全局度量(如CLIP得分)难以同时评估身份保持与互动合理性。HOI-Edit通过引入‘思考成对区域’(Thinking with Pair-wise Regions)的自动化度量HOI-Eval,首次实现了对实体身份一致性、交互状态变更及因果物理合理性的层次化解耦评价。其意义在于揭示了静态编辑范式在处理时变关系时的结构性缺陷,推动了学术研究从‘像素修补’向‘过程模拟’的认知范式转变,为构建鲁棒的世界模型提供了不可或缺的验证平台。
衍生相关工作
基于HOI-Edit衍生出的经典工作首推SCPE(自我修正流程编辑)框架,该框架开创性地利用图像到视频(I2V)模型的时间生成能力,通过代理体循环协作进行错误诊断与指令精炼,实现了超越闭源商业模型(如Nano Banana)的交互编辑性能。此外,HOI-Edit催生了对视频先验在动态编辑中诊断价值的系统性研究,特别是将失败视频作为‘过程回放’来探究错误根因的方法论。此外,该数据集还被用于基准测试多种开闭源编辑器及加速方法(如TurboDiffusion),并验证了面向过程引导与经验记忆库在复杂交互编辑中的普适有效性,推动了可解释、可修正的图像编辑新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务