遇见数据集

ExBind

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

ExBind是由清华大学自动化系构建的可执行对应诊断基准,旨在隔离视觉反馈编辑流程中从语义定位到代码执行之间的结构化对应层。数据集包含540条精心控制的实例,涵盖250条广泛诊断套件、240条针对性结构诊断套件和50条配对潜在组,数据来源于表示无关的潜在绑定实例,通过格式特定编译器编译为SVG、DOM、画布、树、图、表格等多种观测表面,并保持可逆映射以支持确定性诊断。创建过程遵循共享潜在目标到表面特异性观测的编译范式,确保每个实例具有已知的潜在真实值和可恢复的结构约束。该数据集主要用于评估模型在真实编辑场景中解析可执行引用的能力,诊断候选有效性掩盖下的结构性错误,而非提供大规模排行榜或端到端编辑性能度量。

ExBind is an executable correspondence diagnosis benchmark developed by the Department of Automation, Tsinghua University, aiming to isolate the structured correspondence layer between semantic localization and code execution in visual feedback editing workflows. The dataset includes 540 carefully controlled instances, covering 250 comprehensive diagnostic suites, 240 targeted structural diagnostic suites, and 50 paired latent groups. Derived from representation-agnostic latent binding instances, these instances are compiled into multiple observation surfaces such as SVG, DOM, canvas, tree, graph and table via format-specific compilers, while retaining reversible mappings to support deterministic diagnosis. Its construction follows the compilation paradigm of mapping shared latent targets to surface-specific observations, ensuring that each instance has known latent ground truths and recoverable structural constraints. This dataset is primarily designed to evaluate a model's ability to parse executable references in real-world editing scenarios and diagnose structural errors masked by candidate validity, rather than providing large-scale leaderboards or end-to-end editing performance metrics.

提供机构:
清华大学
创建时间:
2026-09-01
原始信息汇总

ExBind 是一个用于视觉到可执行对应关系的受控诊断基准(controlled diagnostic benchmark),版本为 v2.0。该基准旨在评估模型能否将视觉或语义所指对象映射到可执行环境所需的精确结构化引用,并通过确定性标注对每次预测进行分解。它属于基准测试与评估工具包,不涉及修正、重排序、训练或智能体策略。

数据集构成

  • 广泛诊断套件:包含 250 个用例,涵盖画布(Canvas)、树(Tree)、DOM、图(Graph)、表格(Table)和 SVG 表面场景。
  • 定向结构套件:包含 240 个用例,细分为 120 个表格用例与 120 个层级结构用例。
  • 配对潜变量组:共 50 组,用于验证 SVG 与画布之间以及树与 DOM 之间的一致性。
  • 确定性评估器:支持精确匹配、维度级、失败阶段和跨格式评分。
  • 冻结论文输出:包含 Qwen2.5-VL-3B 和 Qwen3-VL-4B 的预测结果与摘要。
  • 支持性模型输出:提供 LLaVA-Phi-3-mini 在广泛与表格任务上的预测结果及摘要。
  • 论文材料:包含 ARR/arXiv 手稿源文件、PDF 与图表。

使用方法

通过脚本可重新生成受控基准数据,例如使用固定随机种子生成广泛与定向套件;也可对已有预测文件进行评分,预测文件采用 JSONL 格式,每条记录包含 case_idprediction 字段,预测内容仅包含表面引用,无需提供推理过程或中间标签。

数据布局

核心数据存放于 data/exbind_v2/ 目录,分为 broad/targeted/cross_format/ 子目录。结果数据位于 results/ 下,涵盖冻结模型、候选排序和表格消融。另有 huggingface/ 目录,为可直接上传至 Hugging Face 的数据集仓库,但需作为独立数据集仓库上传,GitHub 仓库仅作为源代码与可复现性主页。

可复现级别

  • 第一级:直接使用已附带的预测与得分文件,无需模型权重。
  • 第二级:通过固定种子运行确定性生成器以重新生成基准记录。
  • 第三级:需另行获取模型检查点,并遵循模型特定条款与严格的输出契约。
  • 第四级:使用附带的 ACL 样式与图表编译论文源文件。

许可与版权

核心软件采用 MIT 许可证;新生成的基准核心记录采用 CC BY 4.0 许可证。模型权重与继承的基准数据未包含在发布包内,如需获取或再分发,需参考第三方声明文件。

引用

论文手稿位于 paper/ 目录,报告结果时请注明 ExBind v2.0 版本。

搜集汇总
数据集介绍
ExBind 数据集图片
构建方式
ExBind数据集的构建遵循一种从潜表征到表层呈现的受控编译范式。每个实例起始于一个表征无关的潜在绑定对象,该对象封装了实体、关系、层级、属性、角色及规范目标。随后,格式特定的编译器将此潜在对象具象化为SVG、DOM、画布、树、图或表格等多样化的表面观测,并配备可逆映射至可执行表面引用。模型仅需输出最终严格的引用,评估器则将其映射回潜在结构,并依据确定性规则判定违反的结构性约束,以此实现可控的诊断性评估。
特点
ExBind数据集的核心特质在于其分离了语义定位与执行动作之间的结构化对应层,使之成为可独立测量的诊断目标。它强调候选有效性、绑定正确性与失败诊断三者的本质不同,并区分了结局稳定性与诊断类型稳定性。通过包含250例广泛套件、240例针对性套件及50组配对潜在群,该数据集提供了跨格式的差异分析能力,既支持跨表征的一致性检验,也能揭示表面编译引发的局部化错误模式,如表格诊断中的正确行-错误列选择。
使用方法
ExBind数据集的使用方法聚焦于冻结视觉语言模型的诊断评估。模型接收指令、观察及候选清单,仅返回严格的JSON格式引用,无需暴露推理过程。评估器自动校验候选有效性,映射至潜在目标,并报告完整违例约束集及依据声明顺序的首次违例摘要。该基准不追求大规模排名,而是通过结构条件分析、候选顺序扰动及配对跨格式转换,深入剖释模型的绑定能力与薄弱环节,如表格子套件中的列错绑模式,从而为模型改进提供定位依据。
背景与挑战
背景概述
ExBind数据集由清华大学自动化系的研究团队于2026年创建,旨在解决视觉反馈编程与编辑系统中从渲染产物到可执行程序结构之间的对应关系问题。该数据集创新性地将语义/视觉定位与动作执行之间的结构化可执行对应层作为独立诊断目标,通过从表示无关的潜在绑定实例编译成SVG、DOM、画布、树、图及表格等多种格式,并建立可逆的映射关系,实现对模型输出约束的确定性判别。ExBind包含250例广谱套件、240例针对性套件及50组配对潜在群组,其发布为理解视觉语言模型在可执行绑定中的结构性失误提供了精确工具,对多模态智能体及自动化编辑系统的发展具有重要推动作用。
当前挑战
ExBind数据集主要面临双重挑战。首先,在领域问题层面,端到端编辑成功无法揭示失败源于定位、对应、代码生成还是执行环节,传统评估多止步于区域或坐标,难以诊断有效的候选引用是否真正绑定到正确的可执行对象,例如候选有效性掩盖了错误层级或颠倒的端点角色。其次,在数据集构建过程中,需要确保潜在目标唯一、可执行金标准无歧义、映射确定性以及结构预言机制,同时需防止目标标识泄漏和快捷方式欺骗;候选序列化顺序作为界面变量会改变个案结果,如何区分结果稳定性与诊断类型稳定性亦成为构建中的关键挑战。
常用场景
经典使用场景
ExBind数据集作为一项精心构筑的诊断性基准,其核心用途在于精准剖析视觉—语义定位与可执行动作之间的结构化对应环节。该数据集通过将表征无关的潜在绑定实例编译为SVG、DOM、Canvas、树、图及表格等多类异质表面,并要求模型仅输出严格的最终引用,从而实现对候选有效性、绑定正确性与失败类型三者间的细致甄别。这一设计使得研究人员能够对视觉反馈编码与编辑系统中的中间层进行孤立测量,揭示出'有效但错误'的隐性失败模式,为多模态大型语言模型在可执行结构映射能力上的评估提供了严谨且可复现的诊断工具。
解决学术问题
ExBind数据集有效解决了现有基准中端到端编辑成功与否无法区分失败根源的学术难题。传统评估往往将语义定位、结构对应、代码生成与执行等环节混淆,难以判断错误究竟源于定位失准抑或引用错配。ExBind通过确定性映射将预测回溯至潜在结构,并给出首个违反的约束条件,从而将'有效候选'与'精确绑定'两个概念解耦,量化了候选有效性掩饰执行不匹配的现象。这为学术研究提供了一种机制化、可定位的评估框架,促进了对于多模态模型在结构层级间扮演角色与并列选择等细粒度能力差异的深入理解,并为构建具有强可解释性的视觉—语言系统奠定了方法论基础。
衍生相关工作
ExBind数据集的引入衍生了若干后续相关研究脉络。其一,针对候选序列化顺序扰动影响模型表现的发现,推动了界面敏感性与测量稳定性方向的探索,促使研究者开发更加鲁棒的评估协议和提示设计策略。其二,其开创的潜在绑定到异质表面编译机制启发了跨格式语义一致性检验的新方法,使得同一潜在目标可在多类表征环境中进行映射比较成为可能。其三,ExBind所揭示的正确行但错误列的局部化错误形态,促进了针对表格结构理解中属性列绑定机制的专项分析与干预方法设计,这些工作共同构建了一个从诊断基准到模型改进的闭环研究范式,深化了领域对视觉—语言模型结构化推理能力的认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务