ExBind
收藏资源简介:
ExBind是由清华大学自动化系构建的可执行对应诊断基准,旨在隔离视觉反馈编辑流程中从语义定位到代码执行之间的结构化对应层。数据集包含540条精心控制的实例,涵盖250条广泛诊断套件、240条针对性结构诊断套件和50条配对潜在组,数据来源于表示无关的潜在绑定实例,通过格式特定编译器编译为SVG、DOM、画布、树、图、表格等多种观测表面,并保持可逆映射以支持确定性诊断。创建过程遵循共享潜在目标到表面特异性观测的编译范式,确保每个实例具有已知的潜在真实值和可恢复的结构约束。该数据集主要用于评估模型在真实编辑场景中解析可执行引用的能力,诊断候选有效性掩盖下的结构性错误,而非提供大规模排行榜或端到端编辑性能度量。
ExBind is an executable correspondence diagnosis benchmark developed by the Department of Automation, Tsinghua University, aiming to isolate the structured correspondence layer between semantic localization and code execution in visual feedback editing workflows. The dataset includes 540 carefully controlled instances, covering 250 comprehensive diagnostic suites, 240 targeted structural diagnostic suites, and 50 paired latent groups. Derived from representation-agnostic latent binding instances, these instances are compiled into multiple observation surfaces such as SVG, DOM, canvas, tree, graph and table via format-specific compilers, while retaining reversible mappings to support deterministic diagnosis. Its construction follows the compilation paradigm of mapping shared latent targets to surface-specific observations, ensuring that each instance has known latent ground truths and recoverable structural constraints. This dataset is primarily designed to evaluate a model's ability to parse executable references in real-world editing scenarios and diagnose structural errors masked by candidate validity, rather than providing large-scale leaderboards or end-to-end editing performance metrics.
ExBind 是一个用于视觉到可执行对应关系的受控诊断基准(controlled diagnostic benchmark),版本为 v2.0。该基准旨在评估模型能否将视觉或语义所指对象映射到可执行环境所需的精确结构化引用,并通过确定性标注对每次预测进行分解。它属于基准测试与评估工具包,不涉及修正、重排序、训练或智能体策略。
数据集构成
- 广泛诊断套件:包含 250 个用例,涵盖画布(Canvas)、树(Tree)、DOM、图(Graph)、表格(Table)和 SVG 表面场景。
- 定向结构套件:包含 240 个用例,细分为 120 个表格用例与 120 个层级结构用例。
- 配对潜变量组:共 50 组,用于验证 SVG 与画布之间以及树与 DOM 之间的一致性。
- 确定性评估器:支持精确匹配、维度级、失败阶段和跨格式评分。
- 冻结论文输出:包含 Qwen2.5-VL-3B 和 Qwen3-VL-4B 的预测结果与摘要。
- 支持性模型输出:提供 LLaVA-Phi-3-mini 在广泛与表格任务上的预测结果及摘要。
- 论文材料:包含 ARR/arXiv 手稿源文件、PDF 与图表。
使用方法
通过脚本可重新生成受控基准数据,例如使用固定随机种子生成广泛与定向套件;也可对已有预测文件进行评分,预测文件采用 JSONL 格式,每条记录包含 case_id 与 prediction 字段,预测内容仅包含表面引用,无需提供推理过程或中间标签。
数据布局
核心数据存放于 data/exbind_v2/ 目录,分为 broad/、targeted/ 和 cross_format/ 子目录。结果数据位于 results/ 下,涵盖冻结模型、候选排序和表格消融。另有 huggingface/ 目录,为可直接上传至 Hugging Face 的数据集仓库,但需作为独立数据集仓库上传,GitHub 仓库仅作为源代码与可复现性主页。
可复现级别
- 第一级:直接使用已附带的预测与得分文件,无需模型权重。
- 第二级:通过固定种子运行确定性生成器以重新生成基准记录。
- 第三级:需另行获取模型检查点,并遵循模型特定条款与严格的输出契约。
- 第四级:使用附带的 ACL 样式与图表编译论文源文件。
许可与版权
核心软件采用 MIT 许可证;新生成的基准核心记录采用 CC BY 4.0 许可证。模型权重与继承的基准数据未包含在发布包内,如需获取或再分发,需参考第三方声明文件。
引用
论文手稿位于 paper/ 目录,报告结果时请注明 ExBind v2.0 版本。




