遇见数据集

hny-research/hny-vcv-ui

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

HNY-VCV-UI是一个合成用户界面(UI)视觉合同验证数据集,专门用于视觉问答任务。该数据集包含训练集和验证集,用于测试紧凑视觉观察者模型是否能根据提供的图像和视觉合同判断合同是否被满足(SATISFIED)、违反(VIOLATED)或未知(UNKNOWN),并提供基于证据的决策。数据集由HNY研究部门通过实验002的合成UI视觉合同管道生成,包括132个训练样本和44个验证样本,总计176个PNG图像文件,每个样本包含id、图像路径、元数据(如决策、难度、分割和图像哈希)、提示和目标。

HNY-VCV-UI is a synthetic UI visual-contract verifier SFT dataset for visual-question-answering tasks. It is used to test whether a compact visual observer can determine if an image satisfies, violates, or has an unknown status relative to a visual contract, and provide grounded evidence. The dataset is generated by the HNY Research Division Experiment 002 synthetic UI visual-contract pipeline, consisting of 132 training rows and 44 validation rows, with a total of 176 PNG image files. Each JSONL row includes id, image_path, metadata (such as decision, difficulty, split, and image hash), prompt, and target.

提供机构:
hny-research
搜集汇总
数据集介绍
hny-research/hny-vcv-ui 数据集图片
构建方式
该数据集源自HNY研究部门实验002的合成UI视觉合约管线,是HNY-VCV-001数据集的训练与验证子集。数据集以JSONL格式组织,包含训练集132条、验证集44条,以及176张PNG图像文件。每条数据记录包含唯一标识符、图像路径、元数据(涵盖决策结果、难度等级、数据划分及图像哈希值)、提示文本与目标输出。数据集的构建旨在检验紧凑型视觉观察器能否基于输入图像与视觉合约,输出“满足”、“违反”或“未知”三类判定结果,并提供基于证据的支撑信息。
使用方法
数据集以JSONL文件形式提供,用户可直接加载训练与验证划分。使用时需将PNG图像存放于与JSONL文件平级的png目录下,通过image_path字段引用相关图像。每条数据的prompt字段可作为输入,target字段作为期望输出。由于数据集面向SFT(监督微调),用户可根据任务需求将其用于视觉语言模型的指令微调或评估。该数据集通过Hugging Face提交SHA被控制平面仓库锁定,建议通过版本管理确保数据源的可追溯性。
背景与挑战
背景概述
HNY-VCV-UI数据集由HNY研究部门于近期发布,旨在探索紧凑型视觉观察器在用户界面视觉合约验证任务中的能力,其核心研究问题是通过图像与视觉合约的联合推理,判定用户界面是否满足、违反或无法确认特定约束条件。数据集的创建标志着合成数据生成技术在视觉理解评估中的重要进展,特别是在可解释性需求日益增长的领域,如人机交互与自动化测试。通过实验002管道生成的176张合成UI图像及配套标注,该数据集为验证视觉合约验证器的鲁棒性提供了标准化基准,对推动视觉语言模型在细粒度、高可靠性任务中的应用具有关键影响。
当前挑战
该数据集面临的挑战主要来自两个层面。首先,在领域问题层面,视觉合约验证要求模型同时理解图像内容与抽象逻辑规则,这比传统视觉问答任务更复杂,需要模型具备符号推理与噪声鲁棒性;当前紧凑型视觉观察器在平衡精度与计算效率上仍存在显著瓶颈。其次,在构建过程中,合成数据虽可控制变量,但难以覆盖真实UI中非规律性错误、光照变化或元素重叠等边缘情况;此外,仅132条训练样本的规模限制了模型对复杂场景的泛化能力,且缺乏跨设备、跨平台的多样界面风格,可能引入过度拟合风险。
常用场景
经典使用场景
在视觉与结构化逻辑的交汇领域,HNY-VCV-UI 数据集以其独特的合成UI界面与视觉合约验证任务,为多模态推理提供了一个精巧的测试平台。该数据集最经典的使用场景在于评估紧凑型视觉观察器能否依据UI截图与预定义的视觉合约,准确判断合约状态——满足、违反或未知,并输出带证据支撑的判定结果。这一范式模拟了人机界面中自动合规性检查的核心流程,尤其适合用于训练和验证视觉语言模型在细粒度、结构化场景下的理解与推理能力,成为探索视觉契约执行自动化的重要基石。
解决学术问题
该数据集直面视觉推理中一个长期被忽视的学术问题:如何在UI这类高度结构化、语义密集的图像中,实现基于视觉合约的自动化状态验证。传统视觉问答数据集多聚焦于自然场景的开放式问题,而HNY-VCV-UI 通过引入明确的视觉合约概念,将任务从简单的图像描述提升至逻辑约束的满足性判定。它解决了模型能否跨越像素级特征与符号级规则之间鸿沟的学术挑战,为研究视觉推理中的证据抽取、多模态逻辑一致性以及小样本下的合约泛化能力提供了标准化的基准,推动了可解释视觉问答在严谨应用领域的发展。
实际应用
在实际应用层面,HNY-VCV-UI 数据集所定义的任务具有广泛且深刻的现实价值。它直接服务于自动化UI测试领域,能够使机器在无需人工介入的情况下,根据设计规范或用户合约自动检验界面元素的呈现是否合规,例如确认按钮状态、内容显示是否满足预设条件。这一能力可无缝嵌入到持续集成与部署管线中,大幅提升软件质量保障的效率。此外,该技术还可延伸至无障碍性审查,自动验证界面是否满足无障碍标准,以及数字合同履行监控,即通过截图与合约的比对来核实实际执行状态,为金融、政务等场景提供可靠的自动化核查手段。
数据集最近研究
最新研究方向
该数据集聚焦于合成用户界面的视觉合约验证任务,属于视觉问答领域的前沿分支。研究旨在探索紧凑型视觉观察者能否通过图像与视觉合约的联合推理,准确判定界面行为是否满足合约约束,并输出带有依据的满意、违反或未知状态。这一方向与当前AI安全性和可解释性热点紧密关联,特别是在自动化UI测试和智能合约验证中具有重要应用价值。HNY-VCV-UI通过小规模、高精度的合成数据,为评估多模态模型在结构化视觉推理任务上的能力提供了基准,推动了视觉语言模型在工业级合约合规检测中的实际落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务