遇见数据集

lhpku20010120/DeltaSynth

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Δ-Harness数据集是论文《Δ-Harness: An Agentic Data Harness for Generative Visual and World Models》的配套数据发布,旨在为生成视觉和世界模型提供代理数据工具。数据集包含诊断基准种子(Δ-DiagBench v0/v0.5)、多个实验阶段的图像和JSON数据(如E1主实验、E2人类评估、E3 LoRA训练池、E4视频试点)、以及用于训练和评估的合成数据。总大小约28 GB,涵盖图像编辑、文本到图像等任务,支持LoRA训练、验证对齐和故障模式分析,适用于研究生成模型的性能改进和数据代理方法。

The Δ-Harness dataset is a companion data release for the paper Δ-Harness: An Agentic Data Harness for Generative Visual and World Models, designed to provide an agentic data harness for generative visual and world models. It includes diagnostic benchmark seeds (Δ-DiagBench v0/v0.5), image and JSON data from multiple experimental phases (e.g., E1 main experiment, E2 human evaluation, E3 LoRA training pools, E4 video pilot), and synthetic data for training and evaluation. Totaling approximately 28 GB, the dataset covers tasks such as image editing and text-to-image, supporting LoRA training, verifier alignment, and failure mode analysis, making it suitable for research on improving generative model performance and data agent methods.

提供机构:
lhpku20010120
搜集汇总
数据集介绍
lhpku20010120/DeltaSynth 数据集图片
构建方式
DeltaSynth数据集的构建依托于代理化数据生成框架Δ-Harness,该框架通过随机采样(R0)、矩阵穷举(R1)、过滤优化(R2)与智能代理(R3)四种策略逐步迭代,从诊断种子池Δ-DiagBench中筛选出高质量图像编辑案例。数据集共包含11个压缩档案,总计约28GB,每个档案对应不同实验阶段与配置,如R0至R3的四大主池及消融实验、α敏感性扫描等数据,其中R3代理模式产生了1000个优质案例,成为论文核心成果。训练/评估划分基于确定性随机种子20260529,确保761/191比例的固定分配,便于结果复现。
特点
DeltaSynth的核心特色在于其多维度诊断能力与验证器对齐机制。数据集不仅涵盖图像编辑的多种失败模式与修复案例,还通过交叉视觉语言模型面板与作者标注的对比,揭示了评分一致性差异——如gpt-5.5与作者标签的组内相关系数高达0.79,而gpt-4o仅为0.35,凸显了“一致性缺乏有效性”的关键现象。此外,R3代理策略相较于R1矩阵法生成了4.6倍的有效训练数据,展现了智能数据生成在规模与质量上的显著优势。视频实验的引入(7轴验证器评分)进一步扩展了动态场景的评估维度。
使用方法
用户可通过HuggingFace CLI便捷下载各档案,例如获取诊断种子仅需10MB的文本档案,或下载主池数据用于LoRA训练。训练流程遵循GitHub仓库中的E3_GPU_RUNBOOK指南,包含路径重定向、五模型LoRA训练、固定优化预算与留出评估等七个阶段。验证器对齐表可通过执行特定Python脚本复现,而诊断基准的划分也可通过命令行工具重新生成,确保结果与发布版本完全一致。对于包含生成图像的档案,建议用户遵守上游内容政策进行分发。
背景与挑战
背景概述
生成式视觉模型与世界模型的快速发展对训练数据的质量与多样性提出了严苛要求,然而现有合成数据管道往往因生成策略单一、验证机制薄弱而导致数据存在系统性偏差和失败模式。在此背景下,由北京大学梁浩团队于2026年提出的DeltaSynth数据集应运而生,该数据集伴随论文《Δ-Harness: An Agentic Data Harness for Generative Visual and World Models》发表,由OpenDCAI机构发布,核心研究问题在于如何通过智能体驱动的数据收集框架系统性地提升合成数据的有效性与鲁棒性。DeltaSynth不仅提供了涵盖图像编辑、文本到图像生成等多任务的诊断基准(Δ-DiagBench v0/v0.5),还包含超过三千个经严格筛选的优质样本(GoodCases),并配套了多视角验证器对齐评估体系。该数据集在生成式模型数据质量评估领域树立了新的基准,其对失败模式的归因分析和验证器对齐方法论为后续研究提供了重要参考,显著推动了合成数据在视觉生成任务中的可靠应用。
当前挑战
DeltaSynth数据集所解决的领域问题挑战在于生成式视觉模型训练数据中普遍存在的质量不可控与失败模式隐蔽性:传统随机采样或固定矩阵生成策略难以应对模型在复杂场景下的退化现象,且缺乏系统性诊断工具来识别与修复低质生成样本。在构建过程中,该数据集面临多重挑战:首先,需设计可解释的智能体数据收集框架以自适应地探索失败模式边界,这要求协调多个生成与验证模块的实时协作;其次,构建涵盖476至952个压力提示词的诊断基准需确保其覆盖常见与边缘故障场景,同时平衡训练与评估分区的统计同质性;再者,跨视觉语言模型的验证器对齐实验表明,不同模型对生成质量的评判标准存在显著差异(如gpt-5.5与gpt-4o的ICC值从0.79骤降至0.35),揭示出验证器与人类主观评估间的“一致性但不有效性”悖论,这为数据质量度量的标准化带来了根本性困难;此外,大规模图像数据存储与多阶段实验的可复现性要求也构成了工程层面的严峻挑战。
常用场景
经典使用场景
DeltaSynth数据集为生成式视觉模型与世界模型的诊断与合成数据生产提供了标准化基准。其核心用途在于评估图像编辑与文本到图像生成任务中模型的失败模式,并通过代理式数据合成管线(Δ-Harness)系统性生成高质量训练样本。研究人员常利用该数据集的DiagBench种子池(v0.5版本含952条提示)构建压力测试集,或基于其R0至R4四个数据池(总计3249个GoodCases)进行低秩适配(LoRA)微调,以验证数据质量对模型性能的提升效果。该数据集尤其适用于比较不同数据筛选策略(如随机采样、矩阵枚举、过滤及代理驱动)在训练效率上的差异。
解决学术问题
DeltaSynth的构建旨在解决生成式模型领域长期存在的两个核心学术困境:一是合成数据生产过程中缺乏对数据质量的可控性与可诊断性评估,二是现有基准测试难以系统性地识别模型在复杂指令下的隐性失败模式。通过提出Δ-Harness框架,该数据集首次实现了将数据合成流程与验证器对齐(verifier alignment)相结合的闭环评估体系,使得研究者能够量化不同采样策略(如代理式重写与覆盖率优化)对GoodCase生成率的贡献。该工作通过E1至E4四组对照实验,揭示了固定矩阵策略(R1)与代理驱动策略(R3)之间24%的相对质量差距,为数据效率理论提供了实证基础,并推动了合成数据领域从经验驱动向诊断驱动的范式转变。
衍生相关工作
DeltaSynth催生了多个方向的前沿探索。其核心代理式数据合成框架启发了后续研究者将强化学习中的探索-利用权衡思想引入数据生成领域,形成了基于蒙特卡洛树搜索的提示规划变体。DiagBench诊断基准已被复用在基于扩散模型的视频编辑任务中,衍生出评估时空一致性与物体持久性的扩展评测集(如Δ-VideoBench)。在模型对齐方向,该数据集的验证器-人类标签一致性分析框架被借鉴用于研究多模态大模型(如GPT-4o与GPT-5)在视觉质量评估中的偏差模式,揭示了高一致性(ICC=0.79)与“一致但不准确”(ICC=0.35)的认知分型。此外,其开源代码库中的LoRA训练管道被社区适配为通用数据效率分析工具,应用于文本到3D生成与神经辐射场(NeRF)的自主数据增强场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务