遇见数据集

vinhome_samples

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

Vinhome Copilot Samples 是一个用于 Vinhome Copilot 演示任务的合成训练样本数据集。该数据集通过非交互式 Codex 模型,采用种子提示级多样性采样方法生成,旨在为图像到图像和文本到图像任务提供多样化的训练数据。数据集包含 9 个不同的任务分片,其中 8 个为图像任务,1 个为文本任务。图像任务包括图像超分辨率、体量到最终建筑、总平面图到概念设计、材质替换、氛围灯光调整、人物修复、渲染增强和视图同步;文本任务为提示协同。每个任务的数据组织在对应的 <task-slug>/ 目录下,包含一个规范样本和位于 `NNNN/` 子目录中的编号多样性样本。对于图像任务,每个样本通常包含输入图像(input.png)和输出图像(output.png),部分双输入任务还包含参考图像(reference.png)。对于文本任务(prompt-copilot),每个样本包含请求文本(request.txt)、简要说明(brief.txt)和预览图像(preview.png)。此外,每个样本目录都包含一个记录提示信息和采样变体属性的元数据文件(metadata.json),以及一个列出所有样本及其文件路径的索引文件(index.jsonl)。数据集总大小约为 16.2 GB,每个任务分片包含 305 个样本,总计 2745 个样本。数据集适用于图像生成、图像编辑、文本到图像生成等计算机视觉和生成式人工智能任务的研究与开发。

Vinhome Copilot Samples is a synthetic training sample dataset for Vinhome Copilot demonstration tasks. It is generated using a non-interactive Codex model with seed prompt-level diversity sampling, aiming to provide diverse training data for image-to-image and text-to-image tasks. The dataset includes 9 distinct task shards, with 8 image tasks and 1 text task. Image tasks encompass image super-resolution, massing to final building, site plan to concept design, material replacement, ambiance lighting adjustment, character restoration, rendering enhancement, and view sync; the text task is prompt copilot. Data for each task is organized in corresponding <task-slug>/ directories, containing a canonical sample and numbered diversity samples in `NNNN/` subdirectories. For image tasks, each sample typically includes input images (input.png) and output images (output.png), with some dual-input tasks also including reference images (reference.png). For the text task (prompt-copilot), each sample contains request text (request.txt), a brief description (brief.txt), and a preview image (preview.png). Additionally, each sample directory includes a metadata file (metadata.json) recording prompt information and sampling variant attributes, and an index file (index.jsonl) listing all samples and their file paths. The total dataset size is approximately 16.2 GB, with each task shard containing 305 samples, totaling 2745 samples. The dataset is suitable for research and development in computer vision and generative AI tasks such as image generation, image editing, and text-to-image generation.

创建时间:
2026-07-07
原始信息汇总

数据集名称

Vinhome Copilot Samples

任务类别

  • image-to-image(图像到图像)
  • text-to-image(文本到图像)

数据集描述

该数据集是为 Vinhome Copilot 演示的 9 项任务生成的合成训练样本,通过非交互式 Codex 结合种子级提示多样性采样生成。

配置与分片

default 配置

包含以下分片(部分数据来自原始目录 data/ 和补充目录 data_append_20260712/):

  • image_upscale
  • massing_to_final_architecture
  • masterplan_to_concept
  • material_replacement
  • mood_lighting_change
  • people_fixing
  • prompt_copilot
  • render_enhancement
  • view_synchronization

append_20260712 配置

仅包含来自 data_append_20260712/ 目录的补充数据,分片包括:

  • image_upscale
  • masterplan_to_concept
  • mood_lighting_change
  • people_fixing
  • prompt_copilot
  • render_enhancement
  • view_synchronization

数据字段

每个样本包含以下字段:

  • task(字符串):任务名称
  • slug(字符串):任务标识
  • sample_id(int32):样本 ID
  • kind(字符串):数据类型(image 或 text)
  • description(字符串):描述
  • transformation(字符串):变换类型
  • variation(字符串):变体属性
  • input(图像):输入图像
  • reference(图像):参考图像(仅双输入任务)
  • output(图像):输出图像
  • preview(图像):预览图像(文本任务存储为 preview.png)
  • request(字符串):请求文本(文本任务)
  • brief(字符串):简要文本(文本任务)

样本分布

分片任务 数据类型 完整样本数
image_upscale(图像放大) 图像 400
massing_to_final_architecture(体量到最终建筑) 图像 200
masterplan_to_concept(总平面到概念) 图像 295
material_replacement(材质替换) 图像 200
mood_lighting_change(氛围灯光变化) 图像 400
people_fixing(人物修复) 图像 400
prompt_copilot(提示副驾驶) 文本 400
render_enhancement(渲染增强) 图像 400
view_synchronization(视图同步) 图像 400

数据集大小

  • 下载大小:7,391,017,549 字节
  • 数据集总大小:7,419,955,301 字节

文件结构

每个任务(task-slug)目录下:

  • 根目录存放一个标准样本
  • NNNN/ 子目录存放编号的多样性样本
  • 图像任务包含 input.pngoutput.png(双输入任务额外包含 reference.png
  • 文本任务(prompt-copilot)包含 request.txtbrief.txtpreview.png
  • 每个样本目录包含 metadata.json(记录提示和变体属性)
  • index.jsonl 列出所有样本及其文件路径
搜集汇总
数据集介绍
vinhome_samples 数据集图片
构建方式
Vinhome Copilot Samples 数据集专为建筑与室内设计领域的九项智能辅助任务而构建,其样本通过非交互式 Codex 引擎生成,并借助种子级别的提示多样性采样策略来确保数据的丰富性与代表性。在组织架构上,每个任务类别以独立目录存放,根目录下保存一个标准样本,而编号子目录则容纳了多样性的派生样本。对于图像任务,每个样本均包含输入与输出图像(部分双输入任务额外提供参考图像);文本任务则存储请求文本、简要描述及预览图像。每个样本目录均附有包含提示参数及变化属性的元数据文件,同时 index.jsonl 列出所有样本的路径索引。该数据集分两个配置版本:默认配置涵盖全部九项任务,而追加版本仅包含七项主要任务的数据,样本总数达 2895 例,体量约为 7.4 GB。
特点
该数据集的核心特点在于其针对特定设计任务的高度专业化与多样性。它覆盖了建筑可视化流程中的关键环节,包括图像超分辨率、体量到最终建筑的转化、总平到概念设计、材质替换、氛围灯光变换、人物修正、渲染增强及视角同步共八项图像任务,以及一项文本引导的 prompt 辅助任务。每个任务均包含 200 至 400 个不等的样本,确保统计上的充分性。更值得关注的是,数据集中引入了显式的变化属性字段,能够记录样本在风格、光照、材质等方面的变异程度,从而支持模型在训练过程中学习可控的生成变换。此外,多模态数据的结构化存储方式(图像对、文本对元数据)为跨模态学习任务提供了坚实的基础。
使用方法
使用时,研究者可通过 HuggingFace Datasets 库直接加载该数据集。默认配置下,所有九个任务的数据可通过指定 'default' 配置名获取,而追加数据则对应 'append_20260712' 配置。每个任务被划分为独立的子集(split),例如 'image_upscale'、'mood_lighting_change' 等,便于按需加载特定类型的训练样本。数据集的特征字段包含任务名称、样本标识、输入与输出图像(以 PIL Image 格式加载)、参考图像以及相关的文本描述,适用于图像到图像翻译、文本到图像生成及多模态对齐等多种训练范式。此外,存储在元数据中的变换与变化属性可用于构建条件生成模型或评估模型在不同变异因子下的泛化能力。
背景与挑战
背景概述
Vinhome Copilot Samples数据集由Elfsong团队于2023年创建,专为Vinhome Copilot演示任务而设计,涵盖图像超分辨率、体块到最终建筑、总平到概念设计、材质替换、氛围照明调整、人物修正、渲染增强和视图同步等九项视觉任务。该数据集通过非交互式Codex模型结合种子级提示多样性采样生成,旨在为建筑视觉设计领域的多模态生成模型提供高质量的训练样本,推动文本到图像与图像到图像任务的工程化应用,对提升AI辅助建筑设计工具的实用性具有里程碑意义。
当前挑战
该数据集核心解决了建筑设计领域中复杂视觉任务的多模态对齐挑战,包括从抽象总平到具体概念的语义映射、材质与光照的精准替换、渲染质量的自动化增强以及视图间的一致性同步。构建过程中面临的主要挑战包括:1) 如何通过提示多样性采样确保样本的覆盖范围与任务针对性;2) 处理图像放大、人物修复等任务时保持输出图像的语义保真度与视觉自然性;3) 管理多任务(如文本到图与图到图)间数据格式与特征的统一规范,以及存储与索引的高效组织。
常用场景
经典使用场景
在建筑与城市设计领域,vinhome_samples数据集为多模态图像生成与编辑任务提供了丰富的训练样本。其经典使用场景涵盖建筑体块到最终立面的转化、总体规划到概念设计的语义映射、材质替换与氛围灯光调整等精细化编辑操作。通过将输入图像与对应的期望输出配对,该数据集支持图像超分辨率、渲染增强以及视角同步等任务,为计算机视觉与图形学交叉研究提供了高质量的合成训练材料。
解决学术问题
该数据集有效解决了建筑可视化中数据稀缺与标注成本高昂的学术难题。传统方法依赖人工采集配对图像,而vinhome_samples通过非交互式Codex与提示级多样性采样自动生成大规模合成样本,突破了数据获取瓶颈。它推动了条件图像生成、跨域迁移学习及多任务联合训练等方向的研究进展,为评估模型在复杂建筑场景下的泛化能力建立了标准化基准。
衍生相关工作
基于该数据集衍生的工作推动了建筑AI领域的多个里程碑成果。研究者利用其多任务结构开发了统一的图像到图像转换框架,实现了同一模型对多种建筑编辑任务的适配。此外,数据集中提示级多样性采样的策略启发了自监督学习与数据增强的新方法,催生了更高效的合成数据生成管线。这些工作为建立开放的建筑视觉智能生态奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务