vinhome_samples
收藏资源简介:
Vinhome Copilot Samples 是一个用于 Vinhome Copilot 演示任务的合成训练样本数据集。该数据集通过非交互式 Codex 模型,采用种子提示级多样性采样方法生成,旨在为图像到图像和文本到图像任务提供多样化的训练数据。数据集包含 9 个不同的任务分片,其中 8 个为图像任务,1 个为文本任务。图像任务包括图像超分辨率、体量到最终建筑、总平面图到概念设计、材质替换、氛围灯光调整、人物修复、渲染增强和视图同步;文本任务为提示协同。每个任务的数据组织在对应的 <task-slug>/ 目录下,包含一个规范样本和位于 `NNNN/` 子目录中的编号多样性样本。对于图像任务,每个样本通常包含输入图像(input.png)和输出图像(output.png),部分双输入任务还包含参考图像(reference.png)。对于文本任务(prompt-copilot),每个样本包含请求文本(request.txt)、简要说明(brief.txt)和预览图像(preview.png)。此外,每个样本目录都包含一个记录提示信息和采样变体属性的元数据文件(metadata.json),以及一个列出所有样本及其文件路径的索引文件(index.jsonl)。数据集总大小约为 16.2 GB,每个任务分片包含 305 个样本,总计 2745 个样本。数据集适用于图像生成、图像编辑、文本到图像生成等计算机视觉和生成式人工智能任务的研究与开发。
Vinhome Copilot Samples is a synthetic training sample dataset for Vinhome Copilot demonstration tasks. It is generated using a non-interactive Codex model with seed prompt-level diversity sampling, aiming to provide diverse training data for image-to-image and text-to-image tasks. The dataset includes 9 distinct task shards, with 8 image tasks and 1 text task. Image tasks encompass image super-resolution, massing to final building, site plan to concept design, material replacement, ambiance lighting adjustment, character restoration, rendering enhancement, and view sync; the text task is prompt copilot. Data for each task is organized in corresponding <task-slug>/ directories, containing a canonical sample and numbered diversity samples in `NNNN/` subdirectories. For image tasks, each sample typically includes input images (input.png) and output images (output.png), with some dual-input tasks also including reference images (reference.png). For the text task (prompt-copilot), each sample contains request text (request.txt), a brief description (brief.txt), and a preview image (preview.png). Additionally, each sample directory includes a metadata file (metadata.json) recording prompt information and sampling variant attributes, and an index file (index.jsonl) listing all samples and their file paths. The total dataset size is approximately 16.2 GB, with each task shard containing 305 samples, totaling 2745 samples. The dataset is suitable for research and development in computer vision and generative AI tasks such as image generation, image editing, and text-to-image generation.
数据集名称
Vinhome Copilot Samples
任务类别
- image-to-image(图像到图像)
- text-to-image(文本到图像)
数据集描述
该数据集是为 Vinhome Copilot 演示的 9 项任务生成的合成训练样本,通过非交互式 Codex 结合种子级提示多样性采样生成。
配置与分片
default 配置
包含以下分片(部分数据来自原始目录 data/ 和补充目录 data_append_20260712/):
- image_upscale
- massing_to_final_architecture
- masterplan_to_concept
- material_replacement
- mood_lighting_change
- people_fixing
- prompt_copilot
- render_enhancement
- view_synchronization
append_20260712 配置
仅包含来自 data_append_20260712/ 目录的补充数据,分片包括:
- image_upscale
- masterplan_to_concept
- mood_lighting_change
- people_fixing
- prompt_copilot
- render_enhancement
- view_synchronization
数据字段
每个样本包含以下字段:
- task(字符串):任务名称
- slug(字符串):任务标识
- sample_id(int32):样本 ID
- kind(字符串):数据类型(image 或 text)
- description(字符串):描述
- transformation(字符串):变换类型
- variation(字符串):变体属性
- input(图像):输入图像
- reference(图像):参考图像(仅双输入任务)
- output(图像):输出图像
- preview(图像):预览图像(文本任务存储为 preview.png)
- request(字符串):请求文本(文本任务)
- brief(字符串):简要文本(文本任务)
样本分布
| 分片任务 | 数据类型 | 完整样本数 |
|---|---|---|
| image_upscale(图像放大) | 图像 | 400 |
| massing_to_final_architecture(体量到最终建筑) | 图像 | 200 |
| masterplan_to_concept(总平面到概念) | 图像 | 295 |
| material_replacement(材质替换) | 图像 | 200 |
| mood_lighting_change(氛围灯光变化) | 图像 | 400 |
| people_fixing(人物修复) | 图像 | 400 |
| prompt_copilot(提示副驾驶) | 文本 | 400 |
| render_enhancement(渲染增强) | 图像 | 400 |
| view_synchronization(视图同步) | 图像 | 400 |
数据集大小
- 下载大小:7,391,017,549 字节
- 数据集总大小:7,419,955,301 字节
文件结构
每个任务(task-slug)目录下:
- 根目录存放一个标准样本
NNNN/子目录存放编号的多样性样本- 图像任务包含
input.png、output.png(双输入任务额外包含reference.png) - 文本任务(prompt-copilot)包含
request.txt、brief.txt和preview.png - 每个样本目录包含
metadata.json(记录提示和变体属性) index.jsonl列出所有样本及其文件路径





