mid_512
收藏资源简介:
Midjourney 23M 512x512 是一个大规模图像数据集,由 VGT Midjourney 数据集转换而来。所有图像均被转换为 512×512 像素的 JPEG 格式,总共有 23,167,456 张图像,分布在 5,000 个逻辑分片中。每个分片以一个未压缩的 tar 存档形式存储,通常包含 5,000 张 JPEG 图像,并附带一个 JSONL 格式的清单文件,记录每张图像的源文件名、转换后的路径、宽度和高度。图像转换过程包括:应用 EXIF 方向、转换为 RGB、中心裁剪短边为正方形、使用 Lanczos 重采样调整大小至 512×512、最后以 JPEG 质量 85 和 4:2:0 色度子采样编码。该数据集适用于图像生成(text-to-image)和图像描述(image-to-text)等任务,可作为训练文本到图像模型或图像字幕模型的基准数据。
Midjourney 23M 512x512 is a large-scale image dataset derived from the VGT Midjourney dataset. All images have been converted to 512×512 pixel JPEG format, with a total of 23,167,456 images distributed across 5,000 logical shards. Each shard is stored as an uncompressed tar archive, typically containing 5,000 JPEG images along with a JSONL manifest file recording each images source filename, converted path, width, and height. The image conversion process includes: applying EXIF orientation, converting to RGB, center cropping to a square using the shorter side, resizing to 512×512 using Lanczos resampling, and finally encoding with JPEG quality 85 and 4:2:0 chroma subsampling. The dataset is suitable for tasks such as image generation (text-to-image) and image captioning (image-to-text), and can serve as benchmark data for training text-to-image models or image captioning models.
数据集概述
数据集名称:Midjourney 23M — 512×512
数据集地址:https://huggingface.co/datasets/dingshizhe/mid_512
许可协议:其他(other)
任务类别:图像到文本(image-to-text)、文本到图像(text-to-image)
语言:英语(en)
基本规模
该数据集是 VGT Midjourney 数据集的 512×512 JPEG 转换版本,总共包含 23,167,456 张图像,分布在 5,000 个逻辑分片(logical shards) 中。
图像转换流程
每张源图像按以下步骤处理:
- 应用 EXIF 方向信息,校正图像方向。
- 转换为 RGB 色彩空间。
- 中心裁剪短边以获得正方形图像(不进行宽高比拉伸)。
- 使用 Lanczos 重采样调整尺寸至 512×512。
- 编码为 JPEG 质量 85,采用 4:2:0 色度子采样。
文件布局
数据集以未压缩的 tar 归档格式存储,原因是完整数据集包含超过 2300 万个独立文件,而 JPEG 数据本身已压缩,采用 gzip 会显著增加处理时间且压缩收益甚微。
文件结构如下:
text data/{group}/{shard}.tar manifests/{group}/{shard}.jsonl
- 每个归档通常包含 5,000 个 JPEG 文件。
- 对应的 JSONL 清单(manifest)记录了源文件名、转换后的图像路径、宽度和高度。
- 数据集在两个节点上针对不相交的分片范围进行处理和上传,因此路径之间不会重叠。




