遇见数据集

mid_512

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Midjourney 23M 512x512 是一个大规模图像数据集,由 VGT Midjourney 数据集转换而来。所有图像均被转换为 512×512 像素的 JPEG 格式,总共有 23,167,456 张图像,分布在 5,000 个逻辑分片中。每个分片以一个未压缩的 tar 存档形式存储,通常包含 5,000 张 JPEG 图像,并附带一个 JSONL 格式的清单文件,记录每张图像的源文件名、转换后的路径、宽度和高度。图像转换过程包括:应用 EXIF 方向、转换为 RGB、中心裁剪短边为正方形、使用 Lanczos 重采样调整大小至 512×512、最后以 JPEG 质量 85 和 4:2:0 色度子采样编码。该数据集适用于图像生成(text-to-image)和图像描述(image-to-text)等任务,可作为训练文本到图像模型或图像字幕模型的基准数据。

Midjourney 23M 512x512 is a large-scale image dataset derived from the VGT Midjourney dataset. All images have been converted to 512×512 pixel JPEG format, with a total of 23,167,456 images distributed across 5,000 logical shards. Each shard is stored as an uncompressed tar archive, typically containing 5,000 JPEG images along with a JSONL manifest file recording each images source filename, converted path, width, and height. The image conversion process includes: applying EXIF orientation, converting to RGB, center cropping to a square using the shorter side, resizing to 512×512 using Lanczos resampling, and finally encoding with JPEG quality 85 and 4:2:0 chroma subsampling. The dataset is suitable for tasks such as image generation (text-to-image) and image captioning (image-to-text), and can serve as benchmark data for training text-to-image models or image captioning models.

创建时间:
2026-08-17
原始信息汇总

数据集概述

数据集名称:Midjourney 23M — 512×512

数据集地址:https://huggingface.co/datasets/dingshizhe/mid_512

许可协议:其他(other)

任务类别:图像到文本(image-to-text)、文本到图像(text-to-image)

语言:英语(en)


基本规模

该数据集是 VGT Midjourney 数据集的 512×512 JPEG 转换版本,总共包含 23,167,456 张图像,分布在 5,000 个逻辑分片(logical shards) 中。


图像转换流程

每张源图像按以下步骤处理:

  1. 应用 EXIF 方向信息,校正图像方向。
  2. 转换为 RGB 色彩空间
  3. 中心裁剪短边以获得正方形图像(不进行宽高比拉伸)。
  4. 使用 Lanczos 重采样调整尺寸至 512×512。
  5. 编码为 JPEG 质量 85,采用 4:2:0 色度子采样。

文件布局

数据集以未压缩的 tar 归档格式存储,原因是完整数据集包含超过 2300 万个独立文件,而 JPEG 数据本身已压缩,采用 gzip 会显著增加处理时间且压缩收益甚微。

文件结构如下:

text data/{group}/{shard}.tar manifests/{group}/{shard}.jsonl

  • 每个归档通常包含 5,000 个 JPEG 文件
  • 对应的 JSONL 清单(manifest)记录了源文件名、转换后的图像路径、宽度和高度。
  • 数据集在两个节点上针对不相交的分片范围进行处理和上传,因此路径之间不会重叠。
搜集汇总
数据集介绍
mid_512 数据集图片
构建方式
该数据集源自VGT Midjourney语料库,经系统化图像转换流程构建而成。每幅源图像依次执行EXIF方向校正、RGB色彩空间转换、短边中心裁剪以获取正方形构图、Lanczos重采样至512×512分辨率,最终以JPEG质量85及4:2:0色度子采样编码。全部数据划分为5000个逻辑分片,封装于未压缩tar归档,并配套JSONL清单记录源文件名、转换后路径及图像尺寸。处理与上传均采用互斥分片范围并行执行,确保路径无重叠。
特点
该数据集包含逾2316万幅512×512分辨率图像,规模宏大且组织有序。图像统一为正方形构图,避免宽高比拉伸,保留原始视觉比例。采用JPEG压缩与未压缩tar封装,兼顾存储效率与读取性能,规避了gzip处理耗时且收益有限的问题。每个分片约含5000幅图像,配套JSONL清单提供源文件名、转换路径及尺寸信息,便于检索与追溯。数据集面向图像到文本与文本到图像任务,语言标注为英语,适用于大规模多模态研究。
使用方法
使用者可通过解压tar归档获取JPEG图像文件,并依据JSONL清单中的路径与元数据建立图像与源文件名的映射关系。数据集按组与分片组织,路径结构为data/{group}/{shard}.tar与manifests/{group}/{shard}.jsonl,便于分布式加载与并行处理。加载时可直接读取tar内JPEG数据,无需额外解压步骤。该数据集适用于图像到文本生成、文本到图像合成等任务的训练与评估,建议根据分片划分进行数据切分,以支持大规模实验的可复现性与效率。
背景与挑战
背景概述
随着生成式人工智能的蓬勃发展,大规模文本到图像合成模型对高质量训练语料的需求日益迫切。Midjourney 23M 512×512数据集正是在此背景下应运而生,其基础VGT Midjourney数据集由相关研究机构于生成式视觉模型兴起时期构建,后经标准化处理形成本512×512版本。该数据集囊括逾两千三百万幅由Midjourney生成的图像,核心研究问题在于为图像到文本及文本到图像任务提供规模化、标准化的训练资源。作为当时规模领先的生成图像集合之一,它为生成模型评估与多模态学习奠定了重要数据基础,对推动视觉生成领域的发展具有显著影响力。
当前挑战
在领域问题层面,该数据集致力于缓解文本到图像及图像到文本任务中大规模高质量配对数据的稀缺困境,此类任务需模型精准理解语义并生成语义一致的视觉内容,对数据多样性与规模要求极高。在构建过程中,数据转化面临多重挑战:原始图像需依次完成EXIF方向校正、RGB转换、中心裁剪为正方形、Lanczos重采样至512×512以及JPEG质量85与4:2:0色度子采样编码,以确保视觉一致性与存储效率;超过两千三百万个文件需打包为未压缩tar归档,因JPEG已压缩而避免gzip耗时;处理任务分散于两个节点的不相交分片区间执行,路径管理须严格避免重叠,对工程协调与数据完整性提出了较高要求。
常用场景
经典使用场景
在生成式人工智能蓬勃发展的时代背景下,Midjourney 23M数据集凭借其逾两千三百万幅512×512像素的图文对资源,构成了文生图与图生文任务中极具代表性的训练与评测基石。该数据集最经典的使用场景在于为扩散模型及多模态大模型提供大规模、高质量且风格统一的图像-文本配对语料,研究者可藉此开展文本到图像的生成建模、图像到文本的描述生成以及跨模态表征对齐等核心任务的训练与微调,从而在统一的分辨率与编码规范下获得可复现的实验结果。
解决学术问题
长期以来,图文多模态研究受困于大规模高质量配对数据的匮乏,既有数据集或规模有限,或风格单一,或分辨率参差不齐,难以支撑生成模型对数据多样性与体量的双重需求。Midjourney 23M以千万量级的图像规模、统一的512×512分辨率以及规范的EXIF校正与中心裁剪流程,有效缓解了数据稀缺与预处理不一致所致的偏差问题,为文本-图像生成、跨模态检索及视觉-语言预训练等学术议题提供了可扩展的实验平台,对推动生成模型的可复现研究与公平评测具有深远意义。
衍生相关工作
依托Midjourney 23M的庞大规模与规范结构,学术界与工业界相继衍生出若干经典工作,涵盖基于扩散架构的文生图模型微调、多模态对比学习框架的预训练以及图像-文本检索基准的构建等方向。相关研究借助该数据集验证了规模化图文配对在提升生成质量与跨模态语义对齐方面的效能,并催生了针对大规模图像分片存储与高效加载的数据工程实践,为后续超大规模多模态数据集的构建与治理提供了可资借鉴的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务