遇见数据集

laion-1m

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

LAION-Subset (Lance Format) 是 LAION-5B 图像-文本语料库的一个子集,包含约100万行数据,采用高效的 Lance 列式存储格式。该数据集以内联 JPEG 字节形式存储图像,并预计算了 CLIP 图像嵌入(768维),同时提供了完整的 LAION 元数据,包括标题、URL、NSFW 标志、相似度分数、图像尺寸、EXIF 信息等。此外,数据集还附带了一个预构建的 IVF_PQ 近似最近邻索引,可用于高效的向量相似性搜索。数据集的列模式包括 key(行键)、image(图像字节)、image_path(原始文件名)、caption(文本描述)、url(来源URL)、NSFW(安全标志)、LICENSE(许可证)、similarity(CLIP 相似度)、width/height(尺寸)、original_width/original_height(原始尺寸)、exif、md5、status、error_message 以及 img_emb(CLIP 嵌入向量)。所有数据存储在单个 train.lance 文件中,支持快速随机访问、多模态存储、数据版本控制和高效的数据演化。该数据集适用于文本到图像、图像到文本、零样本图像分类等任务,可通过 HuggingFace datasets 库、LanceDB 或 Lance 直接加载使用。

LAION-Subset (Lance Format) is a subset of the LAION-5B image-text corpus, containing approximately 1 million rows of data in an efficient Lance columnar storage format. The dataset stores images as inline JPEG bytes and precomputes CLIP image embeddings (768 dimensions), while providing complete LAION metadata including captions, URLs, NSFW flags, similarity scores, image dimensions, EXIF information, etc. Additionally, the dataset comes with a pre-built IVF_PQ approximate nearest neighbor index for efficient vector similarity search. The column schema includes key (row key), image (image bytes), image_path (original filename), caption (text description), url (source URL), NSFW (safety flag), LICENSE, similarity (CLIP similarity), width/height (dimensions), original_width/original_height, exif, md5, status, error_message, and img_emb (CLIP embedding vector). All data is stored in a single train.lance file, supporting fast random access, multimodal storage, data versioning, and efficient data evolution. This dataset is suitable for tasks such as text-to-image, image-to-text, zero-shot image classification, and can be loaded directly using the HuggingFace datasets library, LanceDB, or Lance.

创建时间:
2026-08-17
原始信息汇总

LAION-Subset (Lance格式) 数据集概述

基本信息

  • 数据集名称: LAION-Subset (Lance Format)
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 数据规模: 约100万行 (1M < N < 10M)
  • 任务类型: 文本到图像生成、图像到文本生成、零样本图像分类

数据来源与内容

该数据集是 LAION-5B 图像-文本语料库的一个子集,以Lance格式存储,包含约100万条数据记录。数据集中包含内联JPEG图像字节、预计算的CLIP图像嵌入向量(768维)、完整的LAION元数据以及预构建的近似最近邻(ANN)索引。

数据模式(Schema)

列名 类型 说明
key int64 行键(用于合并的自然连接键)
image large_binary 内联JPEG图像字节
image_path string 原始文件名
caption string 图像描述文本
url string 图像来源URL
NSFW int64 0=安全,1=不适宜内容
LICENSE string 每行许可标签
similarity float64 CLIP图像-文本余弦相似度
width, height int64 图像尺寸
original_width, original_height int64 调整前的原始尺寸
exif, md5, status, error_message string 来源/元数据信息
img_emb fixed_size_list<float32, 768> CLIP图像嵌入向量

关键特性

  1. 内联JPEG字节: 图像直接存储在 image 列中,无需辅助文件或图像文件夹
  2. 预计算CLIP嵌入: 提供768维图像嵌入向量,附带 IVF_PQ 索引用于相似性搜索
  3. 完整元数据: 包含描述文本、URL、NSFW标记、EXIF、尺寸、相似度分数等
  4. 单一列式数据集: 可低成本扫描元数据,仅按需获取所需行的图像字节

技术优势(Lance格式)

  • 快速随机访问: 优化分散行的读取,适合随机采样和实时ML服务
  • 原生多模态支持: 文本、嵌入和其他数据类型可共存于同一文件,大二进制对象延迟加载
  • 原生索引支持: 磁盘上的快速向量索引和全文搜索索引与数据集共存
  • 高效数据演进: 添加新列或回填数据无需重写整个数据集
  • 灵活查询: 支持向量相似性搜索、全文搜索和SQL风格过滤的单一查询组合
  • 数据版本控制: 每次变更提交新版本,旧版本保留在磁盘上

使用方式

通过HuggingFace datasets加载

python import datasets hf_ds = datasets.load_dataset("lance-format/laion-1m", split="train", streaming=True)

通过LanceDB加载

python import lancedb db = lancedb.connect("hf://datasets/lance-format/laion-1m/data") tbl = db.open_table("train")

通过Lance直接加载

python import lance ds = lance.dataset("hf://datasets/lance-format/laion-1m/data/train.lance")

功能示例

  • 搜索: 使用内置IVF_PQ索引进行近似最近邻搜索
  • 数据筛选: 结合相似度与元数据过滤(如NSFW=0、宽度≥512)构建定制子集
  • 数据演进: 添加新列(如宽高比、高分辨率标志)或合并外部标签数据
  • 训练数据加载: 通过列投影和PyTorch DataLoader集成为训练管道
  • 版本管理: 支持版本历史查看、标签创建和按版本/标签打开数据集

引用与许可

搜集汇总
数据集介绍
laion-1m 数据集图片
构建方式
该数据集源自LAION-5B大规模图文语料库,经系统化采样与格式转化构建而成。构建过程将原始图像数据以JPEG字节形式内联存储,同时集成预计算的768维CLIP图像嵌入向量,并保留完整的LAION元数据字段,包括标题、来源URL、NSFW标记、EXIF信息及相似度评分等。所有数据经统一整理为单一列式Lance数据集,并预先构建IVF_PQ近似最近邻索引,最终形成可直接从HuggingFace Hub加载的标准化资源,兼顾数据完整性与检索效率。
特点
该数据集以列式存储与内联二进制设计为显著优势,图像字节、嵌入向量与文本元数据一体化存放,消除对外部文件或目录结构的依赖,极大简化数据管理流程。预置的CLIP嵌入与IVF_PQ索引支持高效的向量相似性搜索,使百万级图文数据的随机访问与近邻查询兼具低延迟与高吞吐。Lance格式原生支持列裁剪、数据演化及版本管理,可低成本追加新列或合并外部标签,历史版本完整保留,为训练实验的可复现性提供可靠保障。
使用方法
使用者可通过HuggingFace datasets接口以流式方式快速加载并浏览样本,亦可借助LanceDB或pylance直接连接Hub上的数据集,执行向量检索、条件过滤与元数据筛选等操作。针对生产级训练与频繁随机访问场景,建议先行下载至本地以充分释放ANN索引的查询性能。数据支持在单次查询中融合向量相似度、SQL风格过滤与全文检索,亦可通过列投影仅读取训练所需字段,或利用数据演化接口新增派生列、合并外部标注,并结合版本标签实现检索系统与训练流程的精确快照锁定。
背景与挑战
背景概述
随着多模态学习的兴起,大规模图文对数据集成为训练视觉-语言模型的关键基石。LAION-5B由Christoph Schuhmann等人于2022年构建,是一个包含58.5亿图文对的开源数据集,旨在为下一代图像-文本模型提供训练资源。laion-1m作为其百万级子集,以Lance列式格式封装,内联JPEG字节、预计算CLIP嵌入及ANN索引,并保留完整元数据。该数据集降低了大规模多模态数据的访问门槛,推动了文本到图像生成、零样本分类及跨模态检索等研究的发展。
当前挑战
在领域问题上,laion-1m需应对图文检索与生成的语义鸿沟、噪声与偏差传播以及版权与安全审核等挑战,同时大规模数据的高效随机访问和相似性搜索也对存储与检索系统提出严苛要求。构建过程中,研究人员需解决元数据对齐、NSFW内容过滤、嵌入计算与索引构建的一致性问题;Lance格式虽优化了随机访问和列式扫描,但原地更新与版本控制仍依赖本地副本,云端只读特性限制了动态演化能力,且数据流式加载时的内存与带宽瓶颈亦不容忽视。
常用场景
经典使用场景
在视觉-语言预训练领域,跨模态表征学习长期依赖大规模图文对数据。laion-1m作为LAION-5B的Lance格式精炼子集,凭借内联JPEG字节、预计算CLIP图像嵌入与IVF_PQ近似最近邻索引,最经典的使用场景便是图文检索与零样本图像分类的快速实验。研究者可借助内嵌索引对768维嵌入执行相似度搜索,或结合元数据过滤进行候选集筛选,从而在无需额外工程配置的情况下完成端到端的检索与分类任务。
实际应用
在实际应用层面,laion-1m支撑了跨模态检索系统的快速原型开发,例如以文本或图像为查询进行视觉相似内容召回。其元数据与NSFW标记使得数据管护流程能够在一次查询中同时完成安全过滤与质量筛选,适用于内容推荐、素材检索与数据清洗等场景。此外,通过列投影与数据演化机制,该数据集亦可用于高效训练图文生成或分类模型,降低随机访问与特征扩展的工程成本。
衍生相关工作
基于LAION-5B的原始工作,laion-1m衍生出若干围绕Lance格式与检索增强的实践方向。其中,利用预建IVF_PQ索引与组合过滤进行数据遴选的工作,推动了以向量检索为核心的数据管护流程;结合列式存储的数据演化与版本标记,则催生了面向可复现训练的版本化数据切片实践。这些工作共同拓展了大规模图文语料在高效检索、灵活演化与稳定复现方面的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务