遇见数据集

laion-highres-aesthetic-recap-qwen3p5-35b-a3b

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集为 LAION Highres Aesthetic 图像集的重新标注版本,使用 Qwen3.5-35B-A3B 模型为每个图像实例生成高质量英文描述。数据集包含 96,071,504 条生成标题,对应 82,690,560 个图像实例,并额外提供 13,380,944 个不同的标题变体。数据通过 image_shard 和 image_member 字段与原始图像仓库(BootsofLagrangian/laion-highres-aesthetic-webp90-noresize)进行关联。标题生成采用单阶段长描述策略,输出限制为 512 个 token,未进行任何语义后处理。该数据集仅供研究及审计可复现性使用,不适用于直接训练模型;使用前必须进行语义后处理、安全与政策过滤、URL/内容身份验证以及图像版权审查。许可证 CC BY 4.0 仅覆盖生成的标题文本,原始图像及第三方元数据不受此许可保护。

This dataset is a re-annotated version of the LAION Highres Aesthetic image set, using the Qwen3.5-35B-A3B model to generate high-quality English descriptions for each image instance. The dataset contains 96,071,504 generated captions, corresponding to 82,690,560 image instances, with an additional 13,380,944 distinct caption variants. Data is linked to the original image repository (BootsofLagrangian/laion-highres-aesthetic-webp90-noresize) via the image_shard and image_member fields. Caption generation adopts a single-stage long description strategy with an output limit of 512 tokens, without any semantic post-processing. This dataset is intended solely for research and reproducibility auditing, not for direct model training; users must perform semantic post-processing, safety and policy filtering, URL/content verification, and image copyright review before use. The CC BY 4.0 license only covers the generated caption text; original images and third-party metadata are not protected by this license.

创建时间:
2026-08-12
原始信息汇总

数据集概述:LAION Highres Aesthetic recaptions with Qwen3.5-35B-A3B

  • 数据集名称:LAION Highres Aesthetic recaptions with Qwen3.5-35B-A3B
  • 许可证:CC BY 4.0(仅适用于生成的描述文本,不涉及源图像或第三方元数据)
  • 数据格式:Parquet 文件,官方仅提供 train 分割
  • 数据规模:包含 96,071,504 行,由 82,690,560 个图像实例 生成,另外还有 13,380,944 个额外的不同描述变体
  • 数据内容:仅包含生成的标题(caption_text),不包含图像载荷;同时保留源提供的元数据作为 source_caption 字段
  • 关联方式:通过 image_shardimage_member 字段与 laion-highres-aesthetic-webp90-noresize 数据集关联;同时提供 URL 和内容哈希用于独立校验

数据组成与特性

  • 图像实例与 URL 身份
    • 图像发布部分包含 124,416,249 个不同的物化图像实例,对应于 121,348,952 个稳定的 URL 身份
    • 其中有 3,067,297 个额外实例 共享一个 URL 身份
  • 标题绑定规则
    • 如果标题的记录定位器(WebDataset locator)与图像发布匹配,则绑定到精确的图像实例
    • 否则,URL 键控的标题会确定性地回退到字典序最小的源键
    • 已发布的标题行中:96,071,504 行 为精确定位绑定,0 行 为确定性 URL 回退
    • 应用该规则后,有 41,725,689 个图像实例 没有直接对应的标题行(可能包含共享 URL 的额外实例或未发布标题的稳定 URL)
  • 重要提醒:图像到标题的内连接不能视为完整的图像覆盖

生成方法与使用说明

  • 生成模型:Qwen/Qwen3.5-35B-A3B-FP8

  • 生成参数:采用单阶段长标题提示,输出限制为 512 token,使用 Qwen3.5 发布默认采样设置,自由格式输出,基于 vLLM 0.17.1 服务;禁用思考模式;输出仅进行空白字符清理,无语义后处理

  • 复现配置:提供 generation_config.yaml 文件包含系统提示、用户提示、图像预处理和超参数详情

  • 加载示例(仅加载标题): python from datasets import load_dataset

    captions = load_dataset( "BootsofLagrangian/laion-highres-aesthetic-recap-qwen3p5-35b-a3b", split="train", streaming=True, ) row = next(iter(captions)) print(row["image_shard"], row["image_member"], row["caption_text"])

适用领域与限制

  • 适用场景:研究和审计的可复现性(如用于匹配预算的重新标注图像-文本监督分布审计)
  • 使用限制
    • 该数据集不完全适用于训练,用户必须进行语义后处理、安全与政策过滤、URL/内容身份验证,以及图像权限审查
    • 一个图像实例可能对应多条标题行

引用信息

bibtex @misc{oh2026matchedbudget, title={A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions}, author={Giyeong Oh and Junghun Park and Yuhan Bae and Youngjae Yu}, year={2026} }

搜集汇总
数据集介绍
laion-highres-aesthetic-recap-qwen3p5-35b-a3b 数据集图片
构建方式
该数据集源自LAION高分辨率美学图像集合,通过先进的Qwen3.5-35B-A3B模型对图像进行重新描述,生成高质量的图文对数据。构建过程严格遵循源数据集的结构,利用图像分片标识符和成员标识符建立与原始图像仓库的精确对应关系,确保每条生成的描述文本都能准确溯源至特定的图像实例。同时,保留了源图像提供的原始描述字段作为独立元数据,与生成的新描述形成对照,为后续的语义分析和质量评估提供了双重基础。
使用方法
数据集设计为直接通过HuggingFace的datasets库以流式模式加载,用户可便捷地获取描述文本及其关联的定位字段。使用时需将描述与图像仓库通过分片和成员标识符进行连接,或利用URL和内容哈希进行独立验证。该数据集主要用于研究目的,支持大规模图文数据分布的审计研究、重新描述方法的评估以及多模态模型的对比实验。在用于训练前,用户必须自行进行语义后处理、安全过滤和版权审查,以确保符合伦理和法律要求。
背景与挑战
背景概述
大规模多模态数据集的构建与质量评估是推动视觉-语言模型发展的关键环节。由Giyeong Oh、Junghun Park、Yuhan Bae和Youngjae Yu等研究人员于2026年提出的laion-highres-aesthetic-recap-qwen3p5-35b-a3b数据集,旨在通过先进的Qwen3.5-35B-A3B模型对LAION高分辨率美学图像进行重新描述,以解决原始数据集中文本描述质量参差不齐、语义信息不充分等问题。该数据集包含超过9600万条生成的描述,覆盖约8270万个图像实例,为图像-文本监督分布的审计与优化提供了重要资源。其核心研究问题聚焦于如何利用大语言模型提升图像描述的质量和多样性,从而改善多模态模型的训练效果。该工作对数据清洗、描述生成及多模态学习领域具有显著影响力,为后续研究提供了可复现的基准和方法论。
当前挑战
在领域问题层面,原始LAION数据集存在描述噪声、语义偏差和覆盖不全等挑战,直接使用可能导致多模态模型学习到错误关联或泛化能力下降。该数据集通过生成高质量描述,旨在缓解这些难题,但其构建过程中也面临多重挑战:首先,对超过1.2亿图像实例进行高效且一致的重新描述需要巨大的计算资源,并需保证生成质量的一致性;其次,描述绑定到具体图像实例的规则复杂,涉及URL和内容哈希的匹配,容易出现歧义或遗漏;此外,数据集仅包含文本描述,不提供图像内容,用户需自行进行语义后处理、安全过滤和版权审查,这增加了实际应用的难度和合规风险;最后,如何确保生成描述不引入新的偏见或错误,也是构建过程中需要克服的关键挑战。
常用场景
经典使用场景
在视觉-语言预训练领域,大规模图文数据对的质量与语义丰富度直接决定了模型的表征能力与下游泛化性能。该数据集为LAION高分辨率美学筛选子集提供了由Qwen3.5-35B-A3B模型重新生成的约9600万条高质量描述,作为纯文本标注资源,其经典使用场景是替换或增强原始URL抓取的弱监督文本,用于训练图像-文本匹配模型、视觉编码器及多模态对话系统。研究者可依据image_shard与image_member字段与对应的图像仓库进行精确联接,获得语义对齐、细节翔实的图文对,从而有效缓解原始文本噪声大、信息量不足的问题,为细粒度视觉理解、跨模态检索和图文生成等任务奠定坚实的数据基础。
解决学术问题
该数据集直面大规模网络图像-文本语料中普遍存在的文本-图像关联松散、描述粒度粗糙及语义偏差显著的学术困境。通过采用先进的多模态大语言模型进行系统性重述,它提供了语义更连贯、内容更贴合图像细节的长描述,极大地提升了图文监督信号的质量与信息密度。这为解决弱监督学习下的模态对齐不充分、视觉-语言预训练效率低下以及模型对复杂场景理解能力不足等关键问题提供了可靠的研究基石。其发布促进了图像描述质量评估、噪声标签鲁棒性训练及数据分布偏移分析等方向的探索,对构建更具鲁棒性和可解释性的多模态智能系统具有深远意义。
实际应用
在实际应用中,该数据集的纯文本特性与灵活联接机制赋予其广泛适用性。技术团队可利用其高质描述微调视觉问答、图像生成及多模态检索系统,显著提升产品对用户复杂查询的理解与响应精确度。通过URL与内容哈希的独立校验,企业可便捷地与自身图像库整合,用于内容审核、智能相册管理、无障碍辅助描述生成等场景。此外,该数据集为审计与合规流程提供了高质量语义基准,支持版权归属判定与数据来源追踪。在学术与工业界联合推进的可复现研究框架下,它作为核心数据组件,正持续助力开发更安全、更可控、语义更丰富的多模态应用系统。
数据集最近研究
最新研究方向
该数据集聚焦于大规模图像-文本监督分布的重新标注与审计,采用Qwen3.5-35B-A3B模型生成高分辨率美学图像的高质量描述,旨在提升多模态模型训练数据的语义对齐与可控性。其最新研究方向包括:基于匹配预算的审计框架构建,以系统评估重标注对模型性能的影响;探索开放域长描述生成对跨模态检索和生成任务的下游效果;以及通过对比源元数据与生成描述,揭示数据分布偏差和潜在偏见,推动负责任的数据治理与可复现性研究。该数据集为构建更健壮、更公平的视觉-语言预训练语料库提供了基础资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务