遇见数据集

commoncatalog-cc-by-recap-qwen3p5-35b-a3b

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集是 CommonCatalog CC-BY 数据集的重新描述版本,由 Qwen3.5-35B-A3B 模型生成。它包含 14,576,560 条生成的描述文本,对应 14,576,558 个图像资产,不包含图像数据。数据集中的每一行通过 Flickr 的 photoid(表示为 asset_instance_id)以及源 Parquet 文件的行定位器(image_shard 和 image_member)与上游的 common-canvas/commoncatalog-cc-by 数据集对齐。除了本数据集新生成的 caption_text 字段外,还保留了上游数据集中的原始字段:caption、description、title、usertags、machinetags 以及 blip2_caption。这些上游字段不属于本数据集的输出,本数据集也未对其进行修改。描述生成采用 Qwen3.5-35B-A3B-FP8 模型,单阶段长描述,输出限制 512 token,使用 Qwen3.5 发布时的默认采样参数,并通过 vLLM 0.17.1 提供服务。禁用思考模式,输出仅进行空白字符清理,未进行语义后处理。该数据集仅供研究和审计可重复性使用,不适合直接用于训练:用户在使用前必须进行语义后处理、安全与策略过滤、URL/内容身份验证以及图像权利审查。CC BY 4.0 许可证仅适用于本数据集中生成的描述文本,不适用于源图像或第三方元数据。

This dataset is a re-captioning version of the CommonCatalog CC-BY dataset, generated by the Qwen3.5-35B-A3B model. It contains 14,576,560 generated caption texts corresponding to 14,576,558 image assets, without including image data. Each row is aligned to the upstream common-canvas/commoncatalog-cc-by dataset via Flickrs photoid (denoted as asset_instance_id) and row locators (image_shard and image_member) from the source Parquet file. In addition to the newly generated caption_text field, it retains upstream original fields: caption, description, title, usertags, machinetags, and blip2_caption. These upstream fields are not part of this datasets output and have not been modified. The description generation uses the Qwen3.5-35B-A3B-FP8 model with single-stage long descriptions, output limit of 512 tokens, default sampling parameters from Qwen3.5 release, served via vLLM 0.17.1. Thinking mode is disabled, output is only whitespace-cleaned without semantic post-processing. This dataset is intended for research and reproducibility auditing only, not suitable for direct training: users must perform semantic post-processing, safety and policy filtering, URL/content authentication, and image rights review before use. The CC BY 4.0 license applies only to the generated description texts in this dataset, not to source images or third-party metadata.

创建时间:
2026-08-11
原始信息汇总

数据集概述

数据集名称:CommonCatalog CC-BY recaptions with Qwen3.5-35B-A3B

数据集地址:https://huggingface.co/datasets/BootsofLagrangian/commoncatalog-cc-by-recap-qwen3p5-35b-a3b


数据集内容

  • 规模:包含 14,576,560 条生成的标题(captions),对应 14,576,558 个图像资源。
  • 数据格式:仅包含标题文本(caption-only),不包含图像文件。每个条目包括:
    • asset_instance_id(来源于Flickr photoid
    • image_shardimage_member(源Parquet文件定位器)
    • caption_text(由Qwen3.5模型生成的标题)
    • URL和内容哈希值,用于独立核对。
  • 来源:与公开的 common-canvas/commoncatalog-cc-by 数据集在修订版本 80f50fe4a1ca937f37a11be3f8eee5199d776ff3 下匹配。

生成方法

  • 模型Qwen/Qwen3.5-35B-A3B-FP8
  • 生成设置
    • 单阶段长标题生成
    • 输出限制为512个token
    • 使用Qwen3.5发布时的采样默认值
    • 自由格式输出
    • 推理服务:vLLM 0.17.1
    • 禁用思考模式(thinking disabled)
    • 仅去除空格,无语义后处理
  • 配置文件:见 generation_config.yaml

使用说明

  • 加载方式:可通过 load_dataset 流式加载标题数据,或从源数据集加载配对的图像数据(示例代码见README)。
  • 注意:源数据集的文本字段(如 captiondescriptiontitleusertagsmachinetagsblip2_caption)属于上游数据集,非本仓库生成内容。
  • 发布目的:用于研究和审计复现。不适用于直接训练,用户需自行进行语义后处理、安全与政策过滤、URL/内容身份验证以及图像权利审查。

许可与引用

  • 许可协议CC BY 4.0,仅适用于本仓库生成的标题文本,不涵盖源图像或第三方元数据。

  • 引用文献

    @misc{oh2026matchedbudget, title={A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions}, author={Giyeong Oh and Junghun Park and Yuhan Bae and Youngjae Yu}, year={2026} }

搜集汇总
数据集介绍
commoncatalog-cc-by-recap-qwen3p5-35b-a3b 数据集图片
构建方式
该数据集是CommonCatalog CC-BY子集的再标注版本,由Qwen3.5-35B-A3B模型在vLLM 0.17.1服务下生成,采用单次长描述生成策略,输出token上限为512,使用Qwen3.5发布时的采样默认值,禁用思考模式,仅进行空白字符清洗,未施加任何语义后处理。数据集包含14,576,560条生成的描述,对应14,576,558个图像资产,并额外提供两种不同的描述变体。每行通过asset_instance_id(即Flickr的photoid)与源图像数据集‘common-canvas/commoncatalog-cc-by’的固定版本进行对齐,同时保留源Parquet文件名和行定位符(image_shard和image_member),以及URL和内容哈希,便于独立验证与数据对账。
特点
该数据集为纯文本描述集合,不含图像载荷,专注于高质量的重新描述。其显著特点在于生成过程完全透明,附有完整的生成配置(generation_config.yaml),包括系统提示、用户提示及超参数,确保可复现性。此外,数据集保留了上游文本字段(如原始caption、description、title等)和BLIP2描述,但明确区分了原始内容与新建的caption_text,不声称替代或修正上游文本。数据集遵循CC BY 4.0许可,仅覆盖生成的描述文本,不涵盖源图像或第三方元数据,适合用于研究、审计以及图像-文本分布匹配的评估。
使用方法
用户可通过HuggingFace的datasets库以流式模式加载该数据集,使用load_dataset函数指定仓库名称和split='train',即可高效访问描述数据。为了获取对应的源图像,需同时加载固定的源数据集‘common-canvas/commoncatalog-cc-by’的特定版本(revision='80f50fe4a1ca937f37a11be3f8eee5199d776ff3'),通过匹配image_shard和image_member字段实现行级对应。需注意,加载时不应假设未固定的main分支具有相同的行结构,务必使用指定的修订版本。该数据集明确声明不适用于直接训练,使用前需进行语义后处理、安全与政策过滤、URL/内容身份验证及图像权利审查,确保合规性。
背景与挑战
背景概述
该数据集由Giyeong Oh、Junghun Park、Yuhan Bae和Youngjae Yu等研究者创建,隶属于一项针对图像-文本监督分布重述(recaptioning)的审计框架研究,旨在为大规模多模态模型训练数据质量评估提供基准。数据集基于CommonCatalog CC-BY图像集合,利用Qwen3.5-35B-A3B模型对约1457万张图像生成描述性文本,形成纯文本标注仓库。研究核心问题在于系统性地重新生成图像标题,以优化视觉-语言预训练数据的语义对齐,同时保持与原始数据源的可追溯性。该数据集在2026年发布,为多模态学习社区提供了一种可复现的、预算匹配的标题生成与审计方法,对推动大规模数据集的透明性、公平性和可验证性具有重要意义。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程双重维度。在领域层面,图像-文本数据分布常存在语义偏差、噪声和冗余,传统标题生成模型难以平衡信息密度与语言多样性,而本数据集需解决长尾概念覆盖不足及跨模态对齐弱化的问题。构建过程中,挑战包括:处理1457万级别数据的高效生成与存储,确保生成标题的多样性与一致性;严格匹配上游图像数据的行定位,避免因版本漂移导致的数据错位;遵守版权与隐私政策,需在生成文本与原始元数据(如标题、描述、用户标签)之间划清界限;此外,生成过程未涉及语义后处理,可能导致标题包含偏见或不当内容,要求后续使用需进行安全过滤和权利审查,这增加了数据集作为训练资源的准入门槛。
常用场景
经典使用场景
该数据集作为图像-文本配对监督分布的再描述(recaption)资源,广泛应用于多模态预训练、跨模态检索与生成任务。研究者可将其与原始图像数据集(如common-canvas/commoncatalog-cc-by)结合,利用高质量的Qwen3.5生成描述进行对比实验,以探究不同描述策略对视觉语言模型性能的影响。其流式加载接口便于快速迭代,适用于大规模弱监督学习中的描述质量评估与消融研究。
实际应用
在实际应用中,该数据集可用于构建更精准的图像搜索引擎、辅助视觉问答系统训练,以及提升文本到图像生成模型的语义对齐度。对于企业级多模态应用,开发人员可利用其生成描述优化商品推荐、内容审核等场景中的视觉特征表示。此外,其CC BY 4.0许可便于商业集成,但需遵循安全过滤与版权审查流程,确保合规部署。
衍生相关工作
该数据集衍生了基于匹配预算审计框架的经典工作,如Oh等人提出的《A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions》。该工作利用此数据集系统评估了不同再描述方法在固定计算预算下的效果,为后续研究树立了方法论标杆。此外,其生成流程可复现的特性也催生了关于大规模描述自动生成、描述多样性控制及语义保真度度量的后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务