遇见数据集

qwen-deepfashion-fused

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

qwen-deepfashion-fused是一个合成数据集,专注于结构化标题和融合场景生成。它基于AbstractPhil/qwen-deepfashion数据集的SFW(适合工作场所)行,通过qwen-test-runner的12进程融合提取系统处理得到。处理流程包括严格的年龄门控、使用Qwen3.5-9B模型进行3次标题结构化、生成12个确定性视觉任务JSON、构建FusedScene(包含具有掩码包含分层属性的实体、连续偏移的关系、计数和共享基础),以及生成确定性融合提示。数据集规模为122139个保留行,年龄门控拒绝38076行,以parquet格式存储,分片严格小于350MB,并包含_manifests/目录记录处理状态。适用于结构化标题生成、多模态学习、视觉任务和场景理解等任务。提取模型使用Apache-2.0/MIT许可证,输出可再分发。

qwen-deepfashion-fused is a synthetic dataset focused on structured captions and fused scene generation. It is based on the SFW (Safe for Work) rows of the AbstractPhil/qwen-deepfashion dataset, processed through a 12-process fusion extraction system from qwen-test-runner. The processing pipeline includes strict age gating, 3 rounds of caption structuring using the Qwen3.5-9B model with slot registry mode, generation of 12 deterministic visual task JSONs, construction of FusedScene (fused_json) containing entities with mask-inclusive hierarchical attributes, relationships with continuous offsets, counts, and shared bases, and finally generation of deterministic fusion prompts. The dataset scale is 122139 retained rows, with 38076 rows rejected by age gating. It is stored in parquet format with shards strictly smaller than 350MB, and includes an _manifests/ directory recording the processing status of each source shard (rows input/retained/rejected and timing). It is suitable for tasks such as structured caption generation, multimodal learning, visual tasks, and scene understanding. The extraction model uses Apache-2.0/MIT license, and the output is redistributable.

创建时间:
2026-07-11
原始信息汇总

数据集概述

  • 数据集名称:qwen-deepfashion-fused
  • 许可证:Apache-2.0
  • 标签:synthetic, structured-captions, fused-scene, json-schema

数据来源与处理流程

该数据集基于 AbstractPhil/qwen-deepfashion 数据集中所有 SFW(Safe for Work)行,经过 qwen-test-runner 12 进程融合提取系统处理,具体流程如下:

  1. 年龄门控(严格模式):过滤掉不安全内容。
  2. 3× 标题结构化:使用 Qwen3.5-9B 模型,基于 slot-registry 模式进行三次标题结构化处理。
  3. 12 个确定性视觉任务 JSON:生成 tasks_json
  4. FusedScene 融合:生成 fused_json,包含实体(具有掩码包含、归属、分层属性)、关系(连续偏移量、计数、共享流域)等。
  5. 确定性融合提示:生成 prompt_fused

数据集规模

  • 保留行数:122,139 行
  • 年龄门控拒绝行数:38,076 行

数据格式

  • 配置名称:default
  • 数据文件:训练集位于 data/*.parquet
  • 分片限制:每个分片严格低于 350MB
  • 元数据_manifests/ 目录包含每个源分片的完成标记(行数入/保留/拒绝 + 耗时)

模型与许可

  • 所有提取模型均采用 Apache-2.0 或 MIT 许可证,输出结果可再分发。
  • 方法论详见 qwen-test-runner 仓库中的 docs/VISION_PIPELINE.md
搜集汇总
数据集介绍
qwen-deepfashion-fused 数据集图片
构建方式
该数据集基于`AbstractPhil/qwen-deepfashion`中的安全内容行构建,经过一套名为“12过程融合提取系统”的多阶段流水线处理。流程起始于严格年龄门控过滤,随后使用Qwen3.5-9B模型通过插槽注册架构执行三次字幕结构化处理,生成符合预定义JSON schema的语义化描述。继而,系统自动拆解出12项确定性视觉任务JSON数据,最终汇聚为FusedScene融合场景结构,其中包含具有掩码包含关系与分层属性的实体、拥有连续偏移量与计数特征的关联关系,以及共享的语义流域。整个处理过程均基于Apache-2.0或MIT许可的开源模型完成,确保产出的可再分发性。
特点
qwen-deepfashion-fused数据集最显著的特点在于其高度结构化的融合场景表示。每个样本不仅包含经过三次验证的字幕结构化输出,还集成了12项确定性视觉任务的JSON数据,为对象检测、关系推理等任务提供了丰富的训练信号。数据集引入了FusedScene概念,通过掩码包含关系、分层属性、连续偏移量和共享流域等机制,将实体与关系组织成具有空间语义关联的统一图结构。此外,数据集严格控制分片大小不超过350MB,并附带详细的处理清单,记录每源分片的通过、保留与拒绝统计,确保数据质量与可追溯性。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,指定配置名为`default`并读取Parquet格式的数据文件。数据集提供`prompt_fused`字段,内含确定性生成的融合提示,可直接用于视觉语言模型的微调。`fused_json`字段提供了FusedScene的完整结构数据,便于研究者解析实体掩码、分层属性和关系偏移,用于开展细粒度视觉理解、场景图生成或多模态对话等任务。由于所有输出均为结构化JSON,用户可以灵活地将其转换为自定义训练格式,或结合`tasks_json`字段中的12个视觉任务数据,构建多任务学习框架。
背景与挑战
背景概述
qwen-deepfashion-fused数据集诞生于多模态大模型与精细视觉理解蓬勃发展的阶段,由研究者基于AbstractPhil/qwen-deepfashion原始数据构建而成。该数据集旨在解决合成场景中结构化描述生成与复杂关系建模的核心研究问题,通过引入12项确定性视觉任务与FusedScene融合场景框架,将非结构化图像转化为包含实体、属性、关系及空间拓扑的规范化JSON描述。其发布推动了视觉语言模型在细粒度场景理解与可控生成领域的发展,特别是在开源生态下对Apache-2.0协议的支持,降低了研究者获取高质量结构化训练数据的门槛。
当前挑战
该数据集所应对的领域挑战在于,现有视觉语言模型普遍缺乏对图像中多实体间复杂关系(如掩膜包含与被包含、空间偏移与共享区域)的结构化建模能力,导致生成的描述在逻辑一致性与细节精度上存在显著不足。构建过程中面临的核心挑战包括:需对约16万行原始数据进行严格的年龄门控过滤以剔除不合规内容,同时设计并协调3阶段描述结构化流程与12任务并行推理系统,确保不同模型(如Qwen3.5-9B)输出的一致性与可重复性;此外,数据分片需严格控制在350MB以内,以兼顾存储效率与下游加载的稳定性。
常用场景
经典使用场景
qwen-deepfashion-fused数据集在视觉与语言交叉领域扮演着关键角色,其经典使用场景聚焦于多模态理解与生成任务的深度融合。该数据集通过对原始的DeepFashion图像进行结构化标注,将每幅图像转化为包含实体、属性、空间关系以及数值信息的结构化场景表示,从而为细粒度的时尚图像解析提供了高质量的监督信号。研究者常利用该数据集训练端到端的视觉定位、属性识别以及场景图生成模型,特别是在需要对服装类别、颜色、纹理及其空间布局进行精确建模的任务中,该数据集的融合场景标注显著提升了模型的泛化能力与推理精度。
衍生相关工作
该数据集的发布催生了一系列具有代表性的研究工作,在视觉结构化表征与多模态融合领域树立了新的标杆。基于其融合场景标注体系,研究者发展出面向复杂场景的视觉关系抽取与掩膜感知注意力机制,显著提升了细粒度属性定位的鲁棒性。同时,该数据集所依托的qwen-test-runner处理框架及其文档中描述的视觉流水线架构,启发了后续工作将大型语言模型与结构化模式相结合,进行高保真度数据增强与自动标注。围绕该数据集的典型成果还包括面向零样本学习与跨模态检索的场景图生成方法,这些工作共同推动了时尚理解任务从粗粒度分类向精细化结构化推理的演进。
数据集最近研究
最新研究方向
当前,基于合成数据与结构化标注的视觉语言模型训练成为前沿热点。qwen-deepfashion-fused 数据集通过多阶段融合提取系统,将原始SFW图像转化为包含掩码、实体关系与空间偏移的富结构化场景描述,显著提升了细粒度视觉推理任务的标注密度与一致性。其采用的年龄门控、三阶段字幕结构化与12项确定性视觉任务JSON生成流程,代表了从粗粒度图文匹配向空间感知、属性分层、关系抽取等复合能力对齐的演进趋势,为可控图像生成、指代表达理解与场景图预测等研究提供了高质训练基准,推动了多模态模型在复杂视觉理解中的能力边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务