遇见数据集

MegaStyle++-8M

收藏
arXiv2026-09-01 更新2026-09-03 收录
数据链接:
官方服务:

资源简介:

MegaStyle++-8M是一个大规模风格数据集,由腾讯、同济大学、南洋理工大学及香港科技大学联合构建,旨在通过分层式风格定义扩展图像风格空间的多样性与粒度。该数据集包含15万整体风格身份、100万细粒度风格提示及800万张风格化图像,覆盖丰富色彩、光照、纹理、媒介与笔触等属性,数据量较先前工作有显著提升。其构建过程基于层次化风格定义,利用Qwen3.5-35B-A3B1模型对200万参考图像进行自动化标注,经精确去重与语义筛选后形成。该数据集主要服务于风格迁移领域,致力于解决风格定义模糊、表征与内容纠缠的问题,为多样化风格建模提供可扩展的基准。

MegaStyle++-8M is a large-scale style dataset jointly developed by Tencent, Tongji University, Nanyang Technological University, and The Hong Kong University of Science and Technology. It is designed to expand the diversity and granularity of the image style space through hierarchical style definition. This dataset encompasses 150,000 overall style identities, 1 million fine-grained style prompts, and 8 million stylized images, covering diverse attributes such as color, lighting, texture, artistic medium, and brushstroke, with a notably larger data scale compared to prior works. Its construction is based on a hierarchical style definition framework: the Qwen3.5-35B-A3B1 model is employed to automatically annotate 2 million reference images, followed by precise deduplication and semantic filtering to generate the final dataset. Primarily serving the style transfer research community, this dataset aims to resolve the challenges of ambiguous style definition and the entanglement between style representation and content, thereby providing a scalable benchmark for diversified style modeling.

创建时间:
2026-09-01
原始信息汇总

MegaStyle数据集详情

数据集概述

MegaStyle是一个通过一致文本到图像风格映射构建的可扩展风格数据集,包含两个版本:升级版MegaStyle++-8M和原版MegaStyle-1.4M。该数据集旨在提供高内部风格一致性、多样细粒度风格的高质量风格图像,用于风格迁移和风格相似度测量等任务。

数据集版本

MegaStyle++-8M

  • 包含800万张高质量风格图像,覆盖15万个整体风格身份
  • 采用层级风格定义实现更细粒度、多样、全面的图像风格刻画。
  • 下载地址:https://huggingface.co/datasets/tencent/MegaStyle-1.4M/tree/v2.0

MegaStyle-1.4M

  • 包含140万张高质量图像,由17万个精选风格提示词40万个内容提示词构建。
  • 强调显著的内部风格一致性和多样化细粒度风格。
  • 下载地址:https://huggingface.co/datasets/tencent/MegaStyle-1.4M/tree/v1.0(Hugging Face)及 https://modelscope.cn/datasets/Tencent-Hunyuan/MegaStyle-1.4M(ModelScope)

构建方法

MegaStyle首创了一种可扩展的数据整理流程,探索利用当前大型生成模型的一致文本到图像(T2I)风格映射能力,来构建同时满足以下三个条件的风格数据集:

  • 内部风格一致性:同一风格类内的图像风格保持统一。
  • 跨风格多样性:不同风格类别之间存在显著差异。
  • 高质量:图像整体具有高品质。

发布信息

  • MegaStyle++相关论文(arXiv:2609.01423)及数据集于2026年9月2日发布。
  • MegaStyle原版论文(arXiv:2604.08364)、训练/推理代码、模型及数据集于2026年4月21日发布,并提供了Gradio演示和ComfyUI自定义节点支持。

相关模型(基于MegaStyle-1.4M训练)

  • MegaStyle-FLUX:用于通用风格迁移。
  • MegaStyle-Encoder:用于风格相似度可靠测量。

使用许可

相关资源和代码受许可证约束(除非另有指定),许可证信息见数据集主仓库。

搜集汇总
数据集介绍
MegaStyle++-8M 数据集图片
构建方式
图像风格作为高度抽象且与内容深度纠缠的视觉概念,其界定长期缺乏统一标准。MegaStyle++-8M的构建基于一种创新的层级式风格定义,该定义从整体风格身份出发,细化至色彩、光照、纹理、媒介与笔触五类可迁移的视觉属性。研究团队依托MegaStyle的注释管线,运用Qwen3.5-35B-A3B1视觉语言模型对200万参考图像进行多维度风格标注,并通过精确、模糊与语义三级去重策略优化提示词库,最终保留150万条候选提示。进一步采用mpnet编码与自底向上的三层级均衡聚类采样,筛选出100万条风格提示,其中蕴含15万个整体风格身份。每个风格提示与8个随机采样的内容提示配对,经由Qwen-Image模型生成800万幅风格化图像,由此构筑这一大规模风格数据集。
使用方法
MegaStyle++-8M可作为多模态学习与生成研究的基准资源。研究者可将其用于训练风格感知的文本到图像扩散模型,利用层级风格提示实现细粒度风格控制。数据集中每张风格图像均关联明确的风格提示与内容提示,支持风格解耦学习、风格迁移评估及风格描述生成等任务。此外,层级风格定义提供可解释的语言描述,便于构建风格检索系统或分析风格属性间的相互作用。使用时应依据任务划分训练与测试集,并利用其多样性与一致性进行跨内容风格泛化验证,或作为风格空间分析的统计基础。
背景与挑战
背景概述
MegaStyle++-8M是由同济大学、腾讯、南洋理工大学和香港科技大学的研究人员于2026年联合构建的大规模图像风格数据集,旨在系统化地探索和定义视觉风格这一高度抽象且与内容交织的概念。该数据集基于层级风格定义,将风格从整体风格身份细化至色彩、光照、纹理、媒介和笔触五类可感知的视觉属性,由此构建了包含15万个整体风格身份、1百万个细粒度风格提示和8百万张风格图像的庞大资源。其核心研究问题在于提供可迁移、可解释的风格表达,并显著拓展风格空间的多样性与语义广度,为图像风格迁移和生成领域树立了新的基准,推动了风格建模的规模化发展。
当前挑战
该数据集面临的首要挑战源于风格本质的模糊性:风格是多层级视觉属性交互形成的抽象概念,长期缺乏统一且可操作的定义。现有方法或依赖隐含的黑盒特征,或使用粗粒度且主观的自然语言描述,难以精确捕捉可迁移的风格因子。在构建过程中,团队需克服大规模自动标注的可靠性难题,设计精细的指令提示以引导视觉语言模型生成一致且明确的风格注释,并需通过多级去重实现风格提示平衡采样。此外,在保证1百万风格提示的多样性和语义丰富度的同时,还需确保生成图像具有跨语义内容的高内风格一致性,使风格建模能够忠实复现真实参考图像的精髓。
常用场景
经典使用场景
MegaStyle++-8M作为大规模图像风格数据集,其核心使用场景在于为图像风格迁移与生成提供丰富、精细的训练与评估基准。该数据集凭借150K整体风格身份与1M细粒度风格提示,使得研究者能够针对任意内容图像,精准捕捉并再现参考图像的独特视觉风格。其层级化风格定义框架涵盖色彩、光照、纹理、媒介及笔触等多维度属性,为风格表征学习、风格解耦及可控生成等任务提供了理想的数据支撑。
解决学术问题
该数据集解决了图像风格定义模糊及风格空间覆盖不足等长期困扰学术界的难题。传统风格数据集往往依赖于粗粒度标签或隐含特征,导致风格与内容纠缠不清。MegaStyle++-8M通过提出层级化、可解释的风格定义,实现了风格属性的结构化描述,显著扩展了风格空间的多样性与语义广度,为风格表征的准确量化与风格迁移的精细控制奠定了坚实基础,推动了风格理解与生成研究的规范化发展。
实际应用
在实际应用中,MegaStyle++-8M可赋能诸多创意产业与智能设计领域。例如,在数字艺术创作中,艺术家可借助该数据集驱动的人工智能工具,快速将特定画作或艺术流派的风格应用于个人作品,实现风格化滤镜与艺术效果的即时渲染。在影视后期与广告设计行业,该数据集支持高质量的风格迁移,使画面呈现一致且独特的视觉语言,从而提升内容生产效率和审美表现力。
数据集最近研究
最新研究方向
图像风格领域长期受制于风格定义模糊与表征粒度不足的困境,传统方法或依赖隐式特征导致内容耦合,或使用粗粒度语言标签难以精准刻画风格差异。MegaStyle++-8M的构建正是顺应风格理解从整体身份到细微视觉属性(色彩、光照、纹理、媒介与笔触)精细化剖析的前沿趋势,通过层级化语言指令驱动大模型规模化标注,将风格空间扩展至150K整体身份与1M细粒度描述,跳脱既有数据集的窄域局限。该数据集结合可控生成Pipeline,为可迁移、可解释的风格表征研究开辟了新范式,有望重塑风格迁移、多模态生成及创意计算等下游任务的评测基准与性能天花板。
相关研究论文
  • 1
    MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition同济大学; 腾讯; 南洋理工大学; 香港科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务