遇见数据集

MirrorPPR47M

收藏
github2026-07-01 更新2026-07-03 收录
官方服务:

资源简介:

MirrorPPR47M是一个大规模数据集,包含超过4700万修饰对,用于支持基于示例的肖像照片修饰任务。该数据集被结构化为模拟和专业子集,以实现渐进式课程学习,从而平滑优化网络。

MirrorPPR47M is a large-scale dataset comprising over 47 million editing pairs, tailored to support example-based portrait photo editing tasks. Structured into simulated and professional subsets, it enables progressive curriculum learning to facilitate smooth network optimization.

创建时间:
2026-06-27
原始信息汇总

MirrorPPR 数据集概述

基本信息

  • 数据集名称:MirrorPPR47M
  • 发布机构:上海交通大学(SJTU)DENG-Lab
  • 数据集规模:超过 4700 万对经过修图处理的图像对

数据集构成

数据集被划分为两个子集:

  • 模拟子集(Simulated subset):用于渐进式课程学习的基础训练
  • 专业子集(Professional subset):用于进一步提升模型性能的高级训练

任务定义

MirrorPPR 数据集支持基于样本的人像照片修图任务,即:给定一对修图样本(原图与修图后的结果),模型需要推断并对其中的修图操作进行提取,然后将其应用到新的查询图像上。该任务聚焦于结构化的肖像修图,涉及面部特征和身体比例的细微局部调整。

数据特点

  • 每对数据包含严格对齐的修图操作(通过先进的数据自增强范式保证跨身份训练对的操作一致性)
  • 专注于精细、局部的结构性人像修图,而非剧烈的视觉变换
  • 为缓解数据稀缺问题而专门构建的大规模数据集

相关资源

  • 论文:https://arxiv.org/abs/2606.29308
  • 项目页面:https://sjtu-deng-lab.github.io/MirrorPPR
  • 模型与代码:即将发布
搜集汇总
数据集介绍
MirrorPPR47M 数据集图片
构建方式
面对肖像修图领域数据稀缺的挑战,MirrorPPR47M数据集通过一种创新的数据自增强范式构建而成,确保了修图操作的高度对齐。该数据集包含超过4700万组修图配对样本,并精心划分为模拟子集与专业子集,前者为合成数据,用于基础学习,后者由专业修图师标注,保留真实世界的修图细节,以此支持渐进式课程学习,引导模型从简单操作平滑过渡到复杂精修。
特点
MirrorPPR47M的独特之处在于其庞大规模与双重结构设计。它不仅是目前最大的肖像修图配对数据集,更通过模拟与专业子集的有机结合,涵盖从明显变换到极其细微的结构修图操作,如面部特征微调与身体比例修改。这种设计使模型能够捕获并迁移精细的编辑操作,同时显著超越现有基准方法,在修图质量与身份保留方面均展现出卓越性能。
使用方法
研究者可通过GitHub页面访问并下载MirrorPPR47M数据集,将其整合到基于扩散变换器的肖像修图模型中。使用时应首先利用模拟子集进行基础训练,再引入专业子集进行微调,以实现渐进式优化。数据集支持范例驱动的修图任务:给定一对范例图像,模型能从中提取修图操作并应用到新的查询图像上,配合原代码中的连接器与LoRA模块,即可轻松复现论文中的先进成果。
背景与挑战
背景概述
MirrorPPR47M数据集由上海交通大学邓实验室于近期创建,旨在解决肖像照片精细结构修图领域一个尚未被充分探索的研究问题——基于范例的修图操作迁移。与传统的文本引导修图不同,后者难以精确描述面部特征和身体比例的细微变化,该数据集以成对的修图前后图像为范例,要求模型从范例中提取隐式的修图操作并应用于新的查询图像。这一任务的提出填补了现有范例编辑方法在处理结构性修改(如脸型微调、五官比例优化)时的空白,其影响力在于推动了图像编辑从粗粒度变换向高保真、局部精细化修图的演进,为生成式模型在专业人像后期处理领域的应用奠定了数据基础。
当前挑战
该数据集所解决的领域挑战在于:结构性人像修图涉及极为微妙且局部化的操作,现有范例编辑方法难以从范例对中准确捕捉并转移这种精细的修图差异,而文本描述又无法表达像素级的操作意图。在构建过程中,最大的挑战来自跨身份训练对的配对对齐难题——由于不同人脸的几何结构差异,直接生成的修图操作存在错位,为此研究者提出数据自增强范式以生成严格对齐的修图对。此外,如此大规模的数据标注与质量控制也是一大难题,数据集通过模拟与专业两个子集的分层结构(分别包含自动化生成和人工精修的数据),在解决数据稀缺的同时支持渐进式课程学习,以缓解网络优化过程中的收敛困难。
常用场景
经典使用场景
在人像美学编辑领域,基于文本引导的图像编辑虽已取得显著突破,却难以精确刻画面部特征与身体比例中那些极其细腻的变动。MirrorPPR47M数据集专为范例驱动的人像修图任务而生,其核心场景要求模型从给定的修图范例对中精准提取并迁移微妙的结构性调整操作,从而实现跨身份的修图变换。该数据集包含超过4700万张严格对齐的修图配对图像,通过模拟与专业两个子集的分层设计,支持渐进式课程学习策略,以平滑优化网络性能,为结构级人像精修提供大规模、高一致性的训练基础。
衍生相关工作
基于MirrorPPR47M数据集的发布,一系列开创性工作应运而生。研究者们围绕范例驱动的修图操作解耦与迁移展开深入探索,衍生出基于Retouching Operation Extractor的精细差异捕捉机制,以及结合低秩适配与连接器的预训练扩散模型注入方案。这些工作不仅验证了大规模对齐数据对结构修图任务的有效性,还启发了将类似范例范式拓展至全身姿态美化、换脸等更复杂视觉变换的研究方向。此外,该数据集所倡导的渐进式课程学习框架,也为后续跨模态、跨域图像编辑任务提供了可复用的训练策略与评价基线。
数据集最近研究
最新研究方向
基于示例的人像结构修图领域,MirrorPPR47M数据集通过提供超4700万对严格对齐的修图配对样本,推动了从文本引导编辑向示例驱动微调修图的范式转变。该数据集包含模拟与专业子集,支持渐进式课程学习,显著提升了面部特征与身体比例的局部精细调整能力,解决了跨身份操作对齐的长期难题,为人像美学编辑和个性化图像生成提供了大规模标准化训练基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务