遇见数据集

CaptureGuide-Dataset

收藏
arXiv2026-06-24 更新2026-06-26 收录
官方服务:

资源简介:

CaptureGuide-Dataset是由复旦大学与StepFun联合构建的大规模摄影指导数据集,旨在支持实时拍摄过程中的构图决策与姿态推荐研究。该数据集共包含约13万样本,涵盖摄影师侧的10万构图指导样本和主体侧的3万姿态指导样本,数据源自在线平台图像,并经过专家标注与多模态大语言模型验证的自我蒸馏流程处理。数据集通过结构化标注流程构建,包括专家标注的种子集、MLLM验证的伪标签扩展以及人机协同的理性生成,确保了数据的高质量与一致性。该数据集主要应用于摄影美学、多模态人工智能及人机交互领域,旨在解决现有裁剪基准忽略实时拍摄引导与主体姿态建议的局限,为开发能够提供交互式拍摄辅助的智能模型提供数据支撑。

CaptureGuide-Dataset is a large-scale photography guidance dataset jointly constructed by Fudan University and StepFun, aiming to support research on composition decision-making and pose recommendation during real-time shooting. This dataset contains approximately 130,000 samples in total, including 100,000 composition guidance samples from the photographer's perspective and 30,000 pose guidance samples from the subject's perspective. The data is sourced from images on online platforms, and processed via expert annotation and a self-distillation workflow validated by multi-modal large language models (MLLMs). The dataset is built through a structured annotation pipeline, which consists of an expert-annotated seed set, pseudo-label expansion verified by MLLMs, and human-machine collaborative rational generation, ensuring high data quality and consistency. This dataset is mainly applied in the fields of photographic aesthetics, multimodal artificial intelligence, and human-computer interaction. It aims to address the limitation that existing cropping benchmarks ignore real-time shooting guidance and subject pose suggestions, providing data support for developing intelligent models capable of delivering interactive shooting assistance.

提供机构:
复旦大学; StepFun
创建时间:
2026-06-24
搜集汇总
数据集介绍
CaptureGuide-Dataset 数据集图片
构建方式
CaptureGuide-Dataset的构建分为摄影师侧与主体侧两大板块。摄影师侧数据依托专家播种、MLLM验证的自蒸馏管道,先从12K专家标注种子集出发,经过三轮迭代生成100K样本,并利用Gemini-3.0-Pro对伪标签进行合理性校验。主体侧数据通过移除肖像中的人物获得无人场景图,再从中提取COCO-17格式的关键点及其可见性状态,结合专家审核与修正的文本理由,最终形成30K样本。
特点
该数据集涵盖约130K样本,同时支持摄影师侧的构图决策(保留、优化、拒绝)与主体侧的场景化姿态推荐,弥补了现有基准仅聚焦裁剪预测的不足。文本理由与结构化视觉标注并存,并提供六种常见宽高比与五类摄影场景的均衡分布,确保数据的多样性与实用性。经专家验证与强化微调,数据质量得到有效保障。
使用方法
该数据集适用于微调多模态大语言模型以提供实时摄影指导。用户在拍摄时可输入场景图像,模型输出JSON格式的响应:摄影师侧包含任务类型、原因与归一化裁剪框坐标;主体侧包含关键点坐标与可见性向量。推荐在监督微调后结合GRPO强化学习进一步优化决策能力,并通过MLLM评估物理合理性、场景交互与姿态美学三个维度进行效果验证。
背景与挑战
背景概述
在真实摄影场景中,拍摄者往往需要在按下快门的瞬间对构图进行判断与调整,同时被摄对象也期望获得与场景相契合的姿态建议。然而,现有的美学裁剪基准大多聚焦于事后裁剪预测,忽略了拍摄过程本身对摄影引导的需求。为此,复旦大学与StepFun研究团队于近期提出了CaptureGuide-Dataset,一个面向拍摄时摄影引导的大规模数据集。该数据集包含约13万样本,覆盖摄影师侧的构图决策(保留、优化、拒绝三选方案)与被摄对象侧的场景条件化姿态推荐两大互补任务。通过专家标注种子集与多模态大语言模型验证的自蒸馏流水线,该数据集成为了评估和训练多模态大语言模型在拍摄时刻提供交互式引导能力的关键资源,显著推动了该领域的研究进展。
当前挑战
构建CaptureGuide-Dataset面临多重挑战。首先,在领域问题层面,现有方法难以统一处理拍摄时引导的双向需求:通用多模态大语言模型虽能做出构图决策,却缺乏精准的优化定位能力;专门的美学裁剪模型虽能定位裁剪区域,但无法处理“保留”或“拒绝”的判断,更不支持结构化的被摄对象姿态引导。其次,在数据集构建过程中,摄影师侧引导需要专家对大量图片进行三类决策标注及优化框绘制,成本高昂且主观性强;被摄对象侧引导则需将人像转换为无人物景,并获取专家验证的17个关键点坐标、可见性状态及解释性文本,涉及人体移除、姿态估计与文本生成等多个易错环节。此外,如何通过多模态大语言模型验证的自蒸馏流水线在确保数据质量的同时实现规模化扩展,亦是该研究面临的重要技术挑战。
常用场景
经典使用场景
在摄影艺术与计算机视觉的交叉领域中,CaptureGuide-Dataset最为经典的使用场景是作为多模态大语言模型(MLLM)在拍摄时刻进行摄影指导的标准化训练与评测基准。该数据集涵盖两类核心任务:摄影师侧构图决策(包括保留、优化或拒绝当前取景)与被拍摄者侧场景适配姿态推荐。通过提供约13万样本,每份样本均包含结构化视觉标注(构图框或17个关键点坐标及可见性状态)与自然语言理由,它使得模型能够学习在真实拍摄环境下理解画面美感缺陷、框定改进区域,并依据场景语义生成可执行的人体姿态建议。这一经典用法突破了传统美学裁剪数据集仅关注后期处理的局限,将AI辅助摄影的边界前移至按下快门的瞬间,为构建具备交互式审美指导能力的智能摄影助手奠定了数据基础。
实际应用
在实际应用中,CaptureGuide-Dataset为开发交互式手机摄影助手提供了核心驱动力。基于该数据集训练的模型可嵌入相机应用,实时分析取景画面并提供即时的构图改良方案,例如提示用户将主体置于三分线交点、建议采用对称构图以增强庄严感,或在画面存在严重倾斜时告知用户需重新拍摄。对被拍摄者而言,模型能依据背景场景(如台阶、栏杆、花丛)自动推荐适配的站姿、坐姿或倚靠姿态,例如在长椅上推荐放松交叉腿的坐姿,在海边推荐面向镜头的手臂舒展站姿,从而实现从“拍什么”到“怎么拍”的全链路智能引导。这种能力尤其适用于非专业用户的自拍、旅拍和街拍场景,显著降低了拍出满意照片的认知门槛与试错成本。
衍生相关工作
围绕CaptureGuide-Dataset已衍生出一系列具有影响力的经典工作。在模型层面,ShutterMuse作为统一的多模态框架,通过监督微调与强化微调(GRPO)实现了构图决策与姿态推荐的双重任务协同优化,其工作流启发了后续将视觉语言模型与结构化输出相结合的范式。在评测层面,CaptureGuide-Bench催生了针对拍摄时刻指导的新评估协议,包括基于掩码覆盖率的主体保留奖励、基于多轮交叉验证的MLLM评分机制,以及用于验证数据扩展可靠性的专家种子自蒸馏流水线(EMDP)。在方法扩展上,后续研究借鉴了该数据集的三值决策思想,将传统美学裁剪任务升级为包含“拒绝”选项的主动审判断定;同时,其场景条件化姿态推荐策略也被迁移至虚拟摄影、数字人直播、运动教学等更广泛的交互式内容生成领域,推动了MLLM从被动理解向主动建议的革命性转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务