VIGOR-his
收藏资源简介:
VIGOR-his是中山大学构建的跨越十年时间跨度的跨视角数据集,覆盖三大洲11个城市,包含43,653个位置级别的四元组(每个位置整合早期与近期的街景及对应卫星图)。数据通过自动化流水线完成空间配对、一致性筛选、变化分类以及基于卫星的改变描述和局部编辑指令生成,并标注了建筑、道路等变化类别。该数据集旨在弥补现有数据缺乏时间对齐跨视角对与编辑指令的空白,通过近期街景约束视角和不变区域、卫星差异引导变化区域编辑,为历史街景生成提供精细的局部编辑依据。
VIGOR-his is a cross-view dataset constructed by Sun Yat-sen University, spanning a ten-year time span, covering 11 cities across three continents and containing 43,653 location-level quadruples. Each quadruple integrates early and recent street view images and their corresponding satellite imagery for a specific location. The dataset is processed via an automated pipeline that includes spatial pairing, consistency filtering, change classification, satellite-based change description and generation of local editing instructions, with change categories such as buildings and roads annotated. This dataset aims to fill the gap that existing datasets lack temporally aligned cross-view pairs and editing instructions. By constraining perspectives and invariant regions using recent street view images, and guiding the editing of change regions through differences in satellite imagery, it provides fine-grained local editing bases for historical street view generation.
CrossTimeEdit 数据集详情总结
基本信息
- 数据集名称:VIGOR-his(CrossTimeEdit 配套数据集)
- 论文标题:CrossTimeEdit: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation
- 作者:Hanwen Lu、Jun He、Mingjia Yang、Hao Wei、Jinhao Huang、Yi Lin、Xiang Zhang
- 所属机构:中山大学(Sun Yat-sen University)
- 年份:2026
数据集概述
VIGOR-his 是一个跨越约十年的跨视角数据集,用于历史街景生成任务。数据集将历史街景生成重新表述为局部图像编辑问题:以近期街景约束视角与未变化外观,以卫星影像差异作为变化证据,指定变化区域的早期状态。
数据集规模与覆盖
- 样本数量:43,653 个位置级跨视角四元组(location-level cross-view quadruplets)
- 覆盖范围:3 大洲 11 座城市
- 时间跨度:约十年,配对早期与近期的街景和卫星影像
- 数据形式:每个样本包含一个时序跨视角四元组,由同位置的早期/近期卫星影像与街景全景图构成
数据特征
- 配对约十年间隔的早期与近期街景及卫星影像
- 采集时段匹配与基于 Gemini 的跨视角场景一致性筛选
- 覆盖三大洲 11 座城市的地理范围
- 变化类别、基于卫星影像的变化描述及局部编辑指令,支持基于跨视角变化证据的历史街景生成
构建流程
阶段一:数据收集与预处理
收集早期与近期观测数据,利用全景标识符、拍摄时间和 GPS 坐标配对图像,并将全景图对齐至统一的朝北约定。
阶段二:变化分类与一致性筛选
筛选视角对齐情况,对建筑与道路变化进行分类,保留通过相应跨视角与时序一致性检查的四元组。
阶段三:基于卫星影像的指令生成
沿四个观察方向描述时序卫星变化,并转化为指定早期状态与未变化内容的局部指令。
阶段四:指令验证
将指令与配对街景进行验证,检查所请求的编辑是否与早期观测一致并保留未变化区域。
变化类别覆盖
样本涵盖无变化(两个位置)、建筑变化、道路变化,以及建筑与道路组合变化。指令按观察方向组织全景图,并指定区域级的 MODIFY 或 PRESERVE 操作。
相关方法:CrossTimeEdit
- 基座模型:FLUX.2 [Klein] 4B
- 训练方式:监督微调(SFT)后进行在线强化学习(RL)
- 训练数据:VIGOR-his(在基座上训练 LoRA 适配器)
- 生成输入:近期街景(约束视角与未变化外观)+ 卫星导出的指令(指定变化区域的早期状态)
- 监督与评估目标:早期街景(不作为生成输入)
三项编辑评价标准
- Instruction Alignment (IA):指令对齐
- Background Preservation (BP):背景保持
- Quality and Physical Plausibility (QP):质量与物理合理性
三项标准同时作为 RL 奖励维度与街景编辑评估指标。
强化学习优化
- 使用 Flow-GRPO(Within Group Relative Policy Optimization for flow-matching models)进行多奖励目标优化
- 结合 GDPO(Group reward-Decoupled Normalization Policy Optimization),在聚合前对每个奖励维度独立归一化
- 使用 VLM 评分的候选样本更新经 SFT 初始化的 LoRA 策略
实验结果
- CrossTimeEdit 在三项编辑标准上的整体性能较预训练基线提升 17.12%
- 在场景一致性、视觉真实感和感知质量方面优于跨视角生成模型
- 对比对象包括通用图像编辑模型与跨视角生成模型
- 消融实验涵盖 Baseline、w/o SFT、w/o GT、w/o DGN、w/o RL 及 Full 变体
资源链接
- 论文:arXiv:2609.36616(https://arxiv.org/abs/2609.36616)
- 代码:GitHub release(https://github.com/luhanwen67/CrossTimeEdit-release)
- 模型权重:Hugging Face
- VIGOR-his 元数据:Hugging Face
引用信息
@article{lu2026crosstimeedit, title = {{CrossTimeEdit}: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation}, author = {Lu, Hanwen and He, Jun and Yang, Mingjia and Wei, Hao and Huang, Jinhao and Lin, Yi and Zhang, Xiang}, journal = {arXiv preprint arXiv:2609.36616}, year = {2026}, url = {https://arxiv.org/abs/2609.36616} }

- 1CrossTimeEdit: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation中山大学 · 2026年



