遇见数据集

VIGOR-his

收藏
arXiv2026-09-29 更新2026-10-01 收录
官方服务:

资源简介:

VIGOR-his是中山大学构建的跨越十年时间跨度的跨视角数据集,覆盖三大洲11个城市,包含43,653个位置级别的四元组(每个位置整合早期与近期的街景及对应卫星图)。数据通过自动化流水线完成空间配对、一致性筛选、变化分类以及基于卫星的改变描述和局部编辑指令生成,并标注了建筑、道路等变化类别。该数据集旨在弥补现有数据缺乏时间对齐跨视角对与编辑指令的空白,通过近期街景约束视角和不变区域、卫星差异引导变化区域编辑,为历史街景生成提供精细的局部编辑依据。

VIGOR-his is a cross-view dataset constructed by Sun Yat-sen University, spanning a ten-year time span, covering 11 cities across three continents and containing 43,653 location-level quadruples. Each quadruple integrates early and recent street view images and their corresponding satellite imagery for a specific location. The dataset is processed via an automated pipeline that includes spatial pairing, consistency filtering, change classification, satellite-based change description and generation of local editing instructions, with change categories such as buildings and roads annotated. This dataset aims to fill the gap that existing datasets lack temporally aligned cross-view pairs and editing instructions. By constraining perspectives and invariant regions using recent street view images, and guiding the editing of change regions through differences in satellite imagery, it provides fine-grained local editing bases for historical street view generation.

提供机构:
中山大学
创建时间:
2026-09-29
原始信息汇总

CrossTimeEdit 数据集详情总结

基本信息

  • 数据集名称:VIGOR-his(CrossTimeEdit 配套数据集)
  • 论文标题:CrossTimeEdit: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation
  • 作者:Hanwen Lu、Jun He、Mingjia Yang、Hao Wei、Jinhao Huang、Yi Lin、Xiang Zhang
  • 所属机构:中山大学(Sun Yat-sen University)
  • 年份:2026

数据集概述

VIGOR-his 是一个跨越约十年的跨视角数据集,用于历史街景生成任务。数据集将历史街景生成重新表述为局部图像编辑问题:以近期街景约束视角与未变化外观,以卫星影像差异作为变化证据,指定变化区域的早期状态。

数据集规模与覆盖

  • 样本数量:43,653 个位置级跨视角四元组(location-level cross-view quadruplets)
  • 覆盖范围:3 大洲 11 座城市
  • 时间跨度:约十年,配对早期与近期的街景和卫星影像
  • 数据形式:每个样本包含一个时序跨视角四元组,由同位置的早期/近期卫星影像与街景全景图构成

数据特征

  1. 配对约十年间隔的早期与近期街景及卫星影像
  2. 采集时段匹配与基于 Gemini 的跨视角场景一致性筛选
  3. 覆盖三大洲 11 座城市的地理范围
  4. 变化类别、基于卫星影像的变化描述及局部编辑指令,支持基于跨视角变化证据的历史街景生成

构建流程

阶段一:数据收集与预处理

收集早期与近期观测数据,利用全景标识符、拍摄时间和 GPS 坐标配对图像,并将全景图对齐至统一的朝北约定。

阶段二:变化分类与一致性筛选

筛选视角对齐情况,对建筑与道路变化进行分类,保留通过相应跨视角与时序一致性检查的四元组。

阶段三:基于卫星影像的指令生成

沿四个观察方向描述时序卫星变化,并转化为指定早期状态与未变化内容的局部指令。

阶段四:指令验证

将指令与配对街景进行验证,检查所请求的编辑是否与早期观测一致并保留未变化区域。

变化类别覆盖

样本涵盖无变化(两个位置)、建筑变化、道路变化,以及建筑与道路组合变化。指令按观察方向组织全景图,并指定区域级的 MODIFY 或 PRESERVE 操作。

相关方法:CrossTimeEdit

  • 基座模型:FLUX.2 [Klein] 4B
  • 训练方式:监督微调(SFT)后进行在线强化学习(RL)
  • 训练数据:VIGOR-his(在基座上训练 LoRA 适配器)
  • 生成输入:近期街景(约束视角与未变化外观)+ 卫星导出的指令(指定变化区域的早期状态)
  • 监督与评估目标:早期街景(不作为生成输入)

三项编辑评价标准

  1. Instruction Alignment (IA):指令对齐
  2. Background Preservation (BP):背景保持
  3. Quality and Physical Plausibility (QP):质量与物理合理性

三项标准同时作为 RL 奖励维度与街景编辑评估指标。

强化学习优化

  • 使用 Flow-GRPO(Within Group Relative Policy Optimization for flow-matching models)进行多奖励目标优化
  • 结合 GDPO(Group reward-Decoupled Normalization Policy Optimization),在聚合前对每个奖励维度独立归一化
  • 使用 VLM 评分的候选样本更新经 SFT 初始化的 LoRA 策略

实验结果

  • CrossTimeEdit 在三项编辑标准上的整体性能较预训练基线提升 17.12%
  • 在场景一致性、视觉真实感和感知质量方面优于跨视角生成模型
  • 对比对象包括通用图像编辑模型与跨视角生成模型
  • 消融实验涵盖 Baseline、w/o SFT、w/o GT、w/o DGN、w/o RL 及 Full 变体

资源链接

  • 论文:arXiv:2609.36616(https://arxiv.org/abs/2609.36616)
  • 代码:GitHub release(https://github.com/luhanwen67/CrossTimeEdit-release)
  • 模型权重:Hugging Face
  • VIGOR-his 元数据:Hugging Face

引用信息

@article{lu2026crosstimeedit, title = {{CrossTimeEdit}: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation}, author = {Lu, Hanwen and He, Jun and Yang, Mingjia and Wei, Hao and Huang, Jinhao and Lin, Yi and Zhang, Xiang}, journal = {arXiv preprint arXiv:2609.36616}, year = {2026}, url = {https://arxiv.org/abs/2609.36616} }

搜集汇总
数据集介绍
VIGOR-his 数据集图片
构建方式
面对历史街景生成中时间跨度配对数据匮乏的困境,VIGOR-his的构建以跨视角时空对齐为核心线索。研究者以VIGOR数据集的街景影像标识符为锚点,从谷歌街景与地图服务中回溯采集约十年前的街景全景与对应卫星影像,并补充采集巴塞罗那、布达佩斯、哥本哈根等七座城市的多时段观测,以拓展地理与时间多样性。在预处理阶段,观测记录经时空聚类与位置级配对,早今两期全景在5米空间容差内完成匹配,卫星影像以街景采集位置为中心截取并统一北向对齐,最终形成跨年代、跨视角的地点级四元组。
使用方法
该数据集主要服务于历史街景生成任务,其使用方式围绕局部编辑范式展开。研究者以近期街景全景作为视觉参考,约束视角与未变化外观,并利用卫星影像的时间差异作为变化证据,结合局部编辑指令驱动模型对变化区域进行修改。在此基础上,CrossTimeEdit模型通过监督微调与在线强化学习相结合的训练策略,采用指令对齐、背景保持与质量及物理合理性三项准则作为奖励维度与评估指标,借助Flow-GRPO与奖励解耦归一化优化多目标策略,实现历史街景的生成与评估。
背景与挑战
背景概述
街景影像以人本视角镌刻城市演进轨迹,然而空间覆盖的参差不齐与采集时序的无序交错,致使大量历史区段无可观测记录,生成可信赖的往昔街景因而成为城市计算与计算机视觉交汇处的前沿命题。既有跨视角数据集或专于地空配准而缺失时序观测,或止于街景时序分析而无对应卫星影像,难以同时提供地点匹配的早期—近期跨视角影像与局部编辑指令。中山大学研究团队构建的VIGOR-his数据集,涵盖三大洲十一座城市的43,653组十年跨度跨视角四元组,并配套变化类别、卫星变化描述与局部编辑指令,为历史街景生成确立了新的数据基础与监督范式。
当前挑战
该数据集所应对的领域问题在于,卫星影像对街景立面、纹理与遮挡结构约束稀疏,纯粹由卫星生成街景易篡改跨时恒存的建筑与道路,且通用编辑模型难以适配全景畸变下的地点特异性还原。其构建过程亦面临多重挑战:跨视角可观测性差异使远离卫星中心的道路标线难以可靠编辑与核验,自动化时序一致性筛查无法彻底消除卫星与街景影像间的状态错配,卫星观测对复杂历史建筑的立面级证据供给不足,以及同一视觉语言模型兼作训练奖励与评估可能引入评估者特异性偏好。
常用场景
经典使用场景
在城市时空演化分析与人本视角的历史街景重建领域,该数据集最经典的用法是以约十年跨度的跨视角四元组为监督基础,将历史街景生成建模为局部图像编辑任务。模型以近期街景全景作为视角与未变外观的锚定参考,以成对卫星影像的时序差异作为变化证据,依据卫星落地的本地编辑指令对指定方位执行MODIFY或PRESERVE操作。这种编辑式范式避免了从随机噪声直接合成完整街景所引入的结构漂移,使模型能够在保留持久性场景内容的同时,定向恢复已消失或已改造的建筑与道路的历史状态。
解决学术问题
该数据集直面跨视角地理定位与历史街景研究中长期存在的证据缺失难题。既有资源或仅提供地空对应而缺乏同一地点早晚成对观测,或仅提供街景时序而缺少可对照的卫星时序,导致跨视角时序证据与编辑监督无法联合获取。VIGOR-his通过时空配对、一致性筛选与变化分类,将卫星层面的结构变化转译为地面可执行的方位化编辑指令,为历史街景生成、城市变化检测以及跨视角生成模型的评测提供了统一基准,其意义在于把难以直接观测的历史状态恢复问题转化为可监督、可度量的条件编辑问题,并为多时相城市演化建模奠定数据基础。
实际应用
在实际应用中,该数据集可支撑城市规划与遗产保护领域的场景级历史回溯,例如在街景覆盖稀疏或早期影像缺失的区域,辅助生成合理的历史街景假设以补全城市演化的视觉档案。它同样适用于导航与地图服务的时序浏览、城市更新项目的可视化论证,以及变化检测模型在建筑与道路改造识别上的训练与验证。依托多国多城市的覆盖特征,该资源还能服务于跨区域城市形态比较研究,并为生成式模型提供面向真实街景畸变与全景几何的编辑能力评估环境。
数据集最近研究
最新研究方向
VIGOR-his的构建标志着跨视角街景数据集从静态空间对齐向长时序城市演变建模的范式跃迁。该数据集以约十年跨度、三大洲十一座城市的43,653组位置级四元组,填补了历史街景生成中时序跨视角证据与编辑监督联合缺失的空白,并与CityPulse、CVUSA等既有资源形成互补。当前前沿研究聚焦于将历史街景恢复重构为局部编辑任务:以近期街景锚定视角与未变外观,以时序卫星差异作为变化证据,通过SFT与多奖励在线强化学习实现受控生成。其三维奖励协议与评测标准,为城市时空分析与生成式城市建模提供了可复用的监督框架,亦推动了地理视觉与生成模型交叉领域的实证研究。
相关研究论文
  • 1
    CrossTimeEdit: A Decade-Spanning Cross-View Dataset and Reward-Guided Editing for Historical Street-View Generation中山大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务