遇见数据集

AdaptCities

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

AdaptCities 是一个为视觉位置识别(Visual Place Recognition)任务设计的文本数据集,主要用于支持 AdaptVPR 方法中数据增强管道的 prompt 生成与 metadata 格式示例。数据集包含 160,000 条经过规划的图像生成 prompts,每条记录对应一个唯一的 sample_id,并通过 source_id 关联到原始 GSV-Cities 图像。所有 prompts 按城市划分为 23 个非重叠分片,存储在 prompts/by_city/ 目录下,同时提供统一的 JSONL 文件(adaptcities_160k_prompts.jsonl)和验证摘要文件。数据集还包含 45,804 条本地记录(Local records),这些记录根据遮挡类型进一步分类:路缘/停车车辆遮挡(21,840 条)、道路交通遮挡(13,285 条)和其他局部遮挡(10,679 条)。每条本地记录均包含 condition 和 local_occlusion_type 字段以存储分类标签,prompt 字段则描述了场景合适的遮挡物、放置位置及所需保持的约束条件。此外,metadata/ 目录提供了路线、条件和验证 metadata 的格式示例,examples/ 目录包含合成记录以展示公共格式。数据集仅包含文本,不包含原始或生成的街景图像,用户需自行获取 GSV-Cities 原始图像。数据集授权协议为 CC BY-NC-SA 4.0,相关代码和生成流程可在 AdaptVPR GitHub 仓库中找到。

AdaptCities is a text dataset designed for the Visual Place Recognition (VPR) task, primarily used to support prompt generation and metadata format examples in the data augmentation pipeline of the AdaptVPR method. The dataset contains 160,000 planned image generation prompts, each with a unique sample_id and associated with an original GSV-Cities image via source_id. All prompts are divided into 23 non-overlapping shards by city, stored in the prompts/by_city/ directory, along with a unified JSONL file (adaptcities_160k_prompts.jsonl) and a validation summary file. The dataset also includes 45,804 local records, further categorized by occlusion type: curb/parked vehicle occlusion (21,840), road traffic occlusion (13,285), and other local occlusion (10,679). Each local record contains condition and local_occlusion_type fields for classification labels, and the prompt field describes suitable occluders, placement positions, and required constraints. Additionally, the metadata/ directory provides format examples for route, condition, and validation metadata, and the examples/ directory contains synthetic records demonstrating common formats. The dataset contains only text, no original or generated street view images; users must obtain the original GSV-Cities images themselves. The dataset is licensed under CC BY-NC-SA 4.0, and related code and generation pipeline can be found in the AdaptVPR GitHub repository.

创建时间:
2026-09-03
原始信息汇总

AdaptCities 数据集详情

数据集简介

AdaptCities 是由 AdaptVPR 项目释放的文本提示与元数据格式数据集,仅包含文本,不含原始或生成的街景图像。该数据集利用 Qwen3-VL-4B-Instruct 进行提示规划,可用于图像生成,或使用 Qwen 进行再生。

基本信息

  • 语言:英语
  • 许可证:CC BY-NC-SA 4.0(知识共享-非商业性使用-相同方式共享 4.0)
  • 任务类型:图像特征提取
  • 标签:视觉位置识别、图像生成、提示、元数据

数据集构成

AdaptCities 提供统一的 160,000 条记录提示文件,结构如下:

  • prompts/ — 包含统一的 160,000 条提示文件和验证摘要
  • prompts/by_city/ — 将同一集划分为 23 个不重叠的城市分片,每条记录仅存在一个分片中
  • metadata/ — 提供路线、条件和验证元数据的格式示例
  • examples/ — 包含展示公共格式的合成记录

每条记录包含唯一的 sample_id,并且 source_id 保留原始 GSV-Cities 文件名,以链接到源图像。

本地记录分类

数据集的 45,804 条 Local 记录遵循论文分类法:

  • 路边/停车车辆遮挡:21,840 条
  • 道路交通遮挡:13,285 条
  • 其他局部遮挡:10,679 条

每条 Local 记录包含 conditionlocal_occlusion_type 字段,存储相同的分类标签;而 prompt 字段则指定场景适宜的遮挡物、位置以及所需的保留约束。

可用性与限制

  • 释放内容:160,000 条训练分割统一提示 + 元数据格式示例
  • 不重新分发的内容:原始 GSV-Cities 和生成的 AdaptCities 图像,读者需另行从 GSV-Cities 获取
  • 生成代码和处理流水线可从 AdaptVPR GitHub 仓库 获取

引用

可引用论文 (arXiv:2609.04369) 及 AdaptVPR 项目,相关 BibTeX 见数据页面。

搜集汇总
数据集介绍
AdaptCities 数据集图片
构建方式
AdaptCities数据集源于视觉地点识别领域的顽疾——模型在跨域环境下的鲁棒性匮乏。其构建依托Qwen3-VL-4B-Instruct大语言模型进行初始提示规划,产出统一格式的160,000条文本提示,每条记录蕴含独一无二的sample_id,并通过source_id与源图像GSV-Cities建立可追溯的关联。数据依循论文分类法,将局部遮挡细分为三类,涵盖路缘及停放车辆遮挡、道路车流遮挡及其他局部遮挡,对应的prompt精准定义了场景适配的遮挡物、布局及保持约束。为便于分区处理,语料被划分为23个互不重叠的城市分片,每个记录仅在单一分片出现,辅以索引文件完整记录数据归属与统计,确保构建流程的严密与可复现性。
特点
AdaptCities数据集的卓越之处在于其作为首个专为视觉地点识别生成对抗性正样本的大规模文本提示集,摒弃了传统图像数据集的静态局限,转而提供动态可扩展的生成指引。其细粒度的局部遮挡分类直击视觉地点识别中的关键瓶颈,通过条件标签与提示双轨并进,既保留了场景的语义真实性,又精确调控了遮挡物的属性与空间配置。采用纯文本格式,不仅规避了原始图像的分发壁垒,更赋予了数据集高度的适配性与可塑性,研究者可自由借助各类图像生成模型,将提示物化为训练图像,从而在不同生成器间实现灵活迁移与迭代优化。
使用方法
使用AdaptCities数据集时,研究人员首先通过HuggingFace平台获取统一提示文件或按需提取特定城市的子集。数据集中每条记录的prompt字段可直接输入至图像生成模型(如Stable Diffusion等)以合成逼真的训练图像,亦可将提示以jsonl格式导入自定义的数据加载管道,与GSV-Cities中的原始图像配对,构建具备高度领域多样性的训练集。为辅助模型评估,数据集的metadata目录提供了路径、条件及验证信息的格式范本,而examples目录中的合成记录则展示了标准化的输出结构,便于用户快速熟悉格式规范并集成至AdaptVPR等视觉地点识别框架中,驱动模型在跨城市场景中实现鲁棒性提升。
背景与挑战
背景概述
AdaptCities数据集由Chen Shunpeng等研究人员于2026年提出,隶属于AdaptVPR项目,旨在解决视觉地点识别(Visual Place Recognition, VPR)中因视角变化、遮挡及环境动态性导致的性能退化问题。基于GSV-Cities数据集的160,000张街景图像,该数据集利用Qwen3-VL-4B模型生成细粒度生成提示,并附带路由、条件及验证元数据的规范示例,为合成训练数据的可控生成提供了标准化基础。其发布在HuggingFace平台,采用CC BY-NC-SA 4.0许可,不直接分发原始图片,而是开放提示及处理流程。该数据集显著推动了基于生成对抗网络或扩散模型的VPR数据增强研究,为在复杂城市环境中实现鲁棒的地点识别提供了新范式,并对跨域泛化研究具有重要参考价值。
当前挑战
AdaptCities所应对的领域挑战聚焦于VPR模型在现实场景中面临的高难度正样本构建问题,即如何生成与查询图像在视角、光照和遮挡上具有一致性的城市街景图像。具体而言,模型需处理车辆停靠、交通流线等局域遮挡(占Local样本比例的47.7%)、全局天气与光照剧变,以及跨城市风格迁移带来的域差异。在构建过程中,研究者面临三重技术难点:设计场景感知的遮挡物布局及其空间约束以保持地标完整性;确保生成图像的文本提示对VPR特征的判别性,避免冗余模式;以及协调大规模提示生成的质量与效率,采用Qwen3-VL-4B协同规划,并制定统一的元数据框架使提示可复现、可校验。此外,数据集的合规性衍生挑战包括不直接共享生成图像,而要求用户独立获取GSV-Cities,提高了复现门槛。
常用场景
经典使用场景
AdaptCities数据集作为视觉地点识别(Visual Place Recognition, VPR)领域的一项创新性资源,其核心应用场景在于为生成对抗网络(GAN)或扩散模型等生成式架构提供高度结构化的文本提示(prompts)以及配套的元数据格式。该数据集包含160,000条精心设计的提示记录,每条记录关联唯一的采样标识符(sample_id)与源自GSV-Cities的源图像标识符(source_id),并细致划分了本地遮挡(Local occlusions)的三种类型,即路边停靠车辆遮挡、道路交通遮挡及其他局部遮挡。在实践中,研究者可利用该数据集的提示信息驱动图像生成模型,构造具有挑战性的训练样本,以提升VPR模型在动态场景下的鲁棒性。特别地,其元数据中的route、condition与verification字段,为构建多视角、多条件的路径感知训练流程提供了范式,非常适合作为生成式数据增强的基础。
解决学术问题
该数据集直面视觉地点识别研究中长期存在的训练数据匮乏难题,准确地说,是针对现有公开基准(如GSV-Cities)中正样本对(positive pairs)在视角、光照和遮挡条件上变化不足的局限。经典的VPR模型往往依赖大规模、跨条件的匹配图像对进行训练,但现有数据采集成本高昂且难以覆盖多样化的环境扰动。AdaptCities通过提供统一化、细粒度的生成提示,使研究人员能够按需合成具有可控遮挡程度和场景干扰的图片,从而在不依赖额外人工标注的前提下,扩充训练域并模拟难以捕获的极端情况。此方案有效缓解了因数据分布偏置导致的模型泛化能力下降问题,同时为量化遮挡类型对识别性能的影响提供了标准化的研究工具,推动了从数据驱动学习向数据生成驱动的识别范式转变。
衍生相关工作
该数据集的发布直接催生或促进了基于生成式策略的视觉定位研究分支,其伴生论文《AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition》提出了路径感知的困难正样本生成框架,成为这一方向的代表性工作。后续研究可沿两条主线延伸:其一,借鉴其元数据规范设计跨模态(文本-图像-语义)融合的训练管线,推动条件式图像生成引擎(如基于扩散模型的微调)专门面向地点识别任务进行定向优化;其二,该数据集中显式的遮挡分类标签为分析遮挡影响下的特征空间分布提供了基准,衍生出针对遮挡鲁棒性的表示学习评测协议。此外,其公开的按城市切分的提示文件结构,也为多域适应(domain adaptation)研究构建了天然的实验沙盒,预计将对无监督域对齐、持续学习等子领域产生深远辐射。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务