遇见数据集

86Cao/google-landmark-v2-chinese-filtered

收藏
Hugging Face2025-12-19 更新2025-12-20 收录
官方服务:

资源简介:

该数据集包含用于训练地标检索模型的地标图像和元数据,其中地标名称已翻译为中文,以促进中文多模态检索任务。数据集基于Kaggle上的Google Landmarks V2数据集,经过过滤和处理,确保数据质量。关键特点包括:从Kaggle数据集过滤而来,确保数据质量;所有地标名称已翻译为中文,适合训练基于视觉语言模型(VLM)的多模态检索系统;地标按类别组织,支持基于类别的硬负采样以提高训练效果。数据集结构包括元数据文件和图像文件夹,提供了训练集和验证集的详细统计数据。

This dataset contains landmark images and metadata for training landmark retrieval models, with Chinese translations of landmark names to facilitate Chinese multimodal retrieval tasks. The dataset is based on the Google Landmarks V2 dataset from Kaggle, filtered and processed to ensure data quality. Key features include: filtered from the Kaggle dataset to ensure data quality; all landmark names translated to Chinese, making it ideal for training Vision-Language Models (VLM) based multimodal retrieval systems; landmarks organized by categories, enabling category-based hard negative sampling for improved training. The dataset structure includes metadata files and image folders, with detailed statistics on the training and validation sets.

提供机构:
86Cao
搜集汇总
数据集介绍
86Cao/google-landmark-v2-chinese-filtered 数据集图片
构建方式
该数据集源自Kaggle平台上经过清洗的Google Landmarks V2子集,通过精细过滤与加工,构建了适用于地标检索任务的高质量训练数据。具体而言,原始数据经由`train_filter.json`和`valid_filter.json`文件分别提取了包含36493个地标的训练集与验证集,涵盖了615419张和151051张查询图像。在此基础上,数据集进一步引入地标名称的中文翻译,并依据地标类别进行组织,提供了完整的`landmark_id_to_category.json`映射文件,以及经过筛选的`landmark_id_to_category_filtered.json`版本,后者仅保留283个适合地标识别的有效类别,共计27516个地标,从而剔除了约25%的行政实体、抽象概念等不适宜类别,确保了数据质量。
特点
该数据集的核心特色在于其专为中文多模态检索任务定制的中文翻译能力,所有地标名称均已转化为中文,使视觉-语言模型(VLM)能够充分利用其丰富的预训练知识,在地标检索中实现显著性能提升。此外,数据集采用基于类别的组织结构,支持类别级困难负样本采样策略,其中同类别但不同地标ID的样本作为困难负样本,可增强模型对细粒度视觉特征的判别能力。过滤后的版本仅包含高质量地标类别,进一步提升了训练数据的纯净度与实用性。
使用方法
使用该数据集时,可通过Python的json库直接加载元数据文件,例如`train_filter.json`和`valid_filter.json`以获取训练与验证样本。类别映射文件(如`landmark_id_to_category_filtered.json`)可用于实现基于类别的困难负样本采样,通过调整`hard_negative_weight`参数(推荐0.7-0.8)平衡困难负样本与常规负样本的损失权重,从而优化模型训练。同时,该映射文件也可用于过滤无效类别的地标,确保仅使用高质量数据。数据加载过程中,未包含在过滤映射中的地标将自动跳过,简化了预处理流程。
背景与挑战
背景概述
地标识别与检索是计算机视觉领域长期关注的核心课题,其应用涵盖旅游推荐、文化遗产保护与智能图像管理等多个方向。Google Landmarks V2数据集作为该领域的标杆性资源,由Google研究团队于2020年发布,旨在解决大规模地标图像检索中的细粒度分类与跨视角匹配问题。在此基础上,86Cao等人于2025年构建了中文过滤版本,通过引入中文地标名称翻译与类别筛选机制,显著增强了数据集在多模态检索场景下的适用性。该数据集包含约76.6万张图像,覆盖3.6万个地标实体,并创新性地提供了基于类别的难负样本采样策略,为视觉语言模型(VLM)的跨模态对齐研究提供了高质量的训练基础。其影响力体现在推动了中文语境下地标检索任务的标准化评估,并为多模态学习领域贡献了首个大规模中英文对照的地标图像资源。
当前挑战
当前数据集面临多重挑战:首先,地标图像检索领域长期受困于类间相似性与类内多样性之间的矛盾,同一类别下不同地标(如不同教堂)在视觉上高度近似,而同一地标在不同光照、季节或拍摄角度下呈现巨大差异,这对模型的细粒度判别能力提出了严苛要求。其次,在构建过程中,原始Google Landmarks V2数据集包含大量非地标类别(如行政实体、抽象概念),经类别过滤后约25%的数据被剔除,如何在保证数据纯净度的同时避免关键地标信息的流失成为核心难题。此外,中文翻译的准确性与一致性面临挑战,部分地标名称存在多译或文化特异性表述,可能影响多模态检索的语义对齐效果。最后,类别不平衡问题显著,少数热门地标(如著名教堂)占据大量样本,而冷门地标数据稀疏,导致模型泛化能力受限。
常用场景
经典使用场景
在计算机视觉与多模态检索领域,该数据集最经典的使用场景是训练和评估基于视觉-语言模型(VLM)的地标检索系统。通过将原始Google Landmarks V2数据集中的地标名称全部翻译为中文,并保留高质量图像与结构化元数据,研究者可以构建端到端的中文多模态地标检索管道。典型任务包括给定中文地标名称查询对应图像,或输入图像检索其归属地标的中文描述,这为跨模态对齐与语义匹配提供了丰富的训练样本。类别化组织方式还支持类别感知的难负样本采样策略,显著提升了模型在细粒度地标识别上的判别能力。
衍生相关工作
该数据集的发布催生了一系列具有影响力的衍生研究工作。基于其类别化难负样本采样机制,研究者提出了多种改进的对比学习损失函数,如类别感知的Circle Loss与Hierarchical Triplet Loss,在多个地标检索基准上取得了突破性性能。部分工作进一步融合了中文预训练语言模型(如BERT-wwm)与视觉骨干网络,构建了端到端的中文跨模态地标检索框架,验证了双语对齐对检索精度的提升作用。此外,该数据集还被用于地标识别中的域适应研究,探索如何将在大规模英文数据上预训练的VLM高效迁移至中文地标场景,推动了多语言多模态学习的理论边界。
数据集最近研究
最新研究方向
在视觉语言模型(VLM)与多模态检索技术快速发展的背景下,该数据集聚焦于地标识别领域的前沿研究方向,通过引入中文标注的地标名称与类别化组织策略,显著提升了跨语言多模态检索的精度与鲁棒性。其核心创新在于支持基于类别的难负样本采样——利用同类别内不同地标作为更具挑战性的负例,使模型能够学习细粒度视觉差异,从而在建筑风格相似或文化重叠的地标中实现精准区分。这一设计直接回应了当前多模态检索中视觉相似性混淆的痛点,尤其适用于旅游推荐、文化遗产数字化等热点应用场景。此外,数据集通过过滤非实体类别(如行政区域、抽象概念)保证了训练样本的高质量,为构建更可靠、更具泛化能力的地标检索系统奠定了坚实基础,推动了计算机视觉与自然语言处理的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务