遇见数据集

arch-building-dataset

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

世界建筑数据集是一个专门用于多类图像分类的平衡数据集,包含13,440张经过精心策划的建筑图像。数据集由Saugani策展,所有图像均来自Pexels.com,遵循Pexels许可证(允许商业使用且无需署名)。数据集涵盖8个建筑类别:谷仓、桥梁、城堡、清真寺、摩天大楼、体育场、寺庙和风车,每个类别包含1,680张图像,确保类别平衡。图像经过统一处理,最长边分辨率不超过720像素,采用JPEG格式,每张图像文件大小不超过200KB。数据收集采用多模式采集流程,包括Pexels API、BrightData和Selenium,并使用关键词搜索确保类别代表性。严格的质量过滤流程包括最小分辨率、宽高比、颜色标准差等标准,以及基于pHash和SHA256的去重处理,最后经过人工审核。数据集结构清晰,按类别文件夹组织,文件命名遵循“{类别}_XXXXX.jpg”格式。建议的数据划分是80%训练集、10%验证集和10%测试集。该数据集不包含个人身份信息,已过滤人物内容,仅专注于建筑结构,适用于图像分类模型训练和评估。

The World Architecture Dataset is a balanced dataset specifically designed for multi-class image classification, containing 13,440 carefully curated architectural images. The dataset is curated by Saugani, with all images sourced from Pexels.com, following the Pexels license (which permits commercial use without attribution). It covers 8 architectural categories: barn, bridge, castle, mosque, skyscraper, stadium, temple, and windmill, with each category containing 1,680 images to ensure class balance. The images are uniformly processed, with the longest side resolution not exceeding 720 pixels, in JPEG format, and each image file size is no more than 200KB. Data collection employs a multi-modal acquisition process, including Pexels API, BrightData, and Selenium, with keyword searches to ensure category representation. Rigorous quality filtering includes criteria such as minimum resolution, aspect ratio, color standard deviation, as well as deduplication based on pHash and SHA256, followed by manual review. The dataset structure is clear, organized by category folders, with file naming following the format {category}_XXXXX.jpg. The recommended data split is 80% training set, 10% validation set, and 10% test set. The dataset does not contain personally identifiable information, has filtered human content, and focuses solely on architectural structures, making it suitable for training and evaluating image classification models.

创建时间:
2026-06-13
原始信息汇总

数据集概述

  • 数据集名称: World Architectural Buildings Dataset for Multi‑Class Image Classification
  • 策划者: Saugani
  • 许可证: CC-BY-4.0(图像遵循 Pexels 许可证,可免费商用,无需署名)
  • 数据集规模: 13,440 张图像
  • 图像分辨率: 最长边最大 720px,格式为 JPEG
  • 类别数量: 8 个类别,每个类别 1,680 张图像(类别平衡)
  • 联系方式: team@greyscope.xyz
  • 主页: https://greyscope.xyz

类别详情

类别 数量 描述
barn 1,680 传统木制谷仓建筑(住宅和储物建筑)
bridge 1,680 各种桥梁建筑(悬索桥、拱桥、桁架桥)
castle 1,680 中世纪和现代城堡结构
mosque 1,680 伊斯兰清真寺建筑(圆顶、宣礼塔)
skyscraper 1,680 高层商业及住宅、城市天际线建筑
stadium 1,680 体育场馆、竞技场、圆形剧场
temple 1,680 宗教寺庙建筑(佛教、印度教、亚洲风格)
windmill 1,680 风车结构(传统风车、塔式风车、荷兰风车)
总计 13,440 所有数据集已完成最终策划

数据收集与处理

  • 数据来源: 所有图像来自 Pexels.com,遵循 Pexels 许可证(免费商用,无需署名)
  • 收集管道: 多模式抓取级联
    • Pexels API Key:主要来源,基于关键词的 API 直接访问
    • BrightData:对代表性不足的子类别进行补充收集
    • Selenium:针对需要浏览器自动化的特定查询的备用方案
  • 搜索关键词: 每个类别对应一组关键词(如 barn 类:old wooden barn, barn homes 等)
  • 压缩与格式: 最长边最大 720px,最短边最小 200px,单图最大 200KB,JPEG 格式,自适应质量压缩(起始质量 85,步长 -5,最低质量 40,直至文件 ≤ 200KB)
  • 质量过滤: 应用了最小分辨率(150×150 px)、宽高比(0.28 – 3.5)、色彩标准差(≥ 10.0)、文件大小范围(5 KB – 4,096 KB)、文件扩展名过滤(仅保留 JPEG)、URL 模式过滤(排除徽标、头像、图标、AI 艺术、插图、人物等)等多项过滤器
  • 去重处理:
    • pHash(感知哈希,16×16):距离 ≤ 8,移除视觉相似图像
    • SHA256:精确匹配,移除字节相同副本
    • 人工把关:领域专家进行最终视觉注释与筛选
  • 分辨率分布: 宽度范围为 256 – 889 px,高度范围为 160 – 1140 px

加载方式

python from datasets import load_dataset

dataset = load_dataset("0xgr3y/arch-building-dataset", data_dir="dataset")

数据集结构

dataset/ ├── barn/ barn_00000.jpg – barn_01679.jpg ├── bridge/ bridge_00000.jpg – bridge_01679.jpg ├── castle/ castle_00000.jpg – castle_01679.jpg ├── mosque/ mosque_00000.jpg – mosque_01679.jpg ├── skyscraper/ skyscraper_00000.jpg – skyscraper_01679.jpg ├── stadium/ stadium_00000.jpg – stadium_01679.jpg ├── temple/ temple_00000.jpg – temple_01679.jpg └── windmill/ windmill_00000.jpg – windmill_01679.jpg

  • 命名规则: {类别}_{5位序列号}.jpg,序列号从 0 开始,零填充
  • 文件格式: 全部为 JPEG
  • 文件总数: 13,440

数据集划分(推荐)

推荐采用 80% / 10% / 10% 的划分比例,使用 split-folders 并设置 seed=42

划分 图像总数 每类数量
训练集 10,752 1,344
验证集 1,344 168
测试集 1,344 168
总计 13,440 1,680

伦理考量

  • 无个人身份信息(PII):所有图像均为建筑照片,不包含人脸、姓名或个人数据。
  • 人类内容已过滤:URL 模式过滤器在收集过程中明确排除了标记有人物、肖像或人类关注内容的图像。
  • 商用免费许可:所有图像均来自 Pexels,遵循 Pexels 许可证(免费商用,无需署名)。
  • 仅限建筑范围:数据集严格限于建筑结构,不包含可用于监控、画像或任何有害目的的内容。
  • 负责任使用:用户同意不主张原始图像的版权、不在未注明出处的情况下重新分发数据集、不将数据集用于非法目的。

相关内容

引用

bibtex @misc{saugani2026_arch_building_dataset, title={World Architectural Buildings Dataset for Multi‑Class Image Classification}, author={Saugani}, year={2026}, publisher={Hugging Face}, url={https://huggingface.co/datasets/0xgr3y/arch-building}, doi={10.57967/hf/9220} }

搜集汇总
数据集介绍
arch-building-dataset 数据集图片
构建方式
该数据集聚焦于全球建筑风格的多类别图像分类任务,数据全部源自Pexels图库,遵循CC-BY-4.0许可协议。构建过程采用多模式爬取策略,主要包括Pexels API直接检索、BrightData辅助采集以及Selenium浏览器自动化回退机制,以确保每类建筑子类别的图像覆盖充分。通过针对每类建筑精心设计的关键词组合(如barn类使用“old wooden barn”“barn architecture”等)进行检索,最终收集并精选出13,440张高质量图像,涵盖谷仓、桥梁、城堡、清真寺、摩天大楼、体育场、寺庙和风车8个类别,每类严格保持1,680张的平衡分布。
特点
数据集的显著特点在于其精细化的质量控制与均衡性。所有图像在预处理阶段经过分辨率、宽高比、色彩标准差、文件大小及格式的多重过滤,并剔除非摄影类内容(如图标、AI艺术、人物等)。借助感知哈希(pHash,距离≤8)与SHA256双重去重机制,结合人工专家评审,有效消除了视觉相似与字节完全一致的重复样本。最终图像最大边分辨率统一缩放至720像素、文件大小控制在200KB以内,以JPEG格式存储,兼顾了模型训练的效率与视觉信息的完整性。
使用方法
该数据集专为多类别图像分类任务优化,推荐使用Hugging Face的datasets库直接加载,调用load_dataset('0xgr3y/arch-building-dataset', data_dir='dataset')即可获取。数据集按类别分文件夹组织,文件命名规则为“{class}_{5位序列号}.jpg”。官方建议采用80%(训练集)、10%(验证集)与10%(测试集)的比例进行划分,可使用split-folders工具并设定随机种子42实现可复现的拆分。每类在训练集中包含1,344张图像,验证与测试集各168张,适合迁移学习或微调视觉模型,如配套的基于EfficientNetV2的分类模型。
背景与挑战
背景概述
建筑风格识别是计算机视觉领域一项具有挑战性的细粒度图像分类任务,其核心在于捕捉不同建筑类型间微妙的视觉差异。由研究者Saugani于2026年创建的Arch-Building-Dataset,是一项致力于推动全球建筑图像多类别分类研究的重要数据集。该数据集共包含13,440张高质量JPEG图像,涵盖谷仓、桥梁、城堡、清真寺、摩天大楼、体育场、庙宇和风车等八类典型建筑结构,每类均衡分配1,680张图片。所有图像均来源于Pexels平台,在CC-BY-4.0许可下开放使用,并由Saugani与Greyscope团队合作精心整理与标注。该数据集以其均衡的类别分布、严格的采集与过滤流程,为建筑领域细粒度分类研究提供了标准化基准,有效激发了学术界与工业界在建筑风格自动化识别方向上的探索。
当前挑战
Arch-Building-Dataset所面对的挑战可归纳为两个层面。在领域问题层面,建筑图像分类因不同类别间几何形态与结构特征的相似性而极具困难,如城堡与庙宇、传统风车与谷仓的区分,需模型具备极高细粒度判别能力;此外,光照、视角、天气等环境因素的多样性进一步加大了特征提取与泛化难度。在数据集构建层面,挑战同样严峻:多源图片采集需通过Pexels API、BrightData及Selenium等多模式爬虫协同才能覆盖各子类多样性;实施pHash与SHA256双重去重算法,并辅以人工审查以确保数据纯净;为平衡高质量与低存储,采用自适应压缩算法将每张图片控制在200KB以内,整个过程兼具技术复杂性与人力资源投入,体现了对数据标准化的极致追求。
常用场景
经典使用场景
在计算机视觉领域,建筑图像分类一直是细粒度视觉识别中的重要研究方向。Arch-Building-Dataset 以其精心策划的八类建筑图像(谷仓、桥梁、城堡、清真寺、摩天大楼、体育场、寺庙、风车)为基础,每类包含1680张图片,总计13440张,为多类别图像分类任务提供了高度平衡且经过人工精校的数据支撑。该数据集的经典使用场景聚焦于训练和评估深度学习模型在建筑风格与结构识别上的性能,尤其适用于需要区分外观相似的宗教建筑(如清真寺与寺庙)或功能性结构(如谷仓与风车)的细粒度分类挑战。研究者可借此探索卷积神经网络或视觉Transformer在建筑领域特征提取与泛化能力上的表现,推动建筑图像自动理解技术的发展。
衍生相关工作
围绕Arch-Building-Dataset,已衍生出多个具有代表性的相关工作。其官方配套的EfficientNetV2分类模型结合GeM池化与焦点损失函数,为建筑分类任务提供了开箱即用的强基线;Gradio交互式演示空间则降低了非技术人员的使用门槛。这些工作启发了后续研究者在建筑领域探索数据增强策略(如风格迁移扩充)、跨域迁移学习(从开源建筑图像到航拍或街景数据),以及模型轻量化方向。数据集本身的高质量与结构化组织方式,也促使学者将其用作预训练微调的下游任务基准,或与语义分割、生成式模型等方向结合,形成从分类到理解再到创造的完整建筑视觉智能研究链条。
数据集最近研究
最新研究方向
在当前精细视觉分类(FGVC)与建筑遗产数字化保护的交汇前沿,该数据集为全球建筑风格识别提供了高质量的基准资源。随着计算机视觉在城市规划、智能导览及文化遗产自动化建档等场景中的深度融合,研究者正聚焦于如何在海量网络图像中精准区分谷仓、清真寺、摩天大楼等八类具有显著地域与文化特征的建筑结构。数据集通过多源爬取、感知哈希去重及严格的质量过滤流程,构建了类间均衡且版权清晰的样本库,尤其支撑了基于EfficientNetV2与GeM池化的轻量级分类模型研究,推动了从传统地标识别向涵盖功能性建筑(如体育场与风车)的细粒度判别演进。其采用CC-BY-4.0许可并明确排除人物肖像,为伦理合规的视觉理解实验树立了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务