遇见数据集

carimages-rights

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

CarImages Rights Manifest 是一个汽车照片版权解析索引数据集,包含 26,118 张来自 Wikimedia Commons 的 Creative Commons 和公有领域汽车照片的元数据。该数据集不包含任何图像,仅提供元数据和 URL,因此不会传播相同方式共享(ShareAlike)义务。其创建目的是解决 Wikimedia Commons 上许可证记录不一致的问题,将每张照片的许可证解析为三个机器可读的布尔值(是否需要署名、是否要求相同方式共享、是否允许衍生作品),从而方便用户大规模判断哪些照片可用于商业用途且无需 Copyleft 义务。数据集按许可证类别统计:无需署名(CC0/公有领域)5,839 张,仅需署名(CC BY 家族)6,510 张,署名+相同方式共享(CC BY-SA 家族)13,769 张,无衍生作品 0 张,需要署名但无作者记录 0 张。数据集涵盖 3,337 位摄影师,并提供了即用的信用字符串。每条记录包含以下字段:photo_id(稳定标识符)、sha256(文件哈希)、phash(64 位感知哈希,用于近重复检测)、source_page_url(Wikimedia Commons 文件页面)、source_url(图像文件 URL)、source_filename(Commons 文件名)、license_code/license_name/license_url(解析后的许可证信息)、attribution_required/share_alike/allows_derivatives(解析后的义务布尔值)、creator_name/creator_url(摄影师信息)、credit_text(即用署名字符串)、copyright_notice(版权声明)、width/height(图像尺寸)、dominant_hex(整帧主色,非车身颜色指示器)、carimages_url(在 carimages.org 上的目录页 URL)。使用示例:可通过 HuggingFace Datasets 加载并过滤出可商业使用且无 Copyleft 义务的照片。数据集以 CC0 1.0 许可证发布,元数据编译权已放弃,但照片本身仍受各自许可证保护。数据收集于 2026-07-27 至 2026-08-02,许可证解析为自动化过程,准确但不构成法律意见。数据集提供 CSV、JSON Lines 和 Frictionless Data 描述文件。建议引用 Zenodo DOI (10.5281/zenodo.21683771) 以确保可复现性。

CarImages Rights Manifest is a dataset of car photo copyright resolution index, containing metadata of 26,118 Creative Commons and public domain car photos from Wikimedia Commons. The dataset does not contain any images, only metadata and URLs, thus not propagating ShareAlike obligations. It was created to address inconsistent license records on Wikimedia Commons by parsing each photos license into three machine-readable booleans (attribution required, share-alike required, derivatives allowed), enabling users to easily determine which photos can be used commercially without Copyleft obligations. The dataset includes license category statistics: no attribution required (CC0/public domain) 5,839 photos, attribution only (CC BY family) 6,510 photos, attribution + share-alike (CC BY-SA family) 13,769 photos, no derivatives 0 photos, attribution required but no author record 0 photos. It covers 3,337 photographers and provides ready-to-use credit strings. Each record contains fields: photo_id (stable identifier), sha256 (file hash), phash (64-bit perceptual hash for near-duplicate detection), source_page_url (Wikimedia Commons file page), source_url (image file URL), source_filename (Commons filename), license_code/license_name/license_url (parsed license information), attribution_required/share_alike/allows_derivatives (parsed obligation booleans), creator_name/creator_url (photographer info), credit_text (ready-to-use attribution string), copyright_notice (copyright notice), width/height (image dimensions), dominant_hex (overall frame dominant color, not a car body color indicator), carimages_url (catalog page URL on carimages.org). Usage example: load via HuggingFace Datasets and filter for commercially usable photos without Copyleft obligations. The dataset is released under CC0 1.0 license, with metadata compilation rights waived, but photos themselves are protected by their respective licenses. Data collected from 2026-07-27 to 2026-08-02, license parsing is automated and accurate but does not constitute legal advice. The dataset is provided in CSV, JSON Lines, and Frictionless Data description files. Suggested citation: Zenodo DOI (10.5281/zenodo.21683771) for reproducibility.

创建时间:
2026-07-30
原始信息汇总

数据集概述

CarImages Rights Manifest 是一个由 carimages.org 发布的权利解析索引,涵盖 26,118 张来自 Wikimedia Commons 的 Creative Commons 和公有领域汽车照片。该数据集不包含任何图像,仅包含元数据和 URL,因此不会对使用者产生 ShareAlike 义务。每张照片仍受其各自行中记录的许可证约束,其中 license_url 字段为权威依据。

许可证与义务分布

数据集将每个许可证解析为三个机器可读的义务布尔值,分布如下:

义务类型 照片数量
无需署名(CC0 / 公有领域) 5,839
仅需署名(CC BY 系列) 6,510
署名 + 相同方式共享(CC BY-SA 系列) 13,769
禁止演绎(NoDerivatives) 0
要求署名但未记录作者 0

数据集记录了 3,337 位摄影师的署名信息。

数据集内容

该数据集为 CSV(carimages-rights.csv)格式,每行对应一张照片,主要字段包括:

  • 标识与哈希photo_id(稳定标识)、sha256(文件哈希)、phash(64 位感知哈希,用于近似重复检测)
  • 来源信息source_page_url(Wikimedia Commons 文件页,权威记录)、source_url(源图像文件)、source_filename(Commons 文件名)
  • 许可证信息license_codelicense_namelicense_url(权威许可证链接)
  • 义务解析attribution_requiredshare_alikeallows_derivatives
  • 摄影师信息creator_namecreator_urlcredit_text(可直接使用的署名字符串)、copyright_notice
  • 图像属性widthheight(固有尺寸)、dominant_hex(整帧主色调,不代表车身颜色)
  • 关联页面carimages_url(carimages.org 上的目录页,已解析许可、署名和摄影师信息)

数据来源与限制

  • 数据于 2026-07-27 至 2026-08-02 从 Wikimedia Commons 抓取。
  • 许可证解析为自动化处理,虽认为准确但不构成法律意见source_page_url 为权威记录。
  • 对于要求署名但未记录作者的文件已排除,因为此类文件无法合法复用。
  • 数据集中摄影师贡献高度集中,使用者应予以考虑。
  • 该数据集不是汽车摄影的中立样本,而是基于精选制造商类别列表抓取,并经过严格的许可证筛选。

许可声明

  • 此元数据编译以 CC0 1.0(公有领域奉献)发布,同时放弃任何特殊数据库权利。
  • 照片本身不受此奉献覆盖,每张照片仍需遵循其行中记录的许可证,以 license_url 字段为准。
  • Creative Commons 许可证仅涵盖摄影师的版权,不授予任何商标、商业外观或图像中人物/财产肖像权。

使用方式

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset ds = load_dataset("carimages/carimages-rights", split="train")

过滤出可商业使用且无 copyleft 义务的照片

permissive = ds.filter(lambda r: not r["share_alike"] and not r["no_derivatives"])

引用与版本

  • 数据集可通过 Zenodo DOI 永久引用:https://doi.org/10.5281/zenodo.21683771
  • 当前版本:2026-08
  • 此 Hugging Face 副本跟踪实时存档(carimages.org/data/),可能领先于 DOI 版本。引用时请使用 DOI 以获得可复现性。
  • 文件包含:CSV、JSONL(相同记录)及 datapackage.json(Frictionless Data 描述符)。

相关资源

搜集汇总
数据集介绍
carimages-rights 数据集图片
构建方式
在开放图像资源日益丰富但许可状态繁杂的背景下,该数据集通过自动化爬取与解析流程构建而成。研究者从Wikimedia Commons中精选制造商分类下的汽车照片,检索时间跨度为2026年7月27日至9月6日,并采用“失败即关闭”的许可过滤机制,剔除无法合规再利用的文件。每张照片的许可模板经解析后转化为三项机器可读义务——署名要求、相同方式共享要求与衍生作品许可——并同步提取摄影师信息、SHA-256哈希、64位感知哈希、图像尺寸及画面主色调,最终以CSV与JSONL格式发布,共计61,118条记录。
使用方法
使用者可借助Hugging Face datasets库加载该数据集,通过过滤条件快速筛选出可安全用于商业用途且无copyleft义务的照片,例如排除share_alike与no_derivatives为真的记录。每行数据均提供源页面链接与许可URL,实际再利用照片时须以该URL记录的许可条款为准,并依照credit_text完成署名。若需直观浏览照片内容,可访问carimages.org按品牌、世代或摄影师分类的页面,而元数据中的carimages_url则提供了从单条记录直达对应目录页的路径。
背景与挑战
背景概述
伴随开放图像资源在学术研究与产业应用中的广泛渗透,图像许可信息的机器可读化成为制约数据复用的关键瓶颈。维基共享资源虽汇聚海量汽车主题照片,却以非结构化的维基模板记录授权条款,致使商业可用性与copyleft义务的批量判定难以实现。carimages.org于2026年构建的carimages-rights数据集,正是对这一痛点的系统性回应:其覆盖61,118幅知识共享及公有领域汽车照片,将每幅作品的许可状态归纳为署名、相同方式共享与衍生许可三项布尔义务,并同步记录摄影者、信用字符串及感知哈希等元数据。该数据集不包含任何图像实体,仅以元数据与来源链接形式发布,从而在合规层面规避了ShareAlike义务的传播,为大规模图像许可分析与自动化合规筛查提供了可复用的基础设施。
当前挑战
该数据集所回应的领域问题在于:如何在保留来源可靠性的前提下,将异构、模糊且法律语义复杂的图像授权信息转化为可批量计算的结构化义务标签,从而支撑商业可用性筛查与合规决策。构建过程中的挑战则体现于多重维度:其一,维基共享资源的许可声明以模板形式存在,格式不一且存在署名要求与作者记录缺失并存的情形,此类文件因无法合法复用而被排除,其排除本身即构成对源语料质量的揭示;其二,数据集的采样框架并非中性抽样,而是源自策展式制造商类别的爬取结果,且贡献者集中度极高,少数摄影者占据语料的大量份额,用户须对此偏差保持警觉;其三,许可解析虽经自动化处理,然其准确性仍受限于源页面记录,不构成法律意见,且知识共享许可仅覆盖摄影者著作权,不涉及商标、商业外观或人物肖像权,使用者在复用照片时仍须面对这些悬而未决的权利风险。
常用场景
经典使用场景
在数字图像资源管理与计算社会科学交叉领域,针对大规模开放图像语料的权利状态解析与合规复用构成了基础性需求。carimages-rights数据集最为经典的使用场景即面向机器学习的图像数据集构建流程中的许可过滤与归属溯源环节:研究者通过载入该元数据索引,借助attribution_required、share_alike与allows_derivatives三个布尔义务字段,对六万余幅车辆照片进行批量化的权利状态判定,从而在模型训练语料筹备阶段筛选出可安全用于商业目的且不附带传染性 copyleft 义务的图像子集,并利用credit_text与creator_url完成合规署名信息的自动化生成。
解决学术问题
该数据集所直面的核心学术困境,在于维基共享资源等众包平台以异构维基模板记录许可信息,致使大规模图像语料的权利解析长期缺乏可扩展的机器可读方案,研究者往往受困于人工核验的成本壁垒而难以开展严谨的合规性研究。carimages-rights通过将每幅照片的许可状态归一化为三项可计算义务,并辅以SHA-256与感知哈希、摄影师标识及来源页面URL,有效弥合了非结构化权利声明与算法可处理元数据之间的鸿沟。其意义不仅在于为图像权利元数据研究提供了可复现的基准,更以“零图像分发”的设计规避了ShareAlike义务的传播风险,为开放数据伦理与知识产权合规的交叉研究树立了方法论参照。
实际应用
在产业实践层面,该数据集为内容平台、广告创意机构与自动驾驶视觉团队提供了可审计的图像合规基础设施。产品团队可依托其许可义务字段构建自动化的素材准入管线,在车辆图像进入设计稿或训练集之前完成商业可用性与署名要求的双重筛查;数字资产管理系统则可利用感知哈希实现近重复检测,结合carimages_url与credit_text生成符合知识共享协议要求的归属声明。对于欲在公开图像库中检索特定车型而又不愿承担法律风险的开发者而言,该索引以零图像载荷的方式交付了可直接引用的来源链接与权利凭证,显著降低了开放资源再利用的合规门槛。
数据集最近研究
最新研究方向
在开放数据治理与机器可读许可元数据日益受到重视的背景下,carimages-rights数据集将Wikimedia Commons中逾六万张汽车照片的著作权状态解析为三项布尔义务,为大规模合规复用提供了可计算的基础设施。当前研究前沿集中于以许可元数据驱动的自动化合规过滤、基于感知哈希的近似重复检测,以及摄影者集中度对语料偏差的影响评估。该数据集回应了生成式视觉模型训练数据溯源与版权风险审计的迫切需求,使研究者能够在训练前系统性地筛选出可商业使用且无传染性义务的图像,对构建负责任的数据采集流程与可复现的模型数据文档具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务