VehiclesDB
收藏数据链接:
官方服务:
资源简介:
VehiclesDB是一个开放的车辆数据目录,包含来自14个国家官方注册的车辆信息,涵盖19,282个车型、933个制造商和6种类型(汽车、摩托车、轻便摩托车、货车、卡车、公交车)。数据集提供流行度和可用性信息,永久免费使用,采用CC-BY 4.0许可证。
VehiclesDB is an open vehicle data directory containing officially registered vehicle information from 14 countries, covering 19,282 vehicle models, 933 manufacturers, and 6 categories: passenger cars, motorcycles, mopeds, vans, trucks and buses. The dataset provides popularity and availability-related information, is permanently free for use, and is licensed under CC-BY 4.0.
创建时间:
2026-06-24
原始信息汇总
VehiclesDB 数据集概述
基本信息
- 数据集名称:VehiclesDB — open vehicle data
- 最新版本:Dataset
2026.07.0 - 数据规模:18,556 个车型 · 928 个品牌 · 6 种车辆类型 · 14 个国家
- 许可协议:CC-BY 4.0(永久免费,包括商业用途)
车辆类型分布
| 类型 | 车型数 | 品牌数 |
|---|---|---|
| 🚗 汽车(car) | 8,785 | 312 |
| 🏍️ 摩托车(motorcycle) | 5,916 | 260 |
| 🛵 轻便摩托车(moped) | 1,304 | 288 |
| 🚐 面包车(van) | 1,119 | 137 |
| 🚚 卡车(truck) | 1,043 | 96 |
| 🚌 巴士(bus) | 389 | 93 |
数据来源
- 覆盖 14 个国家(NL, GB, ES, FI, LU, IE, DE, US, CA, NZ, MY, TH, UA, AR)
- 仅使用官方、开放许可的车辆注册、型式认证和政府统计数据
- 每条记录均需两个独立官方来源一致或单一来源中的车队计数明确无误才会收录
- 从约 76,000 个原始车辆名称变体中筛选出真实存在的车型
数据文件结构
核心目录 catalog/<kind>/
makes.json:品牌信息(ID, slug, 名称)models.json:完整车型记录(ID, 品牌ID, slug, 名称, 类型, 车身类型, 可用性, 流行度, 来源, 交叉引用)
分发文件 dist/
vehicles.json:嵌套的品牌→车型结构vehicles.min.json:数组压缩版本(约小 60%)vehicles.csv:扁平表格vehicles.parquet:Parquet 格式(适用于 pandas/DuckDB/Hugging Face)catalog.sqlite:完整目录的 SQLite 单文件数据库
数据特性
- ID 永久稳定:由类型 + 品牌 slug + 车型 slug 构成(如
volkswagen/golf) - 重命名时建立别名,不删除数据
- 可选键缺失表示“尚未收录”,而非不存在
- 流行度十分位数:来自实际注册/车队计数(
confidence: "measured")或公众关注信号代理(confidence: "proxy") - 年份范围:来自注册数据,精确度 ±1 年
获取方式
bash
JSON 格式(CDN,始终指向最新版)
curl -sL https://cdn.jsdelivr.net/gh/vehiclesdb/vehiclesdb@latest/dist/vehicles.json
SQL 查询示例
sqlite3 catalog.sqlite "SELECT name FROM models WHERE kind=car ORDER BY global_popularity_decile LIMIT 10"
使用限制
- 不适用于 VIN 解码、车辆估值、车辆历史或保险评级数据
- 可用性是存在的证明,不代表车辆在该市场正式销售(灰色进口也算在内)
- 缺失表示尚未收录,不代表该车型不存在
开放承诺
- 核心骨架永久开放(ID、名称、分类结构、车身类型、年份范围、可用性证据、流行度、型式认证交叉引用)
- 付费服务限于深度数据、规格配置、图片、绝对流行度计数和时间序列、SLA、托管 API、商业许可
- 溯源保证:每条记录附有来源,每个来源的许可协议文本存档于仓库中
搜集汇总
数据集介绍

构建方式
VehiclesDB的构建根植于全球车辆数据的碎片化与异构性困境。研究者从四大洲14个国家的官方注册机构、车型认证目录及政府统计中整合原始数据,涵盖荷兰、英国、西班牙、芬兰、卢森堡、爱尔兰、德国、美国、加拿大、新西兰、马来西亚、泰国、乌克兰和阿根廷。为确保记录的真实性,项目采用双重校验机制:当两个独立官方来源一致确认,或单一来源显示无可疑错误的庞大车流数据时,模型方被收录。这种严谨的交叉验证将约76,000个原始车辆名称变体精简至实际存在的车型,消除了注册噪声。所有数据以CC-BY 4.0协议永久开源,版本化更新确保了可追溯性。
特点
该数据集的核心特点在于其结构化、去冗余与全球视角。它收录了928个品牌、18,556个车型,涵盖汽车、摩托车、轻便摩托车、货车、卡车及客车六大类别。每个记录均嵌入来源证据(sources)、存在性证据(availability)及流行度分位数(popularity),其中流行度基于真实注册数据或公共注意力信号度量,并清晰标注置信度(measured或proxy)。ID系统永久稳定,车型通过品牌与型号slug(如volkswagen/golf)唯一标识,重命名仅产生别名,删除操作被禁止,缺失的可选键仅意味着尚未编录,而非数据缺失。这种设计保证了长期使用的兼容性与可靠性。
使用方法
用户可通过多种格式便捷访问VehiclesDB。最直接的方式是从CDN获取压缩的JSON文件,如vehicles.json或vehicles.min.json,适用于前端或轻量应用。对于数据分析场景,提供了CSV和Parquet格式的扁平化表格,可无缝接入pandas、DuckDB等工具。SQLite版本catalog.sqlite支持标准SQL查询,便于数据库集成。Ruby/Rails用户可利用专属gem,它内置离线快照、下拉选择器、验证器及流行度访问器,还包含MCP服务器以支持AI代理。高级用户可访问catalog/目录下的全保真分类数据,包含按国家细分的流行度排名、来源ID及型式认证对照信息。所有文件均通过manifest.json索引,确保版本的清晰管理。
背景与挑战
背景概述
VehiclesDB是一个由社区驱动的开源车辆数据库项目,创建于2026年,由来自四大洲14个国家的官方车辆登记机构共同维护。其核心研究问题是如何构建一个可靠、统一且持续更新的全球车辆名录,涵盖品牌、型号、车身类型及地域分布等关键信息。该数据集整合了超过18,000种车型与928个品牌,通过交叉验证确保每一条记录的真实性,填补了车辆领域开放数据资源的空白。其对相关领域的影响力在于为交通研究、汽车数据分析、智能交通系统及政策制定提供了标准化、可溯源的基础数据基石,推动了车辆信息的透明化与可复现性。
当前挑战
VehiclesDB所解决的领域挑战在于车辆信息的高度碎片化与不一致性,例如不同国家或机构对同一车型的命名与分类差异,以及如何从约76,000个原始名称变体中精确识别出真实车型。构建过程中的挑战包括:1) 数据源的多样性与异质性,需兼容14个国家官方登记、型式认证及政府统计数据的格式与法律许可;2) 确保数据质量与版本稳定性,通过至少两个独立来源交叉验证,并建立自动化构建流程以抵御上游数据漂移;3) 平衡开放性(CC-BY 4.0)与资金可持续性,避免此前同类项目常见的免费服务中途收费或关闭风险。
常用场景
经典使用场景
在全球汽车工业的庞杂生态中,车辆型号的命名与分类常因地域、法规及市场策略的差异而支离破碎,VehiclesDB应运而生,成为首个横跨四大洲、融合14国官方车辆登记数据的开源车辆目录。其最经典的使用场景在于为汽车数据标准化提供了高可信度的参照基准——无论是车企进行竞品分析、研究者构建车型流通模型,还是保险与金融系统自动识别车辆类型与品牌归属,均可通过该数据集中的唯一稳定标识符(如kind/make/model组合)实现跨数据源的精确匹配与对齐,从而终结了过去依赖商业数据库或零散爬虫数据时常见的混淆与冲突。
衍生相关工作
围绕着VehiclesDB这一开源基础设施,已涌现出涵盖多种技术栈的衍生工作与生态组件。Ruby社区借助官方gem实现了离线快照、表单助手与流行度访问器的无缝集成,进而构建了针对AI代理的MCP服务器,使智能体能够以结构化方式查询车辆信息。在数据科学领域,Parquet与CSV格式的发布直接降低了Python与SQL分析的门槛,催生了多篇基于该数据集的车型扩散模式分析论文与可视化仪表盘项目。更为关键的是,其构建过程中沉淀的跨源融合方法论与校验脚本,亦被其他领域的数据聚合项目借鉴,成为开放数据工程实践的范式参考。
数据集最近研究
最新研究方向
在全球汽车产业数字化转型与智能交通系统加速部署的背景下,VehiclesDB作为首个横跨4大洲14国官方车辆登记数据的开放目录,正推动车辆本体知识图谱在跨区域车型匹配、新车准入检测及流动性分析中的前沿应用。该数据集通过融合2.8万余条经双源验证的车型记录与持续更新的月度版本机制,为自动驾驶规控系统、二手电动车残值评估模型及城市交通碳排因子计算提供了统一且可溯源的基准参照。其开放的CC-BY 4.0许可协议与版本化ID管理,有效规避了此前该领域数据孤岛与商业寡头频繁政策性断供的风险,成为连接真实道路车辆存量与数字孪生体可信映射的关键基础设施。
以上内容由遇见数据集搜集并总结生成




