遇见数据集

mx-vehicle-catalog

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Mexico Vehicle Catalog Reference 数据集是一个结构化参考分类法,涵盖了在墨西哥市场销售或常见的车辆信息。该数据集包含112个品牌、3,011个车型条目和8,380个命名版本/配置,分布在8个顶级车辆类别中:Autos y Camionetas(汽车和皮卡)、Motos(摩托车)、Vehículos Pesados(重型车辆)、Camiones(卡车)、Otros Vehículos(其他车辆)、Autos de Colección(收藏车)、Náutica(船舶)以及Colectivos y Autobuses(巴士和客车)。每个车型条目包括生产年份范围和车身类型;在细粒度文件中,每一行对应一个命名版本/配置。数据集由Arcade Motors MX(一个墨西哥免费车辆买卖分类广告市场)整理和维护,用于支持其网站的分类→品牌→车型→版本级联搜索和列表表单。数据集包含两个CSV文件:mx_vehicle_catalog.csv(每行一个命名版本)和mx_vehicle_models.csv(每行一个车型,版本信息合并在一列中)。字段包括类别标识、类别名称、品牌、车型、车身类型、生产起始年份、生产结束年份、版本/配置(或版本列表)以及版本数量(仅车型文件)。该数据集旨在用于车辆分类、级联表单自动完成、列表归一化以及墨西哥汽车市场的覆盖率分析,但不包含定价、里程或卖家数据。数据是基于公开车辆命名法编译的事实参考结构,而非从市场抓取。数据集采用CC-BY-4.0许可证发布。

Mexico Vehicle Catalog Reference dataset is a structured reference taxonomy covering vehicle information sold or commonly available in the Mexican market. This dataset contains 112 brands, 3,011 model entries, and 8,380 named versions/configurations, distributed across 8 top-level vehicle categories: Autos y Camionetas (Cars and Pickup Trucks), Motos (Motorcycles), Vehículos Pesados (Heavy Vehicles), Camiones (Trucks), Otros Vehículos (Other Vehicles), Autos de Colección (Classic Cars), Náutica (Marine Vessels), and Colectivos y Autobuses (Buses and Coaches). Each model entry includes its production year range and body type; in the fine-grained file, each row corresponds to one named version/configuration. The dataset was compiled and maintained by Arcade Motors MX, a Mexican free vehicle classifieds marketplace, and is used to support its website's category→brand→model→version cascading search and listing forms. The dataset includes two CSV files: mx_vehicle_catalog.csv (one named version per row) and mx_vehicle_models.csv (one model per row, with version information consolidated in one column). Fields include category ID, category name, brand, model, body type, production start year, production end year, version/configuration (or version list), and version count (only present in the model file). This dataset is intended for use cases including vehicle classification, cascading form autocomplete, listing normalization, and coverage analysis of the Mexican automotive market, but does not include pricing, mileage, or seller data. The data is a factual reference structure compiled based on public vehicle nomenclature, rather than scraped from the market. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-07-14
原始信息汇总

数据集概述

Mexico Vehicle Catalog Reference 是一个面向墨西哥汽车市场的结构化参考分类数据集,涵盖车辆品牌、型号和配置级别(trim/version)的层级关系。

核心统计

  • 112 个品牌
  • 3,011 个车型条目
  • 8,380 个具名配置/版本
  • 8 个顶级车辆类别:Autos y Camionetas, Motos, Vehículos Pesados, Camiones, Otros Vehículos, Autos de Colección, Náutica, Colectivos y Autobuses

数据文件

文件 行数 说明
data/mx_vehicle_catalog.csv 8,380 每行对应一个具名配置/版本
data/mx_vehicle_models.csv 3,011 每行对应一个车型,配置以单列合并

字段说明

  • category_slug / category:8个顶级车辆类别之一
  • brand:制造商(例如 "Acura"、"Honda")
  • model:车型名称(例如 "TLX")
  • body_type:车身类型(例如 "sedan"、"suv"、"pickup")
  • year_start / year_end:该车型世代的生产年份范围
  • trim(版本文件)/trims(车型文件):具名配置/版本,例如 "TLX 3.5 V6"、"TLX Advance"
  • trim_count(仅车型文件):该车型下的配置数量

数据用途

作为车辆分类、级联表单自动补全、列表规范化以及墨西哥汽车市场覆盖分析的参考/查询分类数据。不包含定价、里程或卖家信息,并非价格或销售数据集。

数据来源与许可

数据编译为事实性参考结构(品牌/车型/配置/年份范围/车身类型),非从任何市场抓取;数值反映所标注年份的公开车辆命名惯例。许可协议为 CC-BY-4.0,复用需注明出处。

搜集汇总
数据集介绍
mx-vehicle-catalog 数据集图片
构建方式
该数据集以结构化参考分类法为基础,系统化收录了墨西哥市场常见或已售车辆的完整信息体系,涵盖112个品牌、3011个车型条目及8380个命名配置/版本。数据源自Arcade Motors MX平台,通过专业编纂而非网络爬取构建,每项条目均包含生产年份区间与车身类型字段,细粒度配置文件中则详细记录了各车型的具体配置名称,如“TLX 3.5 V6”等。
特点
数据集覆盖八大车辆类别,包括轿车与皮卡、摩托车、重型车辆、卡车、其他车辆、收藏车、船舶及客车与巴士,展现了墨西哥汽车市场的全貌。其独特之处在于作为分类参考而非定价数据集,不包含售价、里程或卖家信息,专注于提供纯净的车型识别与分类基准,支持级联搜索和表单自动补全功能。
使用方法
该数据集适用于车辆分类系统的参考查询、级联表单的自动补全、上市信息标准化以及墨西哥汽车市场的覆盖范围分析。用户可通过两个配置文件灵活调用:细粒度版本(trims)提供每个配置的单行记录,模型版本(models)则汇总各车型及其配置列表,适合嵌入分类引擎或构建行业调研数据库。
背景与挑战
背景概述
在墨西哥汽车市场中,车辆分类体系的标准化是构建高效信息检索与数据分析系统的基础。由Arcade Motors MX团队于近年创建的mx-vehicle-catalog数据集,旨在为墨西哥市场提供一套结构化的车辆分类参考知识库。该数据集涵盖112个品牌、3011个车型及8380个细分版本,横跨8大车辆类别,并标注了生产年份范围与车身类型。作为其免费分类广告平台的核心支撑,该数据集在车辆分类搜索、表单自动补全及列表规范化中发挥关键作用,为墨西哥汽车市场的数字化生态建设提供了基础性参照。
当前挑战
该数据集所应对的领域挑战在于解决墨西哥车辆市场中品牌、车型与版本命名不统一所引发的分类与检索困难,其结构化的分类体系为搜索标准化与市场覆盖分析提供了解决路径。而在构建过程中,主要挑战在于从公开的车辆命名规范中系统性地整理覆盖面广泛且无遗漏的数据条目,确保112个品牌、3011个车型及8380个版本在生产年份、车身类型等维度的准确性,同时避免受任何带有价格或销售数据的商业平台干扰,保持分类参考的纯粹性与可靠性。
常用场景
经典使用场景
mx-vehicle-catalog数据集作为墨西哥汽车市场结构化的品牌、车型与配置参考分类体系,其经典用途在于提供级联搜索与表单自动补全功能的数据支撑。研究者可借助此数据集构建车辆分类引擎,实现从车辆大类到品牌、再到具体车型与配置版本的多级筛选逻辑,极大提升用户在二手车分类平台上的浏览与检索效率。数据集涵盖8大车辆类别、112个品牌及8380个配置版本,成为构建墨西哥市场专属车辆目录索引的标准基础。
解决学术问题
在学术研究层面,该数据集有效解决了墨西哥汽车市场中缺乏统一、可机读的车辆分类标注体系这一痛点。传统汽车数据研究多依赖于美国或欧洲市场的分类标准,难以直接适用于墨西哥市场特有的车辆品牌分布与配置命名习惯。该数据集的发布填补了这一空白,为跨语言与跨市场的本体对齐研究、车辆配置演化分析以及区域性车辆命名规范化提供了基准资源,推动了拉丁美洲区域汽车数据标准化研究的发展。
衍生相关工作
基于mx-vehicle-catalog数据集,研究人员已衍生出多项拓展工作。例如,有工作利用该分类体系联合车辆销售数据建模,分析不同车型配置在墨西哥各州的保有率时空演变。另有一些研究将其作为监督信号,训练面向西班牙语的车辆命名实体识别模型,以从非结构化广告文本中抽取出品牌、车型与配置三元组。此外,该数据集还与北美车型数据库进行跨数据集对齐,用于评估区域间车辆命名差异对跨域推荐系统的影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务