遇见数据集

Classic sample datasets in Parquet

收藏
github2026-08-02 更新2026-08-04 收录
官方服务:

资源简介:

一组知名、公开可用的演示数据集,已转换为Apache Parquet格式,以便在Databricks、Snowflake、BigQuery等现代数据平台或本地使用DuckDB和Polars时轻松使用。

A collection of well-known, publicly available demonstration datasets that have been converted to the Apache Parquet format, enabling seamless utilization across modern data platforms such as Databricks, Snowflake, BigQuery, or locally with DuckDB and Polars.

创建时间:
2026-08-02
原始信息汇总

数据集详情总结

该数据集仓库提供了一系列知名公开演示数据集的 Apache Parquet 格式转换版本,便于在现代数据平台(如 Databricks、Snowflake、BigQuery)或本地工具(如 DuckDB、Polars)中使用。

数据集总览

仓库中包含 8 个经典数据集,均按原样转换,数据值保持不变,仅进行格式转换。每个数据集文件夹包含:

  • parquet/:每个源表对应一个 .parquet 文件
  • SOURCE.md:原始数据集名称、发布者、规范来源链接、许可证及逐表清单
  • LICENSE-<publisher>.txt:原始许可证全文

表名已规范化为 snake_case 格式。

数据集列表

数据集 描述 表数量 许可证 发布者
adventure_works 微软自行车制造商数据仓库(AdventureWorksDW),经典星型模式 29 MIT Microsoft
chinook 数字媒体商店(类似iTunes):艺术家、专辑、曲目、发票 11 MIT Luis Rocha
foodmart 杂货连锁销售/库存仓库;经典OLAP/MDX参考数据集 5 EPL v1.0 Mondrian(Julian Hyde / Hitachi Vantara)
northwind 微软特色食品进出口示例(Northwind Traders) 13 MIT Microsoft
pagila Sakila的PostgreSQL移植版(DVD租赁),另含film_embedding向量表 16 MIT Devrim Gündüz
sakila MySQL标准的DVD租赁示例数据集 16 BSD-3-Clause MySQL AB / Oracle
steelwheels Pentaho的比例模型车辆零售商示例(来自Mondrian测试套件) 13 EPL v1.0 Mondrian(Julian Hyde / Hitachi Vantara)
wide_world_importers_dw 微软现代分析示例(WideWorldImportersDW):维度、事实、ETL暂存 29 MIT Microsoft

转换说明

  • 仅执行格式转换,不修改底层数据值
  • 两个数据集有少量、明确记录的表示变更(详见各数据集的SOURCE.md中的转换说明):
    • wide_world_importers_dw:空间列以Well-Known Binary格式存储
    • pagila:分区表合并为一个文件

许可与归属

  • 数据集按原始许可证重新分发(MIT、BSD-3-Clause、EPL v1.0),每个文件夹包含完整许可证文本及所需的版权/归属声明
  • 仓库自身的贡献(README、文件夹结构、转换工作)以 MIT 许可证 发布,仅适用于该贡献本身,不重新许可数据集
搜集汇总
数据集介绍
Classic sample datasets in Parquet 数据集图片
构建方式
本数据集汇集了业界广为人知的公开演示数据集,并将其统一转换为Apache Parquet列式存储格式,以适配现代数据平台如Databricks、Snowflake、BigQuery及本地工具DuckDB和Polars。每个数据集独立成文件夹,内含Parquet格式的数据文件、详尽记载原始数据来源与许可信息的SOURCE.md文档,以及对应发布者的许可协议文本。表格名称统一采用snake_case规范,数据值保持不变,仅进行格式转换。少数数据集存在清晰标注的表示性调整,如空间列以WKB格式存储或分区表合并,相关说明记录于各自的SOURCE.md中。
特点
该数据集集合涵盖八套经典样例,包括AdventureWorks、Chinook、FoodMart、Northwind、Pagila、Sakila、SteelWheels及WideWorldImportersDW,覆盖零售、媒体、仓储、餐饮等多领域业务场景。所有数据严格遵循原始版权许可(MIT、BSD-3-Clause、EPL v1.0),确保合规重分发。转换过程忠实于原始数据,仅调整存储格式,保障数据完整性。此外,表格命名标准化为snake_case,便于跨平台识别与集成,而源数据目录中附带的详细溯源文档增强了数据的可信度与可追溯性。
使用方法
使用者可直接从各数据集文件夹中的parquet子目录加载Parquet文件到支持该格式的查询引擎,如DuckDB或Polars,通过相应的API或SQL接口进行数据探索与分析。每个数据集的SOURCE.md提供了原始数据背景与许可指引,使用时应遵循其中的归属要求。对于已分区或含特殊类型数据的数据集,应查阅转换备注以确保正确解析。该集合适用于教学演示、基准测试及数据工程实践,用户可依据业务需求灵活选用相应数据集进行建模与验证。
背景与挑战
背景概述
随着大数据与云原生数据平台的蓬勃发展,Apache Parquet作为一种高效的列式存储格式,凭借其卓越的压缩性能和查询优化能力,已成为现代数据工程与分析的基石。该数据集由社区开发者于近期创建,旨在将业界广泛使用的经典演示数据集(如Microsoft的AdventureWorks、PostgreSQL的Pagila等)统一转换为Parquet格式,以降低学习与实践门槛,促进数据平台间的无缝协作。项目核心研究问题聚焦于如何在保持数据原貌的前提下,完成格式转换并确保其在不同引擎(如Databricks、Snowflake、DuckDB)中的可用性。该数据集覆盖了星型模型、OLAP多维分析、向量嵌入等多种场景,为数据从业者提供了丰富的实验基准,其规范化的来源标注与许可证附注亦为数据治理树立了典范,对数据工程教育与工具研发产生了深远影响。
当前挑战
该数据集面临的首要挑战在于确保格式转换的绝对保真性,即在从源格式(如CSV、SQL转储)转换至Parquet时,需精确处理数据类型映射、空值策略及复杂结构(如空间列WKB格式),同时避免数据值被意外改写。其次,多源许可协议(MIT、BSD-3-Clause、EPL v1.0)的合规管理构成法律层面的挑战,需逐一对每个数据集进行来源追溯、许可文本附注及版权声明,以防止知识产权纠纷。此外,确保转换后的Parquet文件在跨平台(如Databricks、Snowflake、BigQuery)与本地工具(DuckDB、Polars)中的兼容性与性能优化亦非易事,需平衡文件大小与查询速度。最后,维持数据集的长期可维护性与版本更新,应对上游数据源的变化,也是持续存在的挑战。
常用场景
经典使用场景
在数据工程与分析的广袤疆域中,Apache Parquet凭借其列式存储与卓越压缩性能,已成为现代数据平台的核心格式。此数据集集大成者,将AdventureWorks、Chinook、Northwind等业界脍炙人口的经典样本,悉数转换为Parquet格式,为数据从业者提供了即取即用的宝贵资源。其经典使用场景,在于作为数据管道开发、数据仓库建模及查询引擎性能基准测试的标准化输入,使得研究者能够聚焦于算法与架构的优化,免于数据格式转换的琐碎之扰。无论是Databricks、Snowflake等云端平台,抑或DuckDB、Polars等本地引擎,皆可无缝接入,即刻开展数据探索与分析之旅。
衍生相关工作
围绕这一系列Parquet格式的样本数据,衍生出了诸多蓬勃发展的技术实践与学术探索。在数据格式研究领域,这些数据集常被用作评测新型列式存储编码、压缩算法及谓词下推策略效能的标准负载。在数据湖与数据网格架构的讨论中,它们成为演示元数据管理、模式演变及跨引擎数据共享概念的常用载体。此外,针对向量化查询执行与物化视图优化的研究,亦可借助这些结构清晰、规模适中的数据集进行原型验证。基于Pagila数据集衍生的嵌入向量表,更为图数据库、推荐系统与向量检索的交叉研究提供了新颖的实验素材,持续催化着数据技术生态的创新与繁荣。
数据集最近研究
最新研究方向
随着现代数据栈的迅猛演进,Apache Parquet以其列式存储、高压缩比与强类型Schema成为数仓与数据湖的基石格式。该数据集集合精准回应了业界对经典样本数据在云端与本地分析引擎间无缝迁移的迫切需求,将Microsoft、MySQL等机构的权威基准数据无损转换为Parquet,并保留原始许可与来源标注。其前沿研究方向聚焦于标准化多源数据的物理表示,以支撑Databricks、Snowflake等平台上的向量检索、OLAP剖析及ETL流程验证,尤其为Polars与DuckDB等新兴工具提供了即用型测试床,从而催化了数据工程领域的可复现实验与基准评测,对推动数据互操作性与现代分析体系的实证研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务