遇见数据集

acta-data

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是Acta v0.2基准测试所使用的规范大规模人工制品集合,用于重现真实数据基准测试。数据集包含四个子集:bts_flight(来自美国交通部的航班准点数据子集,包含15,750,000行、51列,以Parquet和Acta格式存储)、market_deltas(市场增量数据,原始为ClickHouse 26.4.1导出的Parquet文件,包含239,246,024行、13列,提供Parquet和Acta格式)、tsbs_iot(使用TSBS生成的物联网时序数据,包含10,000,000行、20列,提供Parquet、Acta、CSV等格式)、clickbench_hits(ClickBench基准测试的点击数据,包含99,997,497行、105列,提供Parquet、Acta格式及1,000,000行CSV样本)。所有子集均附带校验和、基准测试结果(benchmark.json)以及来源说明。该数据集主要用于软件基准测试和格式验证,用户在使用前应审查源数据的条款、归属要求及适用性。

This dataset is a curated collection of large-scale artifacts used in the Acta v0.2 benchmark for reproducing real-world data benchmarks. It contains four subsets: bts_flight (flight on-time data from the U.S. Department of Transportation, 15,750,000 rows, 51 columns, stored in Parquet and Acta formats), market_deltas (market delta data, originally exported from ClickHouse 26.4.1 as Parquet files, 239,246,024 rows, 13 columns, available in Parquet and Acta formats), tsbs_iot (IoT time-series data generated using TSBS, 10,000,000 rows, 20 columns, available in Parquet, Acta, CSV, and other formats), and clickbench_hits (click data from the ClickBench benchmark, 99,997,497 rows, 105 columns, available in Parquet and Acta formats, with a 1,000,000-row CSV sample). All subsets include checksums, benchmark results (benchmark.json), and source attribution. This dataset is primarily used for software benchmarking and format validation. Users should review the terms, attribution requirements, and suitability of the source data before use.

创建时间:
2026-08-11
原始信息汇总

数据集概述

该数据集为 Acta benchmark data,用于复现 Acta v0.2 基准测试的标准大型数据工件。数据集的转换器、模式映射、命令、校验和、验证程序及测量结果均存储在 Acta GitHub 仓库 中。

数据内容

数据集包含五个子集,每个子集对应不同的基准测试场景:

bts_flight/v0.2/

  • bts_flights_15750000.parquet:15,750,000 行,51 列,381,644,436 字节
  • bts_flights_15750000.acta:使用 Zstandard level 6 的 Acta v0.2 自适应输出,325,340,952 字节
  • manifest.json:源归档 URL、源校验和、行数和 Parquet 校验和
  • benchmark.json:Acta 校验和、压缩级别和基准测试结果

market_deltas/v0.2/

  • deltas.parquet:原始的 239,246,024 行、13 列 ClickHouse Parquet 导出,2,057,215,095 字节
  • deltas.acta:使用固定原始编码和 Zstandard level 1 的 Acta v0.2 输出,1,773,915,800 字节
  • benchmark.json:模式、选项、校验和、环境和转换结果
  • conversion.stats.txt:转换器持久化的开始和最终统计信息

tsbs_iot/v0.2/

  • tsbs_iot_10m_source.txt:固定种子的 TSBS TimescaleDB 格式源流
  • tsbs_iot_10m.parquet:归一化的 10,000,000 行、20 列输入
  • tsbs_iot_10m.acta:使用自适应编码和 Zstandard level 1 的 Acta v0.2 输出
  • tsbs_iot_10m.parquet.target:使用 65,536 行组和 Zstandard level 1 的 Parquet 目标格式输出
  • tsbs_iot_10m.csv:相同模式和行的 UTF-8 CSV 目标格式输出
  • manifest.json:TSBS 版本、生成器参数、源和归一化输入校验和
  • benchmark.jsonbenchmark.md:写入/读取指标、输出校验和环境

clickbench_hits/v0.2/

  • hits.parquet:ClickHouse ClickBench 兼容源工件,99,997,497 行,105 列
  • hits.acta:写入器基准测试产生的 Acta v0.2 目标
  • hits_1m.csv:保留的 100 万行 CSV 样本
  • benchmark.jsonbenchmark.md:Acta 写入/读取指标、源大小基线、CSV 大小推断、校验和环境
  • README.md:精确复现说明和计时范围

数据来源

  • BTS 航班数据:来源于美国交通统计局 (BTS) 报告的承运商准点率数据的精选强类型子集,可从 BTS PREZIP 归档 获取,非官方 BTS 发布。
  • 市场增量数据:用户提供的 ClickHouse Parquet 导出,包含事件时间戳、工人和场所标识符、市场和工具键、结果和簿侧标签、价格、规模和更新类型。
  • TSBS IoT 数据:来源于官方 timescale/tsbs 源,版本 8323e59c74027b108f4ad5ec5d3e498b0101a02e,使用 iot 用例、TimescaleDB 序列化、种子 123、规模 550、10 秒间隔。
  • ClickBench 数据:来源于官方 ClickHouse/ClickBench 仓库。

关键说明

  • 基准测试写入和读取 Acta,原始 Parquet 用作大小基线
  • 完整 CSV 约为 75 GiB,其大小从 100 万行样本推断
  • 数据工件仅供软件基准测试和格式验证使用
  • 用户在使用或重新分发前,需审查源数据的条款、归属要求和适宜性

记录了校验和(部分)

  • 33c7d1fd28faa95d002e05ebf778e6345c4eb1c9d39416224ee08967bad23f27 bts_flights_15750000.parquet
  • ee5c07e11197665895065d3b998f30d2a3984bd6920e9121d04db67e55821d29 bts_flights_15750000.acta
  • 7f2e8dfc86f161737b038c81ce4dbc6b3e0a9fdf4bcc19e36b931490f3218c2a deltas.parquet
  • d5c1d8d1654d8b9373e0225685989e7a49cb65338fd2c84969deb24c75ba8f43 deltas.acta
  • a390f6cb782f6aaef278c72fc1dd86c4f30bc843ebab3c159e9bd4d45ddb079f hits.parquet
  • 44a3aaf872cb6cd0318a6537b104ff26214d2738e8c9e7821a7f1bebd10ebad3 hits.acta
搜集汇总
数据集介绍
acta-data 数据集图片
构建方式
Acta benchmark数据集的构建立足于真实世界大规模数据集的基准复现需求,涵盖航空运输、金融市场、物联网时序及网络点击流等多个关键领域。构建过程始于对原始异构数据源的系统采集,如美国交通统计局航班准时性数据、ClickHouse市场导出数据以及TSBS生成的物联网模拟流。随后,通过严格的规范化流程与模式映射,将原始数据转化为统一的Parquet格式作为中间表示,并利用Acta v0.2编解码器施加自适应压缩策略,最终生成与原格式对应的Acta格式文件。全程伴随校验和验证、基准测试脚本及清单记录,确保数据转换的可追溯性与可复现性。
特点
该数据集的核心特征在于其规模庞大且高度贴近真实应用场景,总记录数跨越数亿级别,字段维度覆盖从13列到105列不等,能够充分检验压缩与序列化方案在极端负载下的性能边界。数据集内嵌了Parquet源文件、Acta压缩输出、CSV样本及详尽的基准测试元数据,形成多格式对照的完整快照。尤为突出的是,所有工件均附带校验和、转换统计与环境参数,支持跨平台结果验证与细粒度性能剖析。其领域多样性也为评估不同编码策略在航班、金融、物联网等数据分布上的适应性提供了理想试验场。
使用方法
研究人员可通过Hugging Face平台直接获取各子目录下的Parquet与Acta文件,借助清单中提供的校验和验证数据完整性。利用Acta仓库中公开的转换脚本与基准测试命令,可复现编码过程并获取写入/读取吞吐量、压缩比等关键指标。对于需要定制化分析的场景,可将Act格式文件通过对应解码器还原为原始模式,或直接与Parquet、CSV等基线格式进行性能对比。使用时需留意各数据源自身的许可条款与归属要求,在合规前提下开展格式验证、算法评测或系统优化研究。
背景与挑战
背景概述
Acta v0.2基准数据集由独立研究者创建,旨在为时间序列与遥测数据的压缩格式提供可复现的评测基准。其核心研究问题在于评估自适应编码与Zstandard压缩在航空飞行记录、金融市场增量数据、物联网传感器流及点击日志等真实场景中的性能表现。数据集涵盖十余种数据模态,规模从数千万至亿级行不等,为存储格式与压缩算法研究提供了标准化比较基础,对时序数据库与列式存储领域具有重要参考价值。
当前挑战
该数据集所面对的领域问题在于如何在保持数据保真度的前提下,实现异构时序数据的高效压缩与快速读写。构建过程中的挑战包括:跨源数据的模式归一化与类型对齐,不同生成器与导出工具的兼容性处理,以及大体积工件的校验和验证。市场增量数据缺乏明确的来源许可信息,要求使用者自行确认合规性;点击日志的完整CSV规模约75 GiB,难以直接测量吞吐量,需通过抽样外推估算。
常用场景
经典使用场景
在时序数据管理与分析领域,Acta数据集充当了评估列式存储格式压缩效能与查询性能的标准化基准。其经典使用场景集中于复现Acta v0.2版本在真实数据上的基准测试,涵盖美国交通统计局航班准点性能数据、市场交易增量数据、TSBS物联网传感器数据以及ClickBench点击流数据。研究者通过对比Acta格式与Parquet、CSV等格式在压缩率、读写吞吐量方面的表现,系统评估自适应编码与Zstandard压缩策略在不同数据模态下的适用性。
实际应用
在实际工业场景中,Acta数据集为数据库系统选型、存储成本优化与数据管道设计提供了决策依据。例如,航班数据分析平台可借助其评估Acta格式在宽表上的压缩收益,市场数据服务商可利用增量数据工件验证低延迟写入性能,物联网平台则能通过TSBS工件衡量传感器数据在高吞吐场景下的存储效率。这些应用直接关系到云存储开支、查询响应时间与系统可扩展性等关键运营指标。
衍生相关工作
基于Acta数据集,研究者与工程师已衍生出一系列相关工作,包括Acta格式本身的持续迭代与版本演进、针对特定领域(如金融时序、车联网遥测)的定制化编码方案、以及与之配套的自动化基准测试框架和转换工具链。此外,该数据集还促进了跨格式比较研究,如Acta与Parquet、ORC、Arrow在压缩率与扫描效率上的系统性评测,为列式存储生态的协同发展提供了公共参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务