遇见数据集

GenBench

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

GenBench 预处理基准数据集仓库提供了用于 GenBench 标准训练和评估流程的精确预处理数组。仓库包含七个数据集:QM9(分子几何,含已表征分子和 TD 跳跃分裂行)、MiniBooNE(粒子事件,含文献分裂和归一化)、NavierStokes(涡度场,含傅里叶下采样后的训练/验证/测试数组)、JetNet30(粒子云,含五类训练/验证/测试数组)、DeepSTARR(增强子序列,含分裂、活性、元数据和官方预测器权重)、GuacaMol(类药分子,含 ChEMBL 非重叠官方分裂作为鲁棒 SELFIES 端点数组)、SpeechCommands(一秒口语波形,含官方说话者不重叠的训练/验证/测试数组和标签)。螺旋和棋盘基准没有存储数据集,其目标分布由 GenBench Python 包精确生成。CIFAR-10 和 MNIST 因为上游数据分发许可证未提供明确的重分发授权而被排除。仓库中的 manifest.json 文件记录了每个必需文件的字节大小和 SHA-256 哈希值,作为权威校验。每个原始数据集的许可证和重分发条款不同,需查阅各自元数据和上游来源。

The GenBench preprocessing benchmark dataset repository provides precisely preprocessed arrays for the standard training and evaluation pipeline of GenBench. The repository contains seven datasets: QM9 (molecular geometries, with characterized molecules and TD jump splitting rows), MiniBooNE (particle events, with literature splits and normalization), NavierStokes (vorticity fields, with training/validation/test arrays after Fourier downsampling), JetNet30 (particle clouds, with five-class training/validation/test arrays), DeepSTARR (enhancer sequences, with splits, activities, metadata, and official predictor weights), GuacaMol (drug-like molecules, with ChEMBL non-overlapping official splits as robust SELFIES endpoint arrays), and SpeechCommands (one-second spoken word waveforms, with official speaker-disjoint training/validation/test arrays and labels). The spiral and checkerboard benchmarks have no stored datasets; their target distributions are exactly generated by the GenBench Python package. CIFAR-10 and MNIST are excluded due to the lack of explicit redistribution authorization from upstream data distribution licenses. The manifest.json file in the repository records the byte size and SHA-256 hash of each required file as authoritative checks. The licenses and redistribution terms for each original dataset differ; refer to their respective metadata and upstream sources.

创建时间:
2026-08-08
原始信息汇总

GenBench 基准数据集概述

GenBench 是一个为生成式基准测试(Generative Benchmarking)准备的标准化数据集集合,旨在支持生成模型的训练与评估流程。该仓库提供了经过精确预处理的数据数组,可直接用于复现官方基准结果,同时保留各数据集的原始来源信息以供验证。


数据集内容

目录 生成对象 数据内容
QM9 分子几何结构 打包的分子特征数据及TD-jumps划分行
MiniBooNE 粒子事件 文献标准划分及归一化数据
NavierStokes 涡量场 傅里叶降采样后的训练/验证/测试数组
JetNet30 粒子云 五类别训练/验证/测试数组
DeepSTARR 增强子序列 划分、活性值、元数据及官方预测器权重
GuacaMol 药物样分子 官方非重叠ChEMBL划分的鲁棒SELFIES端点数组
SpeechCommands 一秒口语波形 官方说话人无关的训练/验证/测试数组及标签

特殊说明

  • 分析螺旋与棋盘基准无存储数据集,其目标分布由GenBench Python包直接生成。
  • CIFAR-10 和 MNIST 被有意排除,因其上游分发未提供明确的一般再分发许可。
  • DeepSTARR 的小型官方活性预测器权重已包含,因其属于评估协议的一部分。

权威清单

manifest.json 为该仓库的权威文件,记录每个必需文件的字节大小和 SHA-256 哈希值,用于数据完整性验证。


许可与分发

各数据集的原始许可和再分发条款不同,使用前需查阅各数据集自身的元数据及上游来源。

搜集汇总
数据集介绍
GenBench 数据集图片
构建方式
GenBench数据集的构建遵循严谨的基准测试规范,集成了多个领域内具有代表性的生成任务数据。其核心构建方法在于,对每个原始数据源进行精心的预处理和标准化,将原始数据转化为可直接用于训练与评估的数组格式。该数据集仓库明确排除了冗余的源档案,每个基准的Python准备模块均记录并验证原始上游来源,确保数据可追溯性与可复现性。具体而言,QM9数据集包含打包的分子几何结构与TD-jump分割行;MiniBooNE采用文献分割与归一化处理;NavierStokes提供傅里叶降采样后的涡度场数组;JetNet30包含五类粒子云数据;DeepSTARR整合了增强子序列、活性数据及官方预测器权重;GuacaMol采用官方非重叠ChEMBL分割,以规范SMILES token形式呈现;SpeechCommands则提供说话者不相交的波形数组。此外,解析螺旋与棋盘格基准因其目标分布可由GenBench Python包精确生成,故未存储独立数据集。整个仓库通过manifest.json文件记录每个必需文件的字节大小与SHA-256校验值,确保数据完整性与权威性。
使用方法
GenBench数据集的使用方法简洁而高效,旨在支持生成模型的标准化训练与评估。用户可直接利用仓库中已准备的数组文件,通过GenBench Python包自带的训练与评估流程,快速搭建基准实验。对于每个子数据集,其目录结构清晰,文件命名规范,便于自动化加载。例如,QM9数据集可直接用于分子几何生成任务,通过指定训练/验证/测试分割,即可进行模型性能评估。NavierStokes与JetNet30等数据则需按相应加载逻辑,将傅里叶域或类别数组代入模型输入。DeepSTARR数据集不仅提供序列与活性数据,还附带了官方预测器权重,用户可依评估协议进行对比测试。在数据引用时,需参照manifest.json文件核对文件校验值,并遵循各上游数据集的原始许可条款。对于未存储数据集的解析螺旋与棋盘格基准,用户需通过GenBench Python包API动态生成目标分布,以实现完整基准测试。总体而言,GenBench提供了开箱即用的数据资源,降低了基准复现的复杂度,促进了生成模型在跨学科领域中的可比性研究。
背景与挑战
背景概述
GenBench数据集由致力于生成式基准测试的研究团队构建,旨在为多种生成式任务提供标准化、可复现的训练与评估数据。该数据集于近年发布,系统整合了涵盖分子几何、粒子事件、涡度场、粒子云、增强子序列、药物分子及语音波形等七个领域的基准数据,并配套权威的manifest.json文件以确保数据完整性与可追溯性。其核心研究问题在于解决生成模型在跨领域评估中数据不一致、预处理繁琐的难题,通过提供精确的预处理数组和统一的评估协议,显著降低了基准测试的复现门槛,推动了生成式模型研究的规范化与可比性,对计算生物学、物理学及语音处理等领域产生深远影响。
当前挑战
GenBench面临的挑战源于多维度生成任务的本质差异:分子几何需精确表征三维结构,粒子事件需处理高维稀疏分布,涡度场需保留物理守恒特性,而增强子序列则需兼顾生物学意义与序列约束。构建过程中,团队需协调不同数据源的许可证条款,如CIFAR-10和MNIST因缺乏明确的再分发授权而被迫排除,同时确保各基准的预处理流程可验证且原始来源可追溯,包括DeepSTARR的官方权重集成。此外,生成数据的规模与多样性要求严格的质量控制,以平衡计算资源与数据代表性,从而维护基准的公平性与实用性。
常用场景
经典使用场景
GenBench数据集作为生成模型基准测试的标准化平台,其核心用途在于为分子几何、粒子事件、涡量场、粒子云、增强子序列、药物样分子以及语音波形等多元生成对象提供统一、预处理完备的训练与评估数据。该数据集通过精心编排的数组格式,确保了不同领域生成任务的可复现性与可比性,使研究者能够直接聚焦于模型架构与算法创新,而无需反复处理原始数据的清洗与标准化,从而显著提升研究效率与实验的稳健性。
解决学术问题
该数据集直面生成模型研究中长期存在的基准不统一、数据预处理繁琐及评估标准模糊等核心难题。通过提供经过严格验证的预处理数据集和权威的manifest清单(含字节大小与SHA-256校验),GenBench确保了数据来源的可追溯性与完整性,解决了跨研究结果难以公平对比的困境。同时,其明确排除未获广泛再分发许可的数据集(如CIFAR-10、MNIST),规避了法律与伦理风险,为学术界树立了负责任的数据共享典范。
实际应用
在实际应用中,GenBench数据集广泛赋能于药物发现、材料科学、流体力学模拟及语音识别等领域。例如,GuacaMol与QM9部分支持新型药物分子与材料的虚拟筛选,加速候选化合物的生成与优化;NavierStokes与JetNet30数据则助力气象预测、航空航天及高能物理实验中的事件重建与信号识别;DeepSTARR与SpeechCommands分别推动基因调控元件的功能预测和智能语音接口的研发,展现出跨学科、多场景的实用价值与影响力。
数据集最近研究
最新研究方向
GenBench数据集的最新研究方向聚焦于生成式基准的统一构建与多领域泛化能力评估,通过整合分子几何、粒子物理、流体动力学、增强子序列、药物分子、语音波形等异构数据,为生成模型提供标准化的训练与评测框架。当前前沿工作强调数据预处理的可复现性与跨学科迁移性,尤其关注小样本生成、物理约束生成以及生成模型的鲁棒性分析。该数据集还推动了对生成任务中分布偏移与归一化策略的研究,其严谨的清单校验与许可追踪机制为开放科学下的数据共享树立了新范式,对AI在药物设计、气候模拟、语音交互等领域的可信应用具有重要推动作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务