遇见数据集

design-bench

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

SciModelingBench Design-Bench Data 是一个用于科学建模和设计任务的基准数据集,为SciModelingBench Design-Bench套件提供规范化的、可追溯来源的科学观测数据。该数据集包含八个不同科学领域的配置,涵盖DNA结合图谱、转录因子观测、合成UTR序列、GFP蛋白质基因型、超导材料成分、药物毒理学观测、神经网络架构搜索单元和强化学习策略等多个领域。数据规模从3,200到4,160,533个观测样本不等,以Parquet格式存储。每个配置对应特定的科学对象和评估设置,支持精确查找、自由形式黑盒优化、复制计数后验、池排序等多种评估方式。数据集采用严格的信任模型,区分精确映射、保留的实验观测、基于原始复制计数的确定性聚合等不同评估类型。数据存储结构包括配置文件、语义清单、来源证明记录和规范基准表,确保实验的可重复性和可追溯性。该数据集适用于科学机器学习、黑盒优化和智能体评估等任务,可通过Hugging Face Datasets直接加载或通过配套Python包构建端到端基准任务。各配置使用不同的上游许可证,需参考各自的清单文件获取具体许可信息。

SciModelingBench Design-Bench Data is a benchmark dataset for scientific modeling and design tasks, providing standardized and traceable scientific observation data for the SciModelingBench Design-Bench suite. The dataset includes configurations across eight different scientific domains, covering areas such as DNA binding profiles, transcription factor observations, synthetic UTR sequences, GFP protein genotypes, superconducting material compositions, drug toxicology observations, neural architecture search units, and reinforcement learning policies. The data scale ranges from 3,200 to 4,160,533 observation samples, stored in Parquet format. Each configuration corresponds to specific scientific objects and evaluation settings, supporting various evaluation methods like precise lookup, free-form black-box optimization, replication count posterior, and pool ranking. The dataset employs a strict trust model, distinguishing evaluation types such as exact mapping, retained experimental observations, and deterministic aggregation based on original replication counts. The storage structure includes configuration files, semantic manifests, provenance records, and standardized benchmark tables, ensuring experimental reproducibility and traceability. It is suitable for tasks like scientific machine learning, black-box optimization, and agent evaluation, and can be loaded directly via Hugging Face Datasets or through an accompanying Python package to build end-to-end benchmark tasks. Each configuration uses different upstream licenses; refer to respective manifest files for specific licensing information.

创建时间:
2026-07-15
原始信息汇总

数据集概述

数据集名称:SciModelingBench Design-Bench Data

数据集地址:https://huggingface.co/datasets/sci-modeling-bench/design-bench

许可证other(每个配置项具有独立的许可证,详见各配置清单)

标签:benchmark, scientific-machine-learning, black-box-optimization, agent

描述:该数据集存储了用于科学建模和设计任务的标准、可溯源观测数据,是 SciModelingBench Design-Bench 套件的科学观测层。数据和评估逻辑分开版本控制,支持可复现实验。


数据配置

配置名称 科学对象 标准行数 评估设置
tfbind8 完整的 SIX6 DNA 8-mer 结合景观 65,536 精确查找;自由形式黑箱优化
tfbind10_pho4 Pho4 BET-seq 原始计数观测 4,160,533 复制计数后验;黑箱优化
utr_mrl_egfp_unmodified 合成的 50-nt 5 UTR 318,468 测量 MRL;组合池排序
gfp Sarkisyan GFP 蛋白基因型 51,715 测量中位亮度;池排序
superconductor 归一化元素组成 15,164 测量组中位临界温度;池排序
drugmatrix_clinical_pathology 个体动物大鼠毒理学观测 10,605 匹配对照测量终点;池排序
cell_dag_nas 规范的 NASBench-101 细胞 DAG 423,624 官方重复 NAS 记录;黑箱优化
hopper_controller 结构化的 PPO 策略检查点 3,200 每个策略 500 次冻结 Hopper-v5 运行;池排序

信任模型

SciModelingBench 不采用单一评估器类型,而是根据科学领域使用以下分类:

  • 精确(Exact):完整的表格化或解析映射,如 TFBind8。
  • 测量(Measured):保留的实验观测或重复模拟结果,如 GFP、Superconductor、DrugMatrix、Hopper Controller。
  • 后验推导(Posterior-derived):基于原始复制计数的确定性聚合,如 TFBind10 Pho4。
  • 遗留学习替代(Legacy learned surrogate):在相关情况下记录,但不默认作为实验事实。

仓库布局

README.md scimodelingbench.json data/<config>/<split>.parquet manifests/<config>.json provenance/<config>/*.json

  • scimodelingbench.json:将配置名称映射到严格的语义清单。
  • manifests/:定义输入、目标、上下文、单位、约束、分割、来源、引用、版本和许可证标识。
  • provenance/:记录源哈希、转换、发布统计、工件哈希和设置特定审计。
  • data/:仅包含标准基准表,不包含 Python 代码或模型检查点。

文档与溯源

配置 任务文档 机器可读溯源
tfbind8 TFBind8 文档 provenance/tfbind8/six6_ref_r1.json
tfbind10_pho4 TFBind10 Pho4 文档 provenance/tfbind10_pho4/observations.json
utr_mrl_egfp_unmodified 尚未发布 provenance/utr_mrl_egfp_unmodified/measurements.json
gfp 尚未发布 provenance/gfp/protein_genotypes.json
superconductor Superconductor 文档 provenance/superconductor/composition_groups.json
drugmatrix_clinical_pathology 尚未发布 provenance/drugmatrix_clinical_pathology/observations.json
cell_dag_nas CellDAG-NAS 文档 provenance/cell_dag_nas/architectures.json
hopper_controller Hopper Controller 文档 provenance/hopper_controller/build.json

许可证信息

配置 清单许可证
cell_dag_nas Apache-2.0
gfp CC BY 4.0
hopper_controller MIT(来源策略);生成的运行溯源单独记录
superconductor CC BY 4.0
tfbind10_pho4 CC BY 4.0
tfbind8 来源特定条款
utr_mrl_egfp_unmodified 上游分发中未知
drugmatrix_clinical_pathology 未知;CEBS 页面未声明简单的工件分发许可证

注意:不要根据 Python 包的 MIT 许可证推断数据集配置的许可证。


评估边界

协议通过包 API 隐藏评估标签,但这些是公开的科学工件,可能在 API 之外可被发现。受控的 Agent 评估需要外部工具来隔离完整数据集、溯源、缓存、源代码和网络。查询预算和迭代反馈策略也属于该外部工具,而非本数据仓库。

搜集汇总
数据集介绍
design-bench 数据集图片
构建方式
Design-Bench数据集是SciModelingBench基准套件的核心科学观测层,其构建严格遵循可追溯性与版本化原则。数据集围绕八类不同的科学设计任务进行组织,每个任务对应一个独立配置(config),涵盖从DNA结合亲和力预测到强化学习策略优化等多元领域。每条观测数据均以Parquet格式存储,并配有详尽的元数据清单(manifest)与来源哈希记录(provenance),确保数据来源清晰、转换过程可审计。观测数据通过实验测量、计算模拟或文献汇编等方式获取,例如TFBind8包含完整的SIX6 DNA 8-mer结合图谱,而Hopper Controller则记录了PPO策略在仿真环境中的重复评估结果。数据集与评估逻辑分离版本,允许实验精确定点特定版本的数据与指标。
特点
该数据集最显著的特点在于其严谨的信任模型(Trust Model)与广泛的领域覆盖。根据数据来源与评估方式,数据集将观测分为精确查表、实验测量、后验推导及遗留学习代理等类型,明确区分真值噪声与确定性聚合规则,避免将近似模型结果误作实验真理。每个配置均包含数万至数百万行的规范化数据,如TFBind10 Pho4拥有超过四百万条原始计数观测,而细胞DAG NAS则涵盖四十二万余种神经网络架构。此外,数据集严格维护每项数据的许可信息与引用来源,确保跨领域科学基准的合规性与可复现性,为黑箱优化与智能体评估提供了可信赖的标准化测试平台。
使用方法
用户可通过Hugging Face Datasets库便捷加载任意配置下的规范化表格,例如使用`load_dataset`指定配置名称与数据切分即可获取观测数据。对于端到端基准评估,推荐结合Python包`sci-modeling-bench`中的任务构建接口,如通过`TFBind8BlackBoxOptimizationTask.from_hub()`可直接生成面向智能体的标准化输入。为实现可复现研究,建议在调用时指定不可变的Hub提交修订版(revision),而非依赖动态更新的默认分支。注意,数据集的评估边界由外部框架控制,协议仅提供智能体可见的观测与隐藏标签,查询预算与迭代反馈策略需由独立的测试框架实现,确保评估过程的隔离性与公正性。
背景与挑战
背景概述
设计优化是科学发现与工程创新的核心环节,旨在探索高维、非凸的搜索空间以获取性能优越的候选解。然而,传统方法在高成本实验与复杂物理约束下往往效率低下。为系统评估黑箱优化算法在多样化科学任务中的表现,SciModelingBench Design-Bench数据集应运而生,由徐可平等研究团队于近期构建并开源。该数据集整合了涵盖分子生物学、材料科学与机器人控制等领域的八个标准化任务,包括DNA结合位点预测、蛋白质荧光亮度优化、超导体临界温度预测及机器人运动控制器设计等,每个任务均提供经过严格溯源与校验的观测数据。凭借其可复现的评估协议与版本化数据管理,该数据集为黑箱优化算法提供了公正的竞技场,并对科学机器学习社区产生了重要影响,成为检验模型从离线数据中学习高效搜索策略的关键基准。
当前挑战
该数据集所解决的领域核心挑战在于如何在高维、离散或组合空间中高效搜索最优设计,同时降低对昂贵物理实验或模拟的依赖。例如,TFBind8与TFBind10任务需在数十亿可能的DNA序列中定位高亲和力结合位点,而超导体任务需从万余种元素组成中筛选高临界温度材料。此外,构建过程中面临多重挑战:首先,不同任务的数据来源高度异质,涵盖完整枚举、噪声实验观测与仿真记录,需统一评估标准;其次,多数任务存在标签不可见问题,需通过严格协议确保Agent无法直接获取实际目标值,以防数据泄露;最后,数据版权与溯源要求复杂,如DrugMatrix数据受CEBS条款限制,需在共享时标注各配置的独立许可证,保障了基准的合法性与可扩展性。
常用场景
经典使用场景
Design-Bench数据集作为科学建模与设计领域中的一项标杆性资源,其核心应用场景集中在黑箱优化与智能体评估任务中。该数据集囊括了从DNA结合谱、蛋白质荧光表型到超导体组分、神经架构搜索等多种科学对象,为研究者提供了具有严格溯源链的规范观测数据。典型用法是将其作为离线优化问题中的真实目标函数,使得算法能够在不进行昂贵物理实验或模拟的情况下,基于历史观测进行策略学习与候选筛选,从而系统评估各类贝叶斯优化、进化算法或强化学习方法在高维离散或组合空间中的表现。
衍生相关工作
该数据集的发布催生了一系列具有里程碑意义的学术工作。最直接的衍生方向是提出了多种面向离线优化的智能体协议,如基于信赖域的贝叶斯优化方法,以及结合扩散模型的组合序列生成框架。一些研究工作利用TFBind8和GFP配置验证了进化策略在离散序列空间中的竞争力,另有工作以Hopper Controller数据为基础开发了鲁棒的策略评价指标。此外,CellDAG-NAS配置被广泛用作神经架构搜索算法的标准测试床,推动了可微分搜索与零成本代理性能预测方法的快速发展,形成了一个生机勃勃的离线科学设计研究生态。
数据集最近研究
最新研究方向
当前,SciModelingBench Design-Bench数据集在前沿科学机器学习与黑箱优化领域引领着一股强调可复现性与可溯源性的研究浪潮。其核心创新在于构建了一个融合了精确查找、实验测量、后验推导与代理模型等多种评估范式的统一基准,精准匹配了从DNA结合景观、蛋白质荧光到超导体临界温度、神经网络架构搜索等跨学科设计任务。伴随人工智能辅助科学发现的蓬勃发展,该数据集通过严格分离数据、评估逻辑与协议,为智能体驱动的材料、生物分子及自动化控制优化提供了透明可信的竞技场,深刻推动了代理模型在稀疏且昂贵实验数据下的稳健泛化能力,并确立了科学建模领域标准化评估的新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务