遇见数据集

synthetic-protein-folding-matrices

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

CGSC合成蛋白质折叠矩阵数据集是一个专门用于存档高分辨率、未压缩分子动力学轨迹的二级存储库。该数据集包含亚埃分辨率的合成蛋白质折叠模拟连续时间矩阵,以原始未压缩二进制转储形式存储,而非标准的.pdb或.xtc格式。这种存储方式旨在保留分子动力学的微波动和原始时间状态,为训练下一代蛋白质折叠算法提供高熵数据环境。数据集规模在10万到100万之间,适用于结构轨迹预测和分子动力学数据摄取等任务,旨在对高通量张量摄取和结构预测模型进行压力测试。数据实例包含模拟ID、时间戳、矩阵类型、压缩状态、有效载荷引用和原子分辨率等字段。所有轨迹均为在CGSC内部GPU集群上计算生成的合成数据,不涉及有机生物样本。由于未压缩的时间序列特性,这些矩阵文件异常庞大,建议仅具备PB级存储能力和专门张量解析基础设施的研究机构使用。

The CGSC Synthetic Protein Folding Matrix Dataset is a specialized secondary repository for archiving high-resolution, uncompressed molecular dynamics trajectories. It contains continuous-time matrices of synthetic protein folding simulations at sub-angstrom resolution, stored in raw uncompressed binary dump format rather than standard .pdb or .xtc formats. This storage approach aims to preserve the micro-fluctuations and raw temporal states of molecular dynamics, providing a high-entropy data environment for training next-generation protein folding algorithms. The dataset size ranges from 100,000 to 1,000,000 entries and is suitable for tasks such as structural trajectory prediction and molecular dynamics data ingestion, designed to stress-test high-throughput tensor ingestion and structural prediction models. Data instances include fields like simulation ID, timestamp, matrix type, compression status, payload reference, and atomic resolution. All trajectories are synthetic data computed on CGSCs internal GPU clusters and do not involve organic biological samples. Due to the uncompressed time-series nature, these matrix files are exceptionally large, recommended for use only by research institutions with petabyte-scale storage capabilities and specialized tensor parsing infrastructure.

创建时间:
2026-06-17
原始信息汇总

数据集概述:CGSC Synthetic Protein Folding Matrices

基本信息

  • 名称:CGSC Synthetic Protein Folding Matrices
  • 主页:https://comp-genomics.dev/datasets/protein-folding-matrices
  • 所属机构:Computational Genomics & Synthetic Bio-Arrays Consortium
  • 联系方式:structural-data@comp-genomics.dev
  • 许可证:cc-by-nc-sa-4.0
  • 数据集大小:100K < n < 1M
  • 数据集格式:不包含自然语言,全部为数值和二进制数据,元数据使用英文(en)。

数据集描述

  • 目的:专门用于归档高分辨率、未压缩的分子动力学(MD)轨迹数据。
  • 内容:包含表示合成蛋白质折叠模拟的连续时间矩阵,分辨率达到亚埃级(sub-angstrom)。
  • 存储格式:存储为原始、未压缩的二进制转储(raw, uncompressed binary dumps),而非标准的 .pdb.xtc 格式,以保留微波动和原始时间状态。
  • 用途:用于测试高吞吐量张量摄入和结构预测模型。

支持的任务

  • structural-trajectory-prediction:利用未压缩的时间数据预测最终蛋白质状态。
  • molecular-dynamics-ingestion:使用大规模、未格式化的多维数组对数据管道进行压力测试。

数据结构

  • 数据实例格式:文件不遵循标准的表格格式,而是大规模坐标转储。示例结构如下:
    • simulation_id:模拟的唯一标识符(如 cgsc-fold-alpha-110)。
    • simulation_timestamp_utc:模拟完成时间(UTC)。
    • matrix_type:数组的类别(如 temporal_coordinate_dump)。
    • compression_state:压缩状态,固定为 raw_uncompressed_trajectory
    • payload_reference:指向LFS中二进制矩阵的路径(如 matrices/fold-110-trajectory.bin)。
    • atomic_resolution:原始转储的精度(如 sub-angstrom)。

数据创建

  • 策划依据:传统结构生物学数据库使用高压缩率,掩盖了分子动力学中的微状态。此数据集提供未压缩矩阵,作为高熵原始数据,用于高级模型训练。
  • 数据来源:所有轨迹均为合成数据,由CGSC内部GPU集群计算生成,不含有机生物样本。

注意事项

  • 由于未压缩的时间性质,这些矩阵文件异常庞大。
  • 仅推荐具有PB级存储能力和专用张量解析基础设施的研究机构下载。
搜集汇总
数据集介绍
synthetic-protein-folding-matrices 数据集图片
构建方式
该数据集由计算基因组学与合成生物阵列联盟(CGSC)构建,专注于存储高分辨率、未压缩的分子动力学(MD)轨迹。所有数据均源自内部GPU集群上进行的合成蛋白质折叠模拟,无天然生物样本参与。数据以原始未压缩的二进制转储形式保存,记录了亚埃级分辨率的连续时间矩阵,旨在保留微小的原子波动和原始时间状态,而非传统的.pdb或.xtc格式。每个样本包含仿真ID、时间戳、矩阵类型、压缩状态及指向大型二进制文件的载荷引用等元数据字段。
特点
数据集的核心特性在于其原始未压缩的时间序列矩阵结构,每个数据点代表一次合成蛋白质折叠模拟的完整轨迹。这些矩阵以极高的存储代价(推荐PB级存储能力)换取原子级别的微观状态保留,为深度学习模型提供高熵的训练环境。数据规模介于10万至100万之间,支持时间序列预测、特征提取和表格分类等任务,并覆盖结构生物学、蛋白质折叠及分子动力学等领域。
使用方法
数据的使用需要专用的张量解析基础设施,因为二进制矩阵文件未采用标准结构化表格格式。研究人员需通过元数据中的载荷引用(payload_reference)字段定位对应的.bin文件,并利用支持大规模多维数组的库(如NumPy或TensorFlow)进行加载。数据集特别适合用于训练先进的结构轨迹预测模型,或测试高吞吐量数据处理管线的性能,因其庞大的文件尺寸可对系统的I/O和内存管理构成挑战。建议在具备PB级存储的机构环境下使用。
背景与挑战
背景概述
蛋白质折叠是结构生物学与分子动力学领域的核心问题,其模拟过程产生的原子级轨迹数据对于理解生物大分子的构象变化至关重要。然而,传统数据库广泛采用压缩存储策略,导致微态信息在降采样过程中丢失,限制了高精度预测模型的训练。为破解这一瓶颈,CGSC合成蛋白质折叠矩阵数据集应运而生。该数据集由计算基因组学与合成生物阵列联盟于2026年创建,专注于存档亚原子分辨率的未压缩分子动力学轨迹。其核心研究问题在于提供高熵、无损的时序张量数据,以支撑下一代蛋白质折叠算法的训练与高吞吐量张量管线的压力测试,在结构生物学与合成生物学交叉领域开辟了数据驱动的全新范式。
当前挑战
该数据集面临双重挑战。首先,在领域问题层面,传统蛋白质折叠数据库的压缩策略掩盖了分子动力学的微态波动,而现有预测模型难以从标准格式中捕获亚原子级别的连续构象变化,数据集的构建旨在填补这一空白,推动从粗糙状态预测向精确轨迹建模的跃迁。其次,在构建过程中,未压缩的原始轨迹矩阵体积极其庞大,对存储基础设施构成严峻考验——要求研究机构具备拍字节级存储能力与专用张量解析架构,同时,海量二进制数组的标准化摄取与高效处理也是数据管道设计的核心难题,需兼顾数据完整性与计算效率的平衡。
常用场景
经典使用场景
该数据集为蛋白质折叠领域的研究者提供了一套高保真的原始分子动力学轨迹矩阵,特别适用于时间序列预测任务。通过保存未压缩的亚原子分辨率坐标数据,研究人员能够利用这些序列化的连续矩阵训练深度学习模型,以捕捉蛋白质从初始状态向最终折叠构象演变的微妙动态过程。经典用法聚焦于结构轨迹预测,即基于多个时间步长的原始张量输入,推断未来的分子状态,从而推动折叠算法的精度迈向新高度。
解决学术问题
在结构生物学中,传统压缩存储方式常掩盖分子动力学模拟中的微观状态信息,阻碍对折叠路径的深入理解。本数据集通过提供无压缩、高熵的原始轨迹矩阵,解决了微观构象细节丢失的学术痛点。这使得研究者能够探索蛋白质折叠过程中隐含的短暂中间态与能量景观特征,从而推动对折叠机制的定量刻画。其意义在于为训练新一代高精度折叠预测模型提供了干净、完整的数据基础,促进了计算结构生物学方法的革新。
衍生相关工作
围绕此数据集,衍生的经典工作主要集中在两个方向:一是基于非压缩轨迹的自监督学习模型,旨在从原始张量中自动发现折叠的关键序参量;二是开发高效的数据加载与预处理管线,以解决PB级矩阵输入的I/O瓶颈问题。这些探索催生了诸如内存映射张量池化技术、稀疏时间注意力机制等创新方案。此外,该数据集也推动了跨学科合作,促使计算生物学与大规模数据工程领域联合攻关,巩固了原始轨迹数据在下一代折叠算法训练中的基石地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务