AlphaFold3_dataset
收藏资源简介:
<p align="center"> <strong> <span style="font-size: 30px;">AlphaFold3 Dataset</span> </strong> </p> ## 数据集介绍 AlphaFold3_dataset 是 `OneScience/AlphaFold3/` 模型的配套数据集,包含推理输入样例、公共搜索数据库、MMseqs 数据库、Jackhmmer 分片数据库和对齐相关目录。数据集 ID 固定为 `OneScience/AlphaFold3_dataset`。 ## 仓库说明 本数据集服务于 AlphaFold3 生物分子结构预测流程。它既提供已经包含 MSA 的 AlphaFold3 JSON 样例,也提供从序列搜索 MSA 所需的数据库目录。模型端可使用这些数据完成预检、带 MSA 推理、MMseqs 数据管线和 Jackhmmer 数据管线。 数据集整理为 OneScience 标准数据包,机器可读说明位于 `manifest.yaml` 和 `onescience_run_manifest.yaml`。当前工作区中大文件以链接方式组织,`metadata/file_manifest.yaml` 记录了关键文件与原始数据之间的文件名、大小和 SHA256 校验信息。 ### 适用模型 | 模型 ID | 用途 | 模型期望路径 | |---|---|---| | `OneScience/AlphaFold3/` | 推理输入、MMseqs 搜索、Jackhmmer 搜索、模板数据库 | `data/alphafold3_dataset` | ## 文件说明 | 路径 | 类型 | 作用 | 是否必需 | 用于能力 | 下载后放置位置 | 备注 | |---|---|---|---|---|---|---| | `manifest.yaml` | Manifest 文件 | 机器可读数据集说明 | 是 | 全部能力 | 数据集包根目录 | 大模型必须解析 | | `onescience_run_manifest.yaml` | 运行 Manifest | 网页端读取入口 | 是 | 全部能力 | 数据集包根目录 | 与 `manifest.yaml` 一致 | | `metadata/file_manifest.yaml` | 完整性清单 | 记录关键文件的源路径、整理路径、大小和 SHA256 | 是 | 预检 | `metadata/` | 验证整理后一致性 | | `scripts/validate_dataset.py` | 验证脚本 | 检查目录、JSON schema、大小和 SHA256 | 是 | 数据读取验证 | `scripts/` | 不运行模型 | | `data/infer_input_data/` | 输入样例 | AlphaFold3 JSON 样例,含 all_data 和 pressure_data | 是 | 推理、预检 | `data/infer_input_data/` | 最小样例为 `all_data/7r6r_data.json` | | `data/public_databases/` | 公共数据库 | Jackhmmer 和模板搜索数据库 | 是 | 数据管线 | `data/public_databases/` | 上传视图使用 `pdb_2022_09_28_mmcif_files.tar` 代替解开的 `mmcif_files/` 目录,以规避文件数限制 | | `data/mmseqsDB/` | MMseqs 数据库 | MMseqs 搜索数据库 | 是 | MMseqs 数据管线 | `data/mmseqsDB/` | 包含 small_bfd、mgnify、uniprot、uniref90 | | `data/jackhmmer_split/` | 分片数据库 | Jackhmmer 搜索用 sharded FASTA | 是 | Jackhmmer 数据管线 | `data/jackhmmer_split/` | 分片数量见目录文件名 | | `data/alignDB/` | 对齐数据库 | 对齐相关数据 | 否 | 高级流程 | `data/alignDB/` | 可选 | `infer_input_data` 中的 JSON 遵循 AlphaFold3 fold input 结构,关键字段包括 `dialect`、`version`、`name`、`sequences` 和 `modelSeeds`。`public_databases` 主要是 FASTA、mmCIF 和 PDB seqres。`mmseqsDB` 是 MMseqs 数据库文件组。`jackhmmer_split` 是按 `name-00000-of-xxxxx` 命名的分片 FASTA。 注意:ModelScope 上传视图中不包含解开的 `data/public_databases/mmcif_files/` 目录,而是包含 `data/public_databases/pdb_2022_09_28_mmcif_files.tar`。运行需要 mmCIF 目录的模板搜索前,请在 `data/public_databases` 下执行 `tar -xf pdb_2022_09_28_mmcif_files.tar`。 本数据集适配模型 `OneScience/AlphaFold3/`。数据集 Manifest 的 `relations.compatible_models` 提供完整 `resource_ref`,指向 `https://modelscope.cn/models/OneScience/AlphaFold3/`。模型仓库的 `relations.required_datasets` 会反向引用本数据集。 ## 使用说明 ### 文件与下载 下载数据集: ```bash modelscope download --dataset OneScience/AlphaFold3_dataset ``` 下载适配模型: ```bash modelscope download --model OneScience/AlphaFold3/ ``` 如果使用 `--cache_dir`,验证前必须切换到实际下载出的数据集包根目录。 ### 数据放置位置 数据集单独下载后,可以保持在数据集包根目录运行验证。供模型使用时,应将本仓库的 `data` 子目录放到模型包: ```text <model-package>/data/alphafold3_dataset ``` 可通过复制或链接实现: ```bash mkdir -p /path/to/model-package/data ln -s /path/to/AlphaFold3_dataset/data /path/to/model-package/data/alphafold3_dataset ``` ### 数据读取验证 在数据集包根目录执行: ```bash python scripts/validate_dataset.py --root . ``` 验证脚本会解析 `metadata/file_manifest.yaml`,检查关键目录存在、JSON 样例可读、文件名一致、大小一致和 SHA256 一致。成功时输出 `dataset_validation_ok: true`。 ## OneScience 官方信息 | 平台 | OneScience 主仓库 | Skills 仓库 | |---|---|---| | Gitee |https://gitee.com/onescience-ai/onescience | https://gitee.com/onescience-ai/oneskills | | GitHub | https://github.com/onescience-ai/OneScience | https://github.com/onescience-ai/oneskills | ## 限制与许可证 当前数据集规模很大,本地整理目录采用符号链接指向原始只读目录。正式上传到 ModelScope 前可按平台要求使用实体文件、大文件上传或对象存储策略,并重新执行 `python scripts/validate_dataset.py --root .`。公共数据库和 AlphaFold3 相关数据需遵守各自上游许可和使用条款。



