BFD
收藏资源简介:
BFD源存档索引数据集包含原始的BFD源存档文件及其压缩字节范围索引,用于高效浏览和预览。由于原始存档文件体积庞大(约292GB),数据集默认提供基于1GiB压缩数据块的索引表,而非完整的序列数据。数据以Parquet格式存储,分为训练集(255行)和测试集(17行),共272行;划分依据是块标识符(index_id)的SHA256哈希值取模10的结果,其中桶0为测试集,桶1至9为训练集。每行数据包含详细的压缩块元信息,如稳定的行ID(index_id)、所属Hugging Face仓库(repo_id)、源文件名(source_file)、源仓库提交哈希(source_sha)、源文件格式(source_format)、块索引(chunk_index)、字节起始和结束位置(byte_start, byte_end_exclusive)、压缩块大小(chunk_size_bytes)、总存档大小(total_size_bytes)、目标块大小(chunk_size_gib)、是否为第一块或最后一块的标志(is_first_chunk, is_last_chunk)、索引范围说明(access_note)以及分割桶(split_bucket)。该数据集主要用于对BFD源存档进行快速检查、Dataset Viewer预览和获取源文件大小与分块元数据;完整的蛋白质序列数据需使用原始存档文件。适用于生物学、蛋白质序列数据库相关的索引构建、数据管理和元数据分析任务。
BFD Source Archive Index 数据集概述
数据集简介
该数据集提供了BFD(Big Fantastic Database)源档案的索引,包含原始压缩档案及便于查看的字节范围索引。原始档案约292 GB,默认的数据查看器表格基于1 GiB的压缩块索引,而非完整的序列展开表。用户可获取完整的序列数据或通过Parquet表格进行快速检查。
数据集划分
数据集按确定性方式划分,基于块标识符的哈希值:sha256(index_id) % 10。值为0的桶为测试集,值为1至9的桶为训练集。
| 划分 | 行数 |
|---|---|
| 训练集 | 255 |
| 测试集 | 17 |
| 总计 | 272 |
源文件
| 文件 | 大小 |
|---|---|
bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt.tar.gz |
291,649,557,441 字节 |
列描述
| 列名 | 描述 |
|---|---|
index_id |
每个压缩块的稳定行ID。 |
repo_id |
Hugging Face数据集仓库。 |
source_file |
源档案文件名。 |
source_sha |
用于构建索引的源仓库提交哈希。 |
source_format |
源档案格式。 |
chunk_index |
从零开始的压缩块索引。 |
byte_start |
包含的压缩字节偏移量。 |
byte_end_exclusive |
不包含的压缩字节结束偏移量。 |
chunk_size_bytes |
压缩块大小(字节)。 |
total_size_bytes |
完整压缩档案大小。 |
chunk_size_gib |
目标块大小(GiB)。 |
is_first_chunk |
是否为第一个压缩块。 |
is_last_chunk |
是否为最后一个压缩块。 |
access_note |
索引范围的说明。 |
split_bucket |
基于sha256(index_id) % 10的确定性划分桶。 |
使用示例
- 加载索引:使用
load_dataset("LiteFold/BFD")。 - 加载特定划分:指定
split="train"或split="test"。 - 下载原始档案:通过
huggingface_hub的hf_hub_download函数下载。 - 读取源文件清单:下载
metadata/source_files.parquet并使用Pandas读取。
数据准备
用于创建Parquet文件的标准化脚本位于scripts/prepare_bfd_dataset.py。





