bio-datasets-1M
收藏资源简介:
Bio Datasets 1M 是一个开源的合成生物学数据集集合,旨在为全球学生提供学习资源。该集合包含多达1,000,000个数据集,覆盖生物学多个核心领域,包括基因组学、蛋白质组学、生态学、微生物学、植物学、动物学、细胞生物学、神经科学、生物化学和生物信息学。数据为合成生成,仅用于教育目的,不适用于临床或研究应用。数据集以表格形式存储为CSV文件,适用于表格分类和回归任务。数据通过GitHub仓库每5分钟自动更新,并采用CC0-1.0许可证,允许自由使用、修改和发布。
Bio Datasets 1M is an open-source synthetic biology dataset collection designed to provide learning resources for students worldwide. The collection includes up to 1,000,000 datasets covering multiple core areas of biology, such as genomics, proteomics, ecology, microbiology, botany, zoology, cell biology, neuroscience, biochemistry, and bioinformatics. The data is synthetically generated and intended solely for educational purposes, not for clinical or research applications. The datasets are stored in CSV files in tabular format, suitable for tabular classification and regression tasks. The data is automatically updated every 5 minutes via a GitHub repository and uses the CC0-1.0 license, allowing free use, modification, and distribution.
📊 Bio Datasets 1M 数据集概述
基本信息
- 数据集名称: Bio Datasets 1M
- 许可证: CC0-1.0(公共领域,可自由使用、修改和发布)
- 语言: 英语(en)
- 任务类型: 表格分类、表格回归
- 数据集规模: 100K 至 1M 条记录
- 标签: 生物学、基因组学、蛋白质组学、生态学、教育、合成数据
数据集描述
该数据集是一个面向全球学生的开放合成生物学数据集集合,最多包含 1,000,000 个数据集。数据每 5 分钟 从 GitHub 自动更新。
⚠️ 注意: 数据为合成数据,仅用于学习目的,不可用于临床用途。
数据分类(类别涵盖)
- 基因组学
- 蛋白质组学
- 生态学
- 微生物学
- 植物学
- 动物学
- 细胞生物学
- 神经科学
- 生物化学
- 生物信息学
使用示例(Python)
python from huggingface_hub import hf_hub_download import pandas as pd
path = hf_hub_download( repo_id="umeshtharukamalaviarachchi/bio-datasets-1M", filename="datasets/genomics/genomics_000123_variant.csv", repo_type="dataset", ) df = pd.read_csv(path)
许可与声明
- 许可证: CC0-1.0 — 公共领域,允许自由使用、二次创作和发布。
- 用途限制: 数据为合成数据,仅限学习使用,禁止用于临床场景。




