Tx-Evaluation
收藏资源简介:
Tx-Evaluation数据集由巴黎高等师范学院的Valence Labs创建,旨在评估转录组学基础模型在扰动分析中的性能。该数据集整合了来自不同测序技术和细胞系的公开数据,用于评估模型在处理中大规模扰动数据时的表现。数据集的创建过程涉及对现有生物任务的整理和新评估任务的引入,如结构完整性。该数据集主要应用于生物扰动分析领域,旨在解决现有模型在理解和预测生物扰动效应方面的不足。
The Tx-Evaluation dataset was created by Valence Labs at École Normale Supérieure de Paris, aiming to evaluate the performance of foundational transcriptomic models in perturbation analysis. This dataset integrates publicly available data from diverse sequencing technologies and cell lines to assess model performance when handling medium-to-large scale perturbation data. The dataset creation process involves curating existing biological tasks and introducing novel evaluation tasks such as structural integrity. Primarily applied in the field of biological perturbation analysis, this dataset is designed to address the limitations of current models in understanding and predicting the effects of biological perturbations.
数据集概述
数据准备
- 数据目录结构:
- 在项目根目录下创建
datasets文件夹。 - 在
datasets文件夹中创建以下子目录:evaltraintest1test2
- 在项目根目录下创建
- 数据文件:
- 将完整的数据文件(anndata h5ad格式)放入
datasets/eval目录中。 - 支持的数据集包括
replogle_2022和l1000_crispr,也可以使用自定义的扰动数据进行评估。
- 将完整的数据文件(anndata h5ad格式)放入
嵌入准备
- 嵌入提取:
- 使用要评估的模型从
datasets/eval中的adata提取嵌入。 - 将嵌入保存到
adata.obsm[your_model_key]中,形状和顺序应与原始数据adata.X和adata.obs相同。
- 使用要评估的模型从
数据分割
- 训练和测试数据分割:
- 将数据分割为训练集和测试集。
- 测试集
test1用于线性探测和knn,共享与训练集相同的扰动,但具有不同的批次。 - 测试集
test2用于重建,具有与训练集不同的扰动和批次。
配置文件
- 自定义配置文件:
- 如果使用与
replogle_2022和l1000_crispr不同的评估数据集,需要创建新的配置文件。 - 参考
./cfg/config/replogle_eval.yaml和./cfg/config/replogle_eval_reconstruct.yaml模板创建配置文件。
- 如果使用与
运行代码
- 运行命令:
-
从根目录运行评估代码:
python main_eval.py --config ./cfg/config/replogle_eval.yaml --seed {{SEED}} --run_name {{JOB_NAME}} --eval_method {{JOB_TYPE}} --obsm_key {{OBSM_KEY}}
-
替换
{{JOB_TYPE}}为选择的评估方法(bmdb,bmdb_precision,reconstruct,linear,knn,ilisi)。 -
如果使用SLURM进行作业管理,运行以下命令:
bash cfg/schedulers/submit_jobs.sh
或
bash cfg/schedulers/submit_arrays.sh
-




