maomlab/Boldini2024
收藏资源简介:
--- license: mit task_categories: - tabular-classification - tabular-regression language: - en tags: - HTS pretty_name: Assay-Interfering-Compounds Finder size_categories: - 1M<n<10M dataset_summary: >- The assay-interfering-compounds finder consists of 17 different datasets. The datasets are uploaded after molecular sanitization using RDKit and MolVS. citation: >- @article{Boldini2024, title = {Machine Learning Assisted Hit Prioritization for High Throughput Screening in Drug Discovery}, ISSN = {2374-7951}, url = {http://dx.doi.org/10.1021/acscentsci.3c01517}, DOI = {10.1021/acscentsci.3c01517}, journal = {ACS Central Science}, publisher = {American Chemical Society (ACS)}, author = {Boldini, Davide and Friedrich, Lukas and Kuhn, Daniel and Sieber, Stephan A.}, year = {2024}, month = mar } config_names: - Boldini2024 configs: - config_name: Boldini2024 data_files: - GPCR.csv - GPCR2.csv - GPCR3.csv - channel_atp.csv - cysteine_protease.csv - IonChannel.csv - IonChannel2.csv - IonChannel3.csv - kinase.csv - serine.csv - splicing.csv - transcrption.csv - transcription2.csv - transcription3.csv - transporter.csv - ubiquitin.csv - zinc_finger.csv dataset_info: - config_name: GPCR_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: GPCR2_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: GPCR3_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: channel_atp_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: cysteine_protease_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: IonChannel_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: IonChannel2_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: IonChannel3_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: kinase_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: serine_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: splicing_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: transcription_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: transcription2_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: transcription3_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: transporter_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: ubiquitin_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 - config_name: zinc_finger_sanitized features: - name: "SMILES" dtype: string - name: "Primary" dtype: int64 - name: "Score" dtype: float64 - name: "Confirmatory" dtype: float64 --- # Boldini2024 (Assay-Interfering-Compounds Finder) 17 Datasets that are used to employ Minimum Variance Sampling Analysis (MVS-A) to find Assay Interfering Compounds (AIC) in High Throughput Screening data. In this study, they present the first data-driven approach to simultaneously detect assay interferents and prioritize true bioactive compounds. Their method enables false positive and true positive detection without relying on prior screens or assay interference mechanisms, making it applicable to any high throughput screening campaign. The datasets uploaded to our Hugging Face repository have been sanitized using RDKit and MolVS. If you want to try these processes with the original dataset, please follow the instructions in the [Processing Script.py](https://huggingface.co/datasets/maomlab/Boldini2024/blob/main/Boldini2024%20Preprocessing.py) file in the maomlab/Boldini2024. # Citation ACS Cent. Sci. 2024, 10, 4, 823–832 Publication Date:March 15, 2024 https://doi.org/10.1021/acscentsci.3c01517
许可证: MIT许可证 任务类别: - 表格分类任务 - 表格回归任务 语言: 英语 标签: 高通量筛选(High Throughput Screening,HTS) 友好名称: 实验干扰化合物查找数据集 数据规模分类: 100万 < 数据量 < 1000万 数据集概述: 本实验干扰化合物查找工具包含17个不同的数据集,所有数据集均经RDKit与MolVS完成分子标准化清洗后上传。 引用文献: @article{Boldini2024, title: {机器学习辅助的药物发现高通量筛选命中化合物优先级排序}, ISSN: {2374-7951}, url: {http://dx.doi.org/10.1021/acscentsci.3c01517}, DOI: {10.1021/acscentsci.3c01517}, journal: {ACS Central Science}, publisher: {美国化学学会(ACS)}, author: {Boldini, Davide、Friedrich, Lukas、Kuhn, Daniel、Sieber, Stephan A.}, year: {2024}, month: 3月 } 配置名称: - Boldini2024 配置项: - config_name: Boldini2024 数据文件: - GPCR.csv - GPCR2.csv - GPCR3.csv - channel_atp.csv - cysteine_protease.csv - IonChannel.csv - IonChannel2.csv - IonChannel3.csv - kinase.csv - serine.csv - splicing.csv - transcrption.csv - transcription2.csv - transcription3.csv - transporter.csv - ubiquitin.csv - zinc_finger.csv 数据集信息: - config_name: GPCR_sanitized 特征: - 名称: 简化分子线性输入规范(Simplified Molecular Input Line Entry System,SMILES) 数据类型: 字符串 - 名称: Primary 数据类型: 64位整数 - 名称: Score 数据类型: 64位浮点数 - 名称: Confirmatory 数据类型: 64位浮点数 - config_name: GPCR2_sanitized 特征: 与GPCR_sanitized一致 - config_name: GPCR3_sanitized 特征: 与GPCR_sanitized一致 - config_name: channel_atp_sanitized 特征: 与GPCR_sanitized一致 - config_name: cysteine_protease_sanitized 特征: 与GPCR_sanitized一致 - config_name: IonChannel_sanitized 特征: 与GPCR_sanitized一致 - config_name: IonChannel2_sanitized 特征: 与GPCR_sanitized一致 - config_name: IonChannel3_sanitized 特征: 与GPCR_sanitized一致 - config_name: kinase_sanitized 特征: 与GPCR_sanitized一致 - config_name: serine_sanitized 特征: 与GPCR_sanitized一致 - config_name: splicing_sanitized 特征: 与GPCR_sanitized一致 - config_name: transcription_sanitized 特征: 与GPCR_sanitized一致 - config_name: transcription2_sanitized 特征: 与GPCR_sanitized一致 - config_name: transcription3_sanitized 特征: 与GPCR_sanitized一致 - config_name: transporter_sanitized 特征: 与GPCR_sanitized一致 - config_name: ubiquitin_sanitized 特征: 与GPCR_sanitized一致 - config_name: zinc_finger_sanitized 特征: 与GPCR_sanitized一致 # Boldini2024(实验干扰化合物查找数据集) 本数据集包含17个数据集,用于结合最小方差采样分析(Minimum Variance Sampling Analysis,MVS-A),在高通量筛选(High Throughput Screening,HTS)数据中识别实验干扰化合物(Assay Interfering Compounds,AIC)。 本研究提出了首个数据驱动方法,可同时检测实验干扰物并对真实生物活性化合物进行优先级排序。该方法无需依赖预筛选实验或已知的实验干扰机制,即可实现假阳性与真阳性化合物的识别,适用于所有高通量筛选项目。 上传至Hugging Face仓库的数据集已通过RDKit与MolVS完成分子标准化清洗。若需使用原始数据集复现该处理流程,请参照maomlab/Boldini2024仓库中的[Processing Script.py](https://huggingface.co/datasets/maomlab/Boldini2024/blob/main/Boldini2024%20Preprocessing.py)文件。 # 引用信息 ACS Cent. Sci. 2024, 10, 4, 823–832 发表日期: 2024年3月15日 https://doi.org/10.1021/acscentsci.3c01517



