遇见数据集

alxfgh/ChEMBL_Drug_Instruction_Tuning

收藏
Hugging Face2023-06-24 更新2024-03-04 收录
官方服务:

资源简介:

--- task_categories: - question-answering language: - en pretty_name: ChEMBL Drug Instruction Tuning --- # Dataset Card for ChEMBL Drug Instruction Tuning ## Dataset Description - **Homepage:** - **Repository:** - **Paper:** - **Leaderboard:** - **Point of Contact:** ### Dataset Summary This dataset card aims to be a base template for new datasets. It has been generated using [this raw template](https://github.com/huggingface/huggingface_hub/blob/main/src/huggingface_hub/templates/datasetcard_template.md?plain=1). ### Supported Tasks and Leaderboards [More Information Needed] ### Languages [More Information Needed] ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale [More Information Needed] ### Source Data #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ### Annotations #### Annotation process [More Information Needed] #### Who are the annotators? [More Information Needed] ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information [More Information Needed] ### Contributions [More Information Needed]

--- task_categories: - 问答任务 language: - 英语 pretty_name: ChEMBL药物指令微调(ChEMBL Drug Instruction Tuning) --- # ChEMBL药物指令微调数据集卡片 ## 数据集描述 - **主页:** - **代码仓库:** - **相关论文:** - **排行榜:** - **联系人:** ### 数据集概述 本数据集卡片旨在作为新建数据集的基础模板,其通过[此原始模板](https://github.com/huggingface/huggingface_hub/blob/main/src/huggingface_hub/templates/datasetcard_template.md?plain=1)生成。 ### 支持任务与排行榜 [More Information Needed] ### 语言 [More Information Needed] ## 数据集结构 ### 数据实例 [More Information Needed] ### 数据字段 [More Information Needed] ### 数据划分 [More Information Needed] ## 数据集构建 ### 遴选依据 [More Information Needed] ### 源数据 #### 初始数据收集与标准化处理 [More Information Needed] #### 源语言生成者为何人? [More Information Needed] ### 标注信息 #### 标注流程 [More Information Needed] #### 标注者为何人? [More Information Needed] ### 个人与敏感信息 [More Information Needed] ## 数据集使用注意事项 ### 数据集的社会影响 [More Information Needed] ### 偏差讨论 [More Information Needed] ### 其他已知局限性 [More Information Needed] ## 附加信息 ### 数据集整理者 [More Information Needed] ### 许可信息 [More Information Needed] ### 引用信息 [More Information Needed] ### 贡献内容 [More Information Needed]

提供机构:
alxfgh
原始信息汇总

数据集概述

基本信息

  • 任务类别: 问答(question-answering)
  • 语言: 英语(en)
  • 数据集名称: ChEMBL Drug Instruction Tuning

数据集描述

  • 数据集概要: 本数据集卡片旨在作为新数据集的基础模板,使用此原始模板生成。

数据集结构

  • 数据实例: 信息待补充
  • 数据字段: 信息待补充
  • 数据分割: 信息待补充

数据集创建

  • 筛选理由: 信息待补充
  • 源数据:
    • 初始数据收集与标准化: 信息待补充
    • 源语言生产者: 信息待补充
  • 注释:
    • 注释过程: 信息待补充
    • 注释者: 信息待补充
  • 个人和敏感信息: 信息待补充

使用数据时的考虑

  • 数据集的社会影响: 信息待补充
  • 讨论偏见: 信息待补充
  • 其他已知限制: 信息待补充

附加信息

  • 数据集管理者: 信息待补充
  • 许可信息: 信息待补充
  • 引用信息: 信息待补充
  • 贡献: 信息待补充
搜集汇总
数据集介绍
alxfgh/ChEMBL_Drug_Instruction_Tuning 数据集图片
构建方式
ChEMBL_Drug_Instruction_Tuning数据集基于ChEMBL药物数据库构建,通过提取药物分子相关的结构信息、药理学特性及靶点关系,将其转化为指令微调格式。每条数据包含自然语言问题与对应答案,覆盖药物性质查询、机制解释等任务。构建过程强调结构化知识向问答对的转化,确保数据覆盖药物研发领域的核心知识点。
特点
该数据集专注于药物领域的指令微调,具有高度专业化的特点。其数据实例以英文呈现,涵盖药物分子属性、生物活性及临床应用等多元信息。通过将ChEMBL中的结构化数据映射为自然语言问答,数据集既保留了医药知识的准确性,又增强了模型对复杂药物概念的理解能力,适用于生物医学问答系统的优化。
使用方法
数据集适用于监督微调(SFT)范式,可直接用于训练大语言模型以提升药物相关问答性能。使用时需加载JSON格式的问答对,按标准指令微调流程处理。建议结合领域预训练模型,如BioBERT或PubMedBERT,以最大化药物知识迁移效果。数据无需额外清洗,可直接拆分训练集与验证集。
背景与挑战
背景概述
在生物医药领域,药物发现与开发是一个高度复杂且耗时的过程,传统方法依赖于专家经验和大量实验筛选,效率低下且成本高昂。近年来,大语言模型在自然语言处理任务中展现出卓越能力,为药物研发的智能化转型提供了新契机。alxfgh/ChEMBL_Drug_Instruction_Tuning数据集应运而生,其创建基于ChEMBL这一权威药物化学数据库,旨在通过指令微调的方式,赋予语言模型对药物分子属性、靶点作用机制等专业知识的理解与问答能力。该数据集由研究机构于2023年左右推出,核心研究问题在于如何将结构化药物数据转化为可被模型学习的指令格式,从而推动人工智能辅助药物设计的前沿探索,对计算药理学和生物信息学领域具有重要影响。
当前挑战
该数据集面临的核心挑战包括:首先,在领域问题层面,药物分子结构与生物活性之间存在高度非线性关系,传统问答任务难以直接映射至化学空间,模型需同时掌握分子式、SMILES表示及药理学概念,这对指令数据的语义对齐提出严苛要求。其次,在构建过程中,从ChEMBL数据库提取并清洗海量异构数据时,面临数据噪声、标注不一致及分子多样性覆盖不足等难题,例如分子量、LogP等物理化学属性与临床适应症之间的关联难以通过简单规则泛化。此外,确保指令数据的生物医学准确性,避免引入虚假关联,是维护数据集可信度的关键挑战。
常用场景
经典使用场景
在药物发现与生物信息学交叉领域,alxfgh/ChEMBL_Drug_Instruction_Tuning数据集为大规模药物指令微调提供了高质量的问答对资源。其经典使用场景聚焦于构建和优化基于大语言模型的药物知识问答系统,研究者利用该数据集对预训练模型进行指令微调,使模型能够精准理解药物分子结构、药理活性、靶点信息等专业查询,并生成符合药理学逻辑的回答。这一过程显著提升了模型在药物研发问答任务中的表现,成为连接化学信息学与自然语言处理的关键桥梁。
衍生相关工作
基于该数据集衍生了多项开创性工作,包括药物领域专用大语言模型BioMedLM的指令微调版本、融合分子图表示与文本推理的多模态药物问答框架,以及面向药物不良反应预测的对比学习模型。这些工作不仅验证了指令微调在药物知识蒸馏中的有效性,还催生了诸如DrugChat等交互式药物分析平台,进一步拓展了数据集的学术影响力,推动了人工智能驱动的药物发现方法论革新。
数据集最近研究
最新研究方向
在药物发现与人工智能的交叉前沿,ChEMBL_Drug_Instruction_Tuning数据集正引领着大规模语言模型在生物医学领域的指令微调研究。该数据集基于ChEMBL数据库中丰富的药物化学信息,通过构建问答形式的指令样本,为预训练语言模型提供了针对药物分子属性预测、靶点识别及药效分析等任务的专业训练素材。随着大模型在分子生成与性质预测中的突破性应用,该数据集成为连接自然语言处理与计算药物设计的关键桥梁,推动了少样本学习与跨模态推理在制药行业的落地。其意义不仅在于提升模型对化学知识的理解能力,更在于加速候选药物的虚拟筛选流程,为精准医疗和新药研发注入智能化动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务