遇见数据集

clinical-trials-drug-approvals-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集汇集了来自ClinicalTrials.gov和FDA官方数据源的临床试验与药物批准信息,由DataForge开源数据计划提供。数据集包含四个子表: - trials(临床试验):635,666条记录,涵盖试验ID、注册机构、标题、阶段、状态、条件、干预措施、赞助商、入组人数、日期、地点等字段。 - drug_ndc(国家药品编码):136,520条记录,包含产品NDC、品牌名、通用名、活性成分、剂型、营销类别、标签商等信息。 - drug_products(药品产品):51,593条记录,包括FDA申请号、品牌名、通用名、活性成分、剂型、批准类型、橙皮书状态、专利及独占期信息。 - pipeline_view(管线视图):234,483条记录,按赞助商、条件、阶段汇总的临床试验统计视图,包含试验数量、活跃/完成/中止试验数、药物、注册机构、总入组人数、国家等。 数据规模:S包(635,666行)和M包(1,058,262行),M包将临床试验与FDA批准数据关联。适用任务包括管线与竞争对手情报分析、试验选址与入组研究、监管分析、生物技术投资研究。数据以Parquet格式提供,可通过Hugging Face Datasets库加载,支持四个配置选项。许可证为CC BY-NC 4.0(学术/个人使用),商业使用需获得DataForge商业许可。

This dataset aggregates clinical trial and drug approval information from ClinicalTrials.gov and official FDA data sources, provided by the DataForge Open Data Initiative. It includes four sub-tables: - trials: 635,666 records covering trial ID, registry, title, phase, status, conditions, interventions, sponsors, enrollment, dates, locations, etc. - drug_ndc: 136,520 records containing product NDC, brand name, generic name, active ingredients, dosage form, marketing category, labeler, etc. - drug_products: 51,593 records including FDA application number, brand name, generic name, active ingredients, dosage form, approval type, Orange Book status, patent and exclusivity information. - pipeline_view: 234,483 records summarizing clinical trial statistics by sponsor, condition, and phase, including trial count, active/completed/terminated trials, drugs, registry, total enrollment, countries, etc. Data sizes: S package (635,666 rows) and M package (1,058,262 rows), with the M package linking clinical trials to FDA approval data. Applicable tasks include pipeline and competitive intelligence analysis, trial site selection and enrollment research, regulatory analysis, and biotech investment research. Data is provided in Parquet format, loadable via the Hugging Face Datasets library, supporting four configuration options. License: CC BY-NC 4.0 (academic/personal use); commercial use requires a DataForge commercial license.

创建时间:
2026-08-08
原始信息汇总

临床试验与药物审批数据集(Clinical Trials & Drug Approvals)

数据集概述

该数据集整合了 635K+ 条注册临床试验记录(包含申办方、病症和干预措施)以及 1.06M 行药物智能数据包,将临床试验与 FDA 药物审批信息关联起来。数据集由 DataForge 开放数据计划提供,适用于学术和个人用途。

数据表结构与规模

配置名称 行数 内容简介
trials 635,666 临床试验核心数据,含 NCT/EU CT/ISRCTN 编号、申办方、阶段、病症、干预措施、试验状态、地理位置等
drug_products 51,593 FDA 药物产品信息,含申请号、品牌名、活性成分、审批日期、专利信息、橙皮书状态等
drug_ndc 136,520 国家药品代码(NDC)层面的药物信息,含标签商、营销类别、RxNorm 和 UNII 标识符等
pipeline_view 234,483 管线汇总视图,按申办方集团 × 病症 × 试验阶段聚合,含试验计数、国家分布、催化日期等

关键字段说明

trials 表核心字段

  • trial_id / registry:试验注册号和来源注册库(CTGOV / EU_CTIS / ISRCTN)
  • phase / phases:规范化后的最高试验阶段
  • overall_status / status_group:统一枚举的试验状态及粗粒度分组(计划/进行中/已完成/中止/未知)
  • lead_sponsor_group / lead_sponsor_class:申办方归一的集团名称和类别(行业/学术/政府/其他)
  • conditions / intervention_names:注册病症和干预措施名称,含 MeSH 术语映射
  • drug_names_normalized:标准化为活性成分/INN 的药物干预名称
  • enrollment_count / location_country_count:入组人数和涉及国家数

drug_products 表核心字段

  • application_number:FDA 申请号(NDA/ANDA/BLA)
  • is_generic / is_biologic:仿制药/生物药标记
  • first_approval_date / latest_approval_date:最早/最近审批日期
  • patent_count / patent_numbers:橙皮书专利数量及编号
  • loss_of_exclusivity_date:预估独占权丧失日期(取专利到期与独占权结束的最大值)

应用场景

  • 管线与竞争情报分析
  • 试验点选择与入组研究
  • 监管分析
  • 生物技术投资研究

数据来源与方法

数据来源于 ClinicalTrials.govFDA 官方数据集,以 Parquet 格式存储,每个数据包内含数据字典、数据表说明和质量评估报告。

许可协议

采用双重许可

  • 学术/个人用途:CC BY-NC 4.0,需注明来源并回链至 data.zalize.com
  • 商业用途:需获得 DataForge 商业许可
  • 上游数据(ClinicalTrials.gov 和 FDA 公共数据)的许可条款继续适用

引用方式

text DataForge (data.zalize.com), built from ClinicalTrials.gov and FDA public data — https://data.zalize.com/datasets/clinical-trials-drug-approvals-dataset

DOI(Zenodo 镜像):10.5281/zenodo.21812647

搜集汇总
数据集介绍
clinical-trials-drug-approvals-dataset 数据集图片
构建方式
本数据集由DataForge开放数据计划构建,整合了ClinicalTrials.gov注册的63万余项临床试验记录与美国FDA官方药品审批信息,形成涵盖试验、药品、审批及管线视图的多维度数据体系。数据以Parquet格式存储,划分为drug_ndc、drug_products、pipeline_view和trials四个配置模块,分别对应药品NDC编码、药品产品信息、赞助商-适应症-阶段聚合视图及临床试验原始记录。每条记录均包含来源URL与采集时间戳,确保可追溯性。通过标准化处理,对赞助商名称、活性成分、适应症等字段进行归一化映射,并关联MeSH术语、RxNorm概念ID等医学本体,提升了跨数据集整合的语义一致性。
特点
该数据集的核心特色在于其规模宏大且结构精细,总行数超过百万级,为药物研发与监管分析提供了丰富的数据基础。其多源融合特性尤为突出,将临床试验注册数据与FDA审批、橘皮书专利及排他性信息无缝衔接,使得研究者能够追踪药物从临床试验到上市审批的全生命周期。数据质量方面,通过归一化处理企业集团归属、统一试验状态枚举、计算专利到期与市场独占期等衍生指标,大大增强了数据的可用性。此外,数据集包含详细的元数据文档,如数据字典与质量评估报告,为用户的深度解析与验证提供了坚实支撑。
使用方法
使用者可通过HuggingFace数据集库便捷访问,利用load_dataset函数按需加载特定配置,例如加载trials配置获取全部临床试验记录,或使用pipeline_view配置进行竞争情报分析。数据集的典型应用场景包括药物管线与竞品动态监测、临床试验基地选择与患者招募策略制定、监管合规性分析以及生物技术投资决策支持。结合Python生态,用户可基于Parquet格式的高效列式存储进行大规模数据筛选、聚合与可视化,亦可将其集成至机器学习管道中,用于临床试验结果预测、药物重定位等前沿研究。学术与非商业用途遵循CC BY-NC 4.0许可,商业利用则需获取DataForge商业授权。
背景与挑战
背景概述
该数据集由DataForge开放数据项目构建,整合了ClinicalTrials.gov注册平台与FDA公开药物审批数据,创建于2026年,包含超过63.5万项注册临床试验及逾百万行药物审批关联记录,核心研究问题在于弥合临床试验信息与监管审批结果之间的鸿沟。通过多维度字段设计,如试验分期、适应症、干预措施、申办方归属及专利与专营权信息,数据集支持管线情报、竞争者分析、临床试验选址及监管合规研究,在药物研发和生物技术投资领域具有重要应用价值,为学术界与工业界提供了统一、可溯源的数据基础设施。
当前挑战
该数据集所解决的领域挑战在于临床试验信息碎片化与审批数据分散化,难以支持跨库关联分析,其构建面临多重技术难题:多源异构数据整合需处理注册机构间差异,包括状态字段归一化、药物名称标准化及企业层级映射;时间维度复杂性要求对历史数据快照进行追踪,校准起始日期与修订记录;缺失与冲突信息需通过规则引擎与外部知识库补全,同时保持数据伦理合规性,确保在开源许可下不泄露商业敏感信息,最终形成了兼顾广度与深度的药物研发智能数据资产。
常用场景
经典使用场景
该数据集整合了ClinicalTrials.gov与FDA的权威数据,涵盖超过63万项注册临床试验及逾百万条药品审批记录,为药物研发全周期提供了系统性的量化视图。其经典使用场景聚焦于临床试验设计与药物开发现状的全景透视,研究者可借此剖析不同疾病领域的试验分布、干预措施类型及阶段性推进状况,亦可追踪特定药物从早期探索到上市审批的完整轨迹,从而洞悉药物研发的格局与趋势。
实际应用
在实际应用中,该数据集已成为制药企业、生物技术公司及投资机构的战略决策支撑工具。它能够助力竞争情报分析,通过追踪同行研发管线动态识别战略机遇;优化临床试验选址与患者招募策略,依据全球试验分布数据合理配置资源;亦可用于监管风险评估,预测审批结果与市场独占期。在投资研究领域,其前瞻性指标如催化剂日期与试验终止信号,为生物医药投资提供了量化依据,辅助资本高效配置。
衍生相关工作
基于此数据集,业界已衍生出多项开创性工作,涵盖研发管线智能分析平台、临床试验推荐系统及药物重定位引擎等应用。在学术层面,它支撑了关于临床试验趋势的计量分析、药物审批时滞的区域比较研究,以及罕见病药物开发模式评估等多项成果。这些衍生工作不仅拓展了原始数据的应用边界,还促进了药物信息学、监管科学和商业智能的交叉创新,为后续研究提供了方法学参考和基准数据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务