遇见数据集

fda_project

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集由从 FDA 药物审评文档中提取的审评员关注点陈述构成。数据通过 Qwen3.6-27B 大语言模型对 FDA 审评文档进行分块和提示抽取得到。每条记录代表一个被识别的关注点,包含以下字段:申请编号(application_number)、药物名称(drug_name)、月份(month)、文档标题(document_title)、章节标题(section_heading)、页码(page)、精确引用(exact_quote)、判断摘要(judgment_summary)、陈述类型(statement_type,如显式关注、隐式/委婉关注、建议、解决方案)、主题(topic)、是否显式(explicit)、目标(target)以及源文件路径(source_path)。数据以 CSV 和 JSON 格式输出,适用于药物审评分析、关注点分类、审评员决策行为研究等自然语言处理任务。

This dataset consists of reviewer concern statements extracted from FDA drug review documents. The data is obtained by chunking and prompting FDA review documents using the Qwen3.6-27B large language model. Each record represents an identified concern and includes the following fields: application_number, drug_name, month, document_title, section_heading, page, exact_quote, judgment_summary, statement_type (e.g., explicit concern, implicit/euphemistic concern, suggestion, solution), topic, explicit, target, and source_path. The data is output in CSV and JSON formats, and is suitable for natural language processing tasks such as drug review analysis, concern classification, and reviewer decision-making behavior research.

创建时间:
2026-08-07
原始信息汇总

数据集概述

基本信息

该数据集名为 FDA Reviewer-Concern Extraction — Misha Handoff,主要内容是从FDA药物评审文档中提取评审人员标注的关切陈述(包括明确关切、隐含/委婉关切、建议和解决方案)。该任务使用 Qwen3.6-27B 模型,在耶鲁大学 Misha 集群的 GPU 节点上本地部署运行。

数据集内容与结构

输入数据格式

脚本期望输入数据按以下结构组织:

<input-dir>/<month>/<drugname_appno>/opendataloader/*.md

该结构与项目中 opendataloader 步骤生成的目录结构一致。

输出数据格式

提取结果保存为 concerns.csvconcerns.json 两个文件,每条记录对应一条关切陈述,具体字段包括:

  • application_number: 申请编号
  • drug_name: 药物名称
  • month: 月份
  • document_title: 文档标题
  • section_heading: 章节标题
  • page: 页码
  • exact_quote: 精确引用
  • judgment_summary: 判断摘要
  • statement_type: 陈述类型
  • topic: 主题
  • explicit: 是否明确
  • target: 目标
  • source_path: 源文件路径

此外,解析失败的文本块会记录到 failed_chunks.log 文件中,供人工审查。

核心文件说明

  • extract_concerns.py: 提取脚本,读取FDA评审Markdown文件,分块处理,调用LLM提取评审关切陈述
  • run_misha.sbatch: Slurm作业脚本,启动Qwen3.6-27B vLLM服务器并运行提取任务
  • requirements-client.txt: 客户端依赖(仅需 openai 包,作为HTTP客户端与本地vLLM服务器通信)

运行环境要求

  • 模型: Qwen/Qwen3.6-27B,2026年4月发布,模型权重约56GB
  • 计算环境: 耶鲁大学Misha集群,需使用GPU分区(H100/A100),A40 48GB显存不足以运行该模型
  • Python环境: Python 3.11,需要安装 transformers>=4.57.1acceleratevllm 等依赖
  • 存储建议: 大型数据应存放于 ~/project/(1TB/组,不清除),而非 $HOME(125GB/用户)或 scratch(60天自动清除)

高级功能与优化

自一致性增强(可选)

可通过在 run_misha.sbatch 中添加 --passes 2--passes 3 参数,对每个文本块进行多次独立推理并将结果合并(对近似相同的引用去重),以提高召回率。该方法的计算成本为 pass 次数倍,但比在提示中要求模型"自我检查"效果更优。

参数调整建议

  • 显存不足时:降低 --gpu-memory-utilization--max-model-len(当前32768已远低于模型原生262K上下文)
  • 快速调试时:使用 --limit 1 限制处理数量,默认开启思考模式(thinking mode),可通过 --no-thinking 关闭以加快运行速度
搜集汇总
数据集介绍
fda_project 数据集图片
构建方式
该数据集基于FDA药物评审文档构建,通过Qwen3.6-27B大语言模型在耶鲁大学Misha集群的GPU节点上运行提取脚本。文档首先按特定目录结构(<month>/<drugname_appno>/opendataloader/*.md)存储,随后脚本将其分块并利用LLM逐块识别评审者关注陈述,涵盖显式关注、隐含/模糊关注、建议及解决方案等类型。提取结果以CSV和JSON格式输出,每条记录包含申请号、药品名、月份、文档标题、章节标题、页码、原文引用、判断摘要、陈述类型、主题、显式性、目标及来源路径等详细字段,确保信息可追溯且结构化。
特点
该数据集的一个显著特点是其深度结构化与高精度标签体系,每条关注陈述均附有精细的元数据,便于后续分析。同时,数据集覆盖多种陈述类型,能够全面捕获评审文档中的显性与隐性关注。构建过程引入了自一致性增强机制,通过多次独立采样并合并结果,有效提升召回率。此外,数据集构建基于最新的大语言模型,具备处理长文档的卓越能力,并提供了失败日志记录,保证了数据的完整性和可靠性,为药物评审领域的文本挖掘提供了高质量资源。
使用方法
使用该数据集前,需将其部署于耶鲁Misha集群环境,遵循README指南完成模型权重预下载、conda环境配置及Slurm作业脚本的参数调整。建议先进行小规模测试(如--limit 2)以验证提取效果,再提交正式作业。运行后,可依据concerns.csv或concerns.json进行下游分析,如统计不同主题的关注分布、追踪特定药品的评审争议点。对于召回率不足的场景,可调整--passes参数以启用自一致性增强,提升抽取完整性。数据字段设计友好,便于与原始评审文档关联,支持定制化研究需求。
背景与挑战
背景概述
FDA药物评审文件承载着监管决策的关键信息,其中评审专家对药品安全性与有效性的关切点(concern)直接关联审批结果与临床风险。然而,这些关切点往往以隐性、委婉或建议性表述隐藏在冗长的评审文档中,传统人工筛查效率低下且易遗漏。fda_project数据集由耶鲁大学Misha集群团队创建,依托Qwen3.6-27B模型对FDA评审文档进行细粒度抽取,旨在系统化识别显性及隐性关切、建议与解决方案。该数据集的构建标志着药物监管文本分析从关键词匹配向深度语义理解的跨越,其结构化输出(包括引用原文、判断摘要和主题分类)为监管科学、药物警戒及自动化审评辅助系统提供了高质量语料,对提升药品审评的透明度和效率具有里程碑意义。
当前挑战
该数据集构建面临双重挑战:领域层面,FDA文档语言复杂度高,关切点常以委婉、条件句或交叉引用形式出现,要求模型具备深厚的医学知识与推理能力,以区分事实陈述与隐含担忧,并准确还原上下文关联;同时,不同评审人员的表述风格差异显著,增加了抽取的一致性与泛化难度。技术层面,模型推理需部署在GPU集群上,面临27B参数的显存限制(A40不可用而需H100)、vLLM版本与新型Qwen架构的兼容性问题,以及长文档分块导致的上下文断裂风险。此外,生成结果的随机性可能造成召回不足,需通过多次独立采样与去重策略(self-consistency)提升稳健性,而海量文档的处理亦需在计算成本与产出质量间寻求平衡。
常用场景
经典使用场景
该数据集聚焦于FDA药物审评文档中审评专家所提出关注点的自动抽取任务。其核心用法在于利用大型语言模型对结构化的药物审评文本进行细粒度语义分析,从冗长且非结构化的审评报告中识别并归类显性关注、隐晦表述、建议及解决方案等多元陈述。此类任务通常依赖信息抽取、自然语言处理及医学文本挖掘技术,为监管科学与计算语言学交叉领域的研究提供了标准化的数据基准与处理范式。
解决学术问题
此数据集旨在解决药物审评文本中关键信息自动化提取与结构化组织的学术难题。传统方法依赖人工阅读和手动标注,耗时耗力且易受主观因素干扰。该数据集通过提供系统化的标注框架与抽取流程,显著提升了审评关注点识别的效率与一致性,有助于推动监管决策透明化、审评质量评估以及药物安全性信号的辅助分析。其意义在于为后续基于证据的监管科学研究和循证医学实践奠定了数据与方法论基础。
衍生相关工作
围绕该数据集,衍生出一系列相关研究,包括基于提示工程的模型优化、抽取结果的自洽性提升策略(如多轮独立采样与结果合并)、以及跨领域迁移学习等。其提出的自一致性增强方法已被证明能有效提升抽取召回率,推动了LLM在专业文本处理中的应用边界。未来工作可能涉及构建更全面的监管文本语料库、开发多模态审评摘要系统,以及将抽取结果与真实世界药物安全数据联动分析,进一步丰富监管科学的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务