fda_project
收藏资源简介:
该数据集由从 FDA 药物审评文档中提取的审评员关注点陈述构成。数据通过 Qwen3.6-27B 大语言模型对 FDA 审评文档进行分块和提示抽取得到。每条记录代表一个被识别的关注点,包含以下字段:申请编号(application_number)、药物名称(drug_name)、月份(month)、文档标题(document_title)、章节标题(section_heading)、页码(page)、精确引用(exact_quote)、判断摘要(judgment_summary)、陈述类型(statement_type,如显式关注、隐式/委婉关注、建议、解决方案)、主题(topic)、是否显式(explicit)、目标(target)以及源文件路径(source_path)。数据以 CSV 和 JSON 格式输出,适用于药物审评分析、关注点分类、审评员决策行为研究等自然语言处理任务。
This dataset consists of reviewer concern statements extracted from FDA drug review documents. The data is obtained by chunking and prompting FDA review documents using the Qwen3.6-27B large language model. Each record represents an identified concern and includes the following fields: application_number, drug_name, month, document_title, section_heading, page, exact_quote, judgment_summary, statement_type (e.g., explicit concern, implicit/euphemistic concern, suggestion, solution), topic, explicit, target, and source_path. The data is output in CSV and JSON formats, and is suitable for natural language processing tasks such as drug review analysis, concern classification, and reviewer decision-making behavior research.
数据集概述
基本信息
该数据集名为 FDA Reviewer-Concern Extraction — Misha Handoff,主要内容是从FDA药物评审文档中提取评审人员标注的关切陈述(包括明确关切、隐含/委婉关切、建议和解决方案)。该任务使用 Qwen3.6-27B 模型,在耶鲁大学 Misha 集群的 GPU 节点上本地部署运行。
数据集内容与结构
输入数据格式
脚本期望输入数据按以下结构组织:
<input-dir>/<month>/<drugname_appno>/opendataloader/*.md
该结构与项目中 opendataloader 步骤生成的目录结构一致。
输出数据格式
提取结果保存为 concerns.csv 和 concerns.json 两个文件,每条记录对应一条关切陈述,具体字段包括:
- application_number: 申请编号
- drug_name: 药物名称
- month: 月份
- document_title: 文档标题
- section_heading: 章节标题
- page: 页码
- exact_quote: 精确引用
- judgment_summary: 判断摘要
- statement_type: 陈述类型
- topic: 主题
- explicit: 是否明确
- target: 目标
- source_path: 源文件路径
此外,解析失败的文本块会记录到 failed_chunks.log 文件中,供人工审查。
核心文件说明
- extract_concerns.py: 提取脚本,读取FDA评审Markdown文件,分块处理,调用LLM提取评审关切陈述
- run_misha.sbatch: Slurm作业脚本,启动Qwen3.6-27B vLLM服务器并运行提取任务
- requirements-client.txt: 客户端依赖(仅需
openai包,作为HTTP客户端与本地vLLM服务器通信)
运行环境要求
- 模型: Qwen/Qwen3.6-27B,2026年4月发布,模型权重约56GB
- 计算环境: 耶鲁大学Misha集群,需使用GPU分区(H100/A100),A40 48GB显存不足以运行该模型
- Python环境: Python 3.11,需要安装
transformers>=4.57.1、accelerate、vllm等依赖 - 存储建议: 大型数据应存放于
~/project/(1TB/组,不清除),而非$HOME(125GB/用户)或scratch(60天自动清除)
高级功能与优化
自一致性增强(可选)
可通过在 run_misha.sbatch 中添加 --passes 2 或 --passes 3 参数,对每个文本块进行多次独立推理并将结果合并(对近似相同的引用去重),以提高召回率。该方法的计算成本为 pass 次数倍,但比在提示中要求模型"自我检查"效果更优。
参数调整建议
- 显存不足时:降低
--gpu-memory-utilization或--max-model-len(当前32768已远低于模型原生262K上下文) - 快速调试时:使用
--limit 1限制处理数量,默认开启思考模式(thinking mode),可通过--no-thinking关闭以加快运行速度





