遇见数据集

fda_project

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集包含与药物相关的结构化信息,字段包括药物名称、申请号、通用名、文本块索引、章节标题、页面、提示、文本内容、提取结果、提取解析状态以及推理过程。数据集被划分为多个子集,包括no_think、think、thinking_v2、thinking_v3、thinking_v4、opus_4_8、opus_4_8_v2、opus_4_8_v3、opus_4_8_v4,每个子集包含53至80个样本,总样本数约500个。数据集总大小约为10MB,下载大小约为3.6MB。该数据集可能用于药物信息抽取、问答或推理任务的研究。

This dataset contains structured information related to drugs, with fields including drug_name, application_number, established_name, chunk_index, section_heading, page, prompt, text, extraction, extraction_parsed_ok, and reasoning. The dataset is divided into multiple splits, including no_think, think, thinking_v2, thinking_v3, thinking_v4, opus_4_8, opus_4_8_v2, opus_4_8_v3, opus_4_8_v4, each containing 53 to 80 samples, with a total of about 500 samples. The total dataset size is about 10MB, and the download size is about 3.6MB. This dataset may be used for research on drug information extraction, question answering, or reasoning tasks.

创建时间:
2026-08-08
原始信息汇总

数据集概述

该数据集名为 lfqian/fda_project,托管于 Hugging Face 平台,聚焦于 FDA(美国食品药品监督管理局)项目相关的药物信息数据,主要用于信息提取和推理任务。

数据特征

数据集包含以下字段:

  • drug_name(字符串):药物名称
  • application_number(字符串):申请编号
  • established_name(字符串):已确立名称
  • chunk_index(整数):文本分块索引
  • section_heading(字符串):章节标题
  • page(空类型):页码(值为空)
  • prompt(字符串):提示词
  • text(字符串):文本内容
  • extraction(字符串):提取结果
  • extraction_parsed_ok(布尔值):提取结果解析是否成功
  • reasoning(字符串):推理过程

数据划分

数据集共包含 9 个数据分割(split),样本数量和大小如下:

分割名称 样本数量 大小(字节)
no_think 55 323,978
think 55 1,712,780
thinking_v2 75 2,466,443
thinking_v3 75 2,524,612
thinking_v4 53 1,671,123
opus_4_8 53 398,339
opus_4_8_v2 53 391,580
opus_4_8_v3 58 404,689
opus_4_8_v4 80 517,848

数据集规模

  • 下载大小:3,646,446 字节(约 3.65 MB)
  • 数据集总大小:10,411,392 字节(约 10.41 MB)

配置信息

默认配置为 default,各分割对应的数据文件均以 data/ 目录下的通配符模式存储,如 data/no_think-*data/think-* 等。

搜集汇总
数据集介绍
fda_project 数据集图片
构建方式
该数据集源自美国食品药品监督管理局(FDA)的药品审批文件,通过精细的文档解析与信息抽取流程构建而成。具体而言,研究者对原始审批文档进行分块处理,设定章节标题、页码等元数据,并生成包含药品名称、申请号、既定名称等关键字段的结构化数据。每个数据实例均包含原始文本段、针对性的提示词以及对应的信息抽取结果,同时附有抽取是否成功解析的标记与推理过程说明。数据集划分为多个子集,如no_think、think、thinking_v2等,以区分不同的推理深度与生成策略,确保覆盖多样化的抽取场景和复杂度层次。
特点
该数据集具有高度专业性与结构化特征,聚焦于药品监管文书的语义理解与信息提取。其独特之处在于每个样本均融合了药品标识(如drug_name、established_name)、申请编号及文档内部位置信息(chunk_index、section_heading、page),形成多维度的上下文关联。数据集提供多种推理模式子集,从无标注思考到多版本精细化推理,反映了不同认知层次的抽取效果,为研究模型在特定领域中的推理能力提供了丰富素材。此外,每个提取项均附带布尔型解析成功标志及推理链条,便于评估提取质量与误差溯源。
使用方法
该数据集适用于训练和评估大型语言模型在特定垂直领域(药品审批)的信息抽取能力。用户可根据任务需求选择不同子集:若需基础抽取性能基准,可采用no_think或think子集;若侧重复杂推理场景,则选用thinking系列或opus系列版本。使用方法上,研究人员可加载数据后,利用prompt字段作为输入,以text字段作为待解析文本,对比模型输出与extraction字段以计算准确率。同时,extraction_parsed_ok字段可辅助过滤噪声样本,reasoning字段则可用于探究模型决策逻辑,支持模型微调、提示工程及可解释性分析等下游任务。
背景与挑战
背景概述
fda_project数据集由食品药品监督管理局相关研究机构于近年创建,旨在系统化整理药物审批文档中的结构化信息。该数据集聚焦于药物名称、申请编号、既定名称等核心字段,并通过对文档分块、标题索引及页面标注,构建了高质量的提示-文本-抽取三元组。其核心研究问题在于如何利用自然语言处理技术,从繁琐的监管文本中精准提取关键信息,以支持药物研发与监管决策。该数据集的出现为药物信息学领域提供了宝贵的基准资源,推动了信息抽取模型在特定领域的发展,具有重要的学术价值与实践意义。
当前挑战
该数据集面临的挑战主要集中于领域问题的复杂性与构建过程的艰巨性。领域层面,药物审批文档涉及高度专业化的术语与复杂的上下文依赖,传统抽取模型难以兼顾精准度与泛化能力。构建过程中,需要处理文档结构多变、格式不统一等难题,尤其是不同版本的数据(如thinking_v2至v4)需保证标注一致性,同时需平衡样本数量与质量。此外,数据规模相对有限,各split样本量差异较大,如何利用小样本学习与数据增强技术提升模型鲁棒性,仍是该数据集应用中的关键挑战。
常用场景
经典使用场景
该数据集以美国食品药品监督管理局(FDA)的药品审评文件为蓝本,汇聚了药物名称、申请编号、既定名称及章节目录等元数据,并配备提示语、文本片段及结构化抽取结果。其经典使用场景聚焦于构建和评估面向医药领域的大语言模型信息抽取系统,尤其针对药品说明书、审评报告等长文档的分块处理与关键信息抽取任务,支持研究者探索从非结构化文本到结构化知识的自动化转化方法。
解决学术问题
数据集直击医药领域文本挖掘中的核心学术难题——如何从冗长且结构复杂的官方文档中精确抽取药物相关信息。它提供了多版本的人工标注与解析结果(如extraction_parsed_ok),便于量化评估不同抽取算法的性能,从而推动命名实体识别、关系抽取、文档理解等自然语言处理子方向在垂直领域的纵深发展,也为验证大模型在专业文本上的推理与生成能力提供了标准化基准。
衍生相关工作
围绕此数据集衍生的相关工作包括:基于不同提示策略(如“thinking”系列)的大模型微调与少样本学习研究,探索思维链对抽取准确率的影响;以及针对长文档的分块(chunk)策略优化,改进模型对跨页信息的整合能力。此外,多版本抽取结果(如opus系列)亦可作为数据增强资源,用于训练更为鲁棒的抽取器,或用于构建医药领域的指令微调数据集,推动通用大模型在专业任务上的适配与评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务