遇见数据集

DrugAudit

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

DrugAudit是由佛罗里达大学和澳门大学联合创建的一个权威感知型药物信息问答基准数据集,包含3,772个精心设计的评估项目。该数据集覆盖了九个源数据库子集,并整合了MedQA和PubMedQA中药物相关的子集,旨在通过双评委大语言模型协议对答案的上游黄金源匹配度、令牌级语义片段重叠和引用忠实性进行多维度评分。其构建过程严格遵循证据等级区分原则,特别强调区分原始监管记录与下游聚合器来源,以解决现有生物医学问答评估中缺乏权威性溯源和引用质量量化的问题。该数据集主要应用于药物信息检索与问答系统的性能评估,致力于提升临床决策支持系统中答案的可验证性与溯源可靠性,从而保障患者安全。

DrugAudit is an authority-aware drug information question answering benchmark dataset jointly developed by the University of Florida and the University of Macau, which comprises 3,772 meticulously designed evaluation items. It encompasses nine source database subsets, and incorporates drug-related subsets extracted from MedQA and PubMedQA. Its core objective is to conduct multi-dimensional scoring of answers across three key aspects: the matching degree between answers and their upstream gold-standard sources, token-level semantic fragment overlap, and citation faithfulness, via the dual-judge large language model protocol. Its construction strictly adheres to the principle of evidence hierarchy, with particular emphasis on differentiating between original regulatory records and downstream aggregator sources, aiming to address the gap that existing biomedical question answering evaluations lack authoritative traceability and quantifiable citation quality. This dataset is primarily applied for performance evaluation of drug information retrieval and question answering systems, and is committed to improving the verifiability and traceable reliability of answers in clinical decision support systems, thereby safeguarding patient safety.

创建时间:
2026-06-01
搜集汇总
数据集介绍
DrugAudit 数据集图片
构建方式
在药物信息问答这一高风险领域,现有基准多聚焦于答案正确性,却忽视了引文溯源权威性的评估。DrugAudit数据集应运而生,旨在填补这一空白。其构建过程严谨而系统:首先,从ChEMBL、DrugCentral、openFDA FAERS等九个权威源数据库中,依据药物在源索引中的频次采样候选药物,并向实时技能接口发出类型化查询,保留返回的行作为金标准记录。随后,利用Claude Opus 4.7模型根据每源模板撰写自然语言问题,确保答案恰好对应所保留的行。最后,通过结构验证器检查每条金标准引文是否可解析至正确的数据库、定位符及片段,并由LLM审计器对答案与引文的一致性进行评分,从而保障数据的质量与可靠性。
特点
DrugAudit数据集的核心特色在于其权威性感知的评估维度,它通过一系列创新度量标准,精准区分了上游原始监管记录与下游聚合器封装。具体而言,源权威匹配采用等价桶与上游关系映射,将直接引用FDA标签等原始来源的引文视为高权威;片段语义重叠以Token-Jaccard指标替代传统子串匹配,并设定阈值0.3;原始源率根据来源层次赋予不同权重;忠实率则衡量模型生成引文与金标准答案的支撑关系。这些特征使得DrugAudit能够严格评估模型是否真正溯源至权威的一手信息,而非依赖可能失真的二次摘要。
使用方法
DrugAudit数据集适用于评估各类系统在药物信息问答中的表现,特别是其生成答案的溯源准确性与权威性。使用时应将系统生成的答案与数据集中提供的金标准答案和引文进行对比,依照数据集配套的评估面板进行评分,包括源权威匹配、语义片段重叠、原始源率及忠实率等指标。此外,数据集还采用了双LLM评判协议,使用Llama-3.1-70B-Instruct和gpt-oss-120b作为独立裁判,以减少单模型偏见,确保评估结果的稳健性。用户可据此对自身系统的药信问答性能进行全面而深入的剖析。
背景与挑战
背景概述
在药物信息问答这一高风险场景中,错误答案可能误导临床决策,而每个引用事实的出处与其真实性同等重要。现有大语言模型虽在通用生物医学知识上表现强劲,但在资源匮乏的疾病领域性能迅速退化,且缺乏指向监管或同行评审源的可审计轨迹,容易生成看似合理但实际虚假的数字。为弥合这一鸿沟,佛罗里达大学与澳门大学的研究团队于2025年联合创建了DrugAudit数据集,由Qing Wang、Bo Li、Jialu Liang等学者主导。该基准包含3,772条权威感知的问答对,涵盖九种源数据库(如ChEMBL、openFDA FAERS、PharmGKB等),其核心研究问题在于评估系统能否返回基于一级监管或同行评审记录的答案,并区分上游原始来源与下游聚合器。该数据集通过引入等价桶规则、Token-Jaccard语义重叠度及双重法官LLM-as-Judge协议(κ=0.88),显著提升了药物问答评估的权威性与可靠性,对推动证据基础的药物信息系统发展具有里程碑式影响。
当前挑战
DrugAudit数据集的构建与使用面临多重挑战。首先,所解决的领域问题是如何确保药物信息问答系统不仅返回事实正确的答案,还能追溯至一级监管或同行评审来源,而非下游聚合器。现有评估体系往往忽略来源等级,无法区分FDA标签与其转述包装,导致关于引用的来源权威性成为评估盲区。其次,构建过程中面临三大结构性偏差:严格源名称规范化会惩罚上游原始来源(如使用CPIC回答PharmGKB查询被视为错误);子字符串匹配在面对字段名而非句子时失效;缺乏独立于引用存在与否的引用质量信号。为此,设计团队引入等价桶规则处理来源映射、以Token-Jaccard语义重叠代替严格子串匹配,并构建双法官LLM-as-Judge协议以消除自偏好偏差,同时处理图表模式下47%至50%的不可解析判定带来的评估噪声。这些技术应对确保了数据集在高风险药物场景中的实用性与鲁棒性。
常用场景
经典使用场景
DrugAudit数据集的核心经典用途在于评估药物信息问答系统中答案的可信度与溯源能力,尤其在回答涉及药物相互作用、不良反应、药效学参数及药物标签警告等高风险临床问题时,该数据集要求模型不仅给出正确答案,还需提供权威的监管或同行评审来源作为支撑。通过其独特的权威感知评估框架,DrugAudit能够严格区分来自FDA标签、ChEMBL等一手监管数据源的引用与来自下游聚合器如SIDER或DrugCentral的次级引用,从而为高保真度药物信息检索系统的研发奠定了坚实的评测基础。
实际应用
在实际应用层面,DrugAudit数据集为临床决策支持系统、药物安全监测平台及药事知识库的自动问答模块提供了严格的验收标准。例如,当临床医生询问特定药物的肝毒性标签警告或FAERS数据库中不良事件报告数量时,基于DrugAudit标准训练的检索增强系统能够提供带有FDA原始文档链接的精确答案,而非可能包含幻觉数字的通用模型输出。此外,该数据集还可用于验证药学知识图谱的动态更新质量、评估不同工具增强型智能体在药物信息检索场景下的实际部署效果,从而降低因虚假药物信息引发的患者安全风险。
衍生相关工作
DrugAudit数据集的构建直接催生了多项开创性研究工作:其一,基于其权威感知评估框架,研究者开发了DrugClaw多智能体检索增强系统,该系统通过状态机工作流调控八个专业智能体,实现了对57种药物与药物警戒技能的精准调度;其二,该数据集启发了对临床药学领域中检索增强生成的深层研究,推动了从开放网页索引向封闭式监管源注册表的范式迁移;其三,其双裁判大模型评分协议(Llama-3.1-70B与gpt-oss-120b,Cohen's κ=0.88)为药物信息问答提供了几乎完美一致性的评价标准,目前已被后续医药领域智能体评估工作广泛借鉴,形成了药物信息溯源研究的新兴子领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务