遇见数据集

cross-jurisdiction regulatory divergence dataset

收藏
github2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

该数据集包含101个专家标注的FDA/EMA要求对,用于检测跨司法管辖区的监管分歧。标签来源于三个公开的专家评审来源,涵盖主题如终点、试验设计、毒理学等。分布包括38个AGREE、40个DIVERGE和23个SILENT类别。

This dataset comprises 101 expert-annotated FDA/EMA requirement pairs, which are utilized to identify regulatory divergences across jurisdictions. The annotations are derived from three publicly available expert review sources, covering topics including endpoints, trial design, toxicology, and other relevant areas. The class distribution includes 38 AGREE, 40 DIVERGE, and 23 SILENT instances.

创建时间:
2026-06-08
原始信息汇总

数据集概述

该数据集专注于跨司法管辖区监管差异检测任务,旨在通过NLP方法自动识别美国食品药品监督管理局(FDA)与欧洲药品管理局(EMA)指南之间的分歧。

数据集规模与构成

  • 总样本数:101对经专家验证的FDA/EMA要求配对
  • 标签分布
    • AGREE(一致):38对
    • DIVERGE(分歧):40对
    • SILENT(一方未提及):23对

数据来源

数据来源于三组公开的专家小组评审及主要指南文本:

来源 配对数量 主题
J. Crohns & Colitis 2025 溃疡性结肠炎终点比较 40 终点指标、缓解、试验设计
PMC8157504 — EMA/FDA精神科指南 10 试验持续时间、对照药物、安慰剂
PMC6529498 — 美欧放射性药物要求 9 GLP、毒理学、标签
主要指南文本(ICH E9R1、E11A、FDA/EMA) 42 估计目标、儿科、生物类似药、基因治疗等

任务定义

给定关于同一主题的一条FDA要求和一条EMA要求,将其关系分类为以下三类之一:

  • AGREE:要求一致
  • DIVERGE:要求存在分歧
  • SILENT:一方未对该主题提出要求

关键研究发现

  1. SILENT类别在语义上可检测,但对NLI蕴含框架(F1从0.08提升至0.74)不可见
  2. 义务级图结构优于词汇基线(+0.14 F1),但逊于平面LLM上下文(-0.12 F1)
  3. 图方法正确目标应为语料库级构建,而非配对级重排序

标注一致性

使用不同提示的第二标注员(Claude Haiku)在36个样本上的人工间一致性:κ = 0.542(中等一致性)

相关资源

搜集汇总
数据集介绍
cross-jurisdiction regulatory divergence dataset 数据集图片
构建方式
该数据集旨在应对制药企业在同时满足美国FDA与欧洲EMA两大监管机构要求时所面临的指南文本分歧问题。数据集构建过程严谨,基于三组公开的专家小组评审成果,并辅以ICH E9R1、E11A等核心指导原则的原始文本。具体而言,从《Journal of Crohn's & Colitis》2025年关于溃疡性结肠炎终点的比较研究、PMC8157504号文献中关于精神科指南的对比,以及PMC6529498号文献中关于放射性药物要求的分析中,提取出101对经专家核实的FDA与EMA要求条款。所有文本对均被人工标注为一致(AGREE)、分歧(DIVERGE)或沉默(SILENT)三类关系,最终形成包含38对一致、40对分歧和23对沉默的平衡数据集。
使用方法
使用该数据集进行研究和实验非常便捷。研究者可直接从实验代码仓库克隆项目,通过pip安装`anthropic`和`transformers`等依赖库。运行词汇基线方法无需任何API密钥,直接执行`cv_eval.py`脚本即可。若需复现大语言模型法官的实验,则需在环境变量中配置Anthropic API密钥,随后运行`llm_baseline.py`。图增强检索分类器可通过`graph_classify.py`调用。所有方法的评估均支持通过`bootstrap_ci.py`计算带95%置信区间的宏F1分数,研究者还可使用`iaa.py`进行标注者间一致性分析。数据集本身基于公开的FDA/EMA指南文件及开放获取的同行评议文献,代码以MIT许可协议发布,确保了学术研究的可复现性与合法使用。
背景与挑战
背景概述
在全球制药与生物技术领域,同时向美国食品药品监督管理局(FDA)和欧洲药品管理局(EMA)提交药物上市申请已是普遍实践。然而,两大监管机构基于各自的法律框架与临床实践传统,常针对同一议题发布内容不一甚至相互抵触的指导原则。这种跨司法管辖区的监管分歧为药物研发企业带来了巨大的合规成本与决策风险。为此,研究者于2026年提出了跨管辖区监管分歧检测数据集,该数据集由chuchugo团队主导创建,核心研究问题在于将监管分歧检测构建为一项自然语言处理任务:给定FDA与EMA针对同一主题的两条要求,判定其关系为一致、分歧或沉默。该数据集整合了101对经专家验证的监管要求对,覆盖溃疡性结肠炎临床试验设计、精神疾病药物试验规范、放射性药物与生物类似药等多个关键领域,为监管文本的自动化分析开辟了新的研究路径,对推动国际药品监管协调以及制药行业的数字化合规具有重要学术与实践价值。
当前挑战
本数据集所解决的领域挑战主要集中在三个方面:其一,跨管辖区监管文本分歧检测是一项全新的跨语料矛盾识别任务,传统自然语言推理框架天然忽视“沉默”这一语义类别,导致模型难以捕捉监管文本中因一方未提及而隐含的分歧。其二,监管文本具有高度结构化与专业化的特点,其中蕴含的义务层级关系(如条件、要求、建议)复杂交织,使得单纯基于词法或嵌入的匹配方法在区分细微的语义分歧时表现不佳。其三,在数据集构建过程中,挑战同样艰巨:监管对需在大量官方指导文件中逐条定位、对标并校验,而不同来源的监管要求常嵌入不同语境,标注一致性难以保障——即使借助高级语言模型进行二次标注,Cohen's Kappa仅达到0.542,凸显了这一任务在数据采集与标注精度上的高度复杂性。
常用场景
经典使用场景
在药品研发与监管科学的交叉领域中,该数据集被用于构建和评估跨辖区监管文本的语义一致性检测模型。研究者将FDA与EMA针对同一药物开发主题发布的指导原则作为成对输入,要求模型在三分类框架下判别两者是‘一致’、‘分歧’还是‘沉默’。这一任务突破了传统信息检索的匹配范式,转而聚焦于监管文本间微妙的蕴含与矛盾关系,为自动化监管合规分析奠定了基准。
解决学术问题
该数据集直击跨法域监管文本对齐这一长期被忽视的学术难题。既往自然语言推理研究多聚焦于通用英语语料,而监管文本具有高度的术语规范性、义务性句式结构以及隐含的缺省信息,导致通用NLI模型在此领域表现不佳。该数据集的构建填补了专业领域矛盾检测的空白,揭示了‘沉默’类别的语义可检测性但结构不可见性,这一发现挑战了传统蕴含建模的边界,推动了面向垂直领域的文本关系推理研究。
实际应用
在跨国制药企业的监管申报流程中,该数据集支撑的模型可自动化筛查美欧双报时需关注的指导原则差异,辅助监管事务专员快速定位需要额外桥接实验或解释性论证的关键条款。监管机构亦可利用此类工具进行国际协调指南的影响评估,识别药审标准差异的聚集领域,从而优先推动跨国协调工程。以图谱增强的检索手段能够显式呈现义务性条款的关联结构,降低人工比对数百页指导原则的认知负荷。
数据集最近研究
最新研究方向
该数据集聚焦于跨司法管辖区(FDA与EMA)监管指南的自动分歧检测,属于自然语言处理与生物医药监管交叉的前沿方向。研究基于101对专家标注的监管需求对,构建了AGREE、DIVERGE、SILENT三分类任务,并提出了从词汇启发式到图RAG及大语言模型法官的基线层级体系。最新实验揭示,SILENT(沉默)类别虽在语义上可检测,却对传统的自然语言推理框架(NLI)造成结构性盲区(F1低至0.08),而大语言模型凭借平面成对推理取得了最优宏F1(0.819),超越了显式图谱结构方法。这一发现不仅为全球制药企业在美欧双轨申报中提供了自动化合规审查的技术进路,也推动了面向监管文本的特殊矛盾检测任务从封闭式推理走向开放式语义建模,具有显著的工业应用价值与学术启发意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务