遇见数据集

DAPFAM

收藏
arXiv2025-06-27 更新2025-11-28 收录
官方服务:

资源简介:

DAPFAM是一个基于专利家族级别的开放访问领域感知专利检索数据集。该数据集包含1247个领域平衡的全文本查询家族和45336个全文本目标家族。数据集通过基于国际专利分类(IPC)代码的创新标签方案丰富了清晰的关联判断(正向/反向引用作为积极链接,随机负面),并明确领域内或领域外关系,从而产生49869个评估对。数据集是多司法管辖区,对检索评估的预处理要求很少,对于资源有限的实体来说,其大小仍然可以管理,允许在不产生过高的计算成本的情况下进行子文档级别的检索实验。我们描述了我们的三步数据整理流程,展示了全面的数据集统计数据,并提供了使用词汇和神经检索方法的基线实验。我们的基线实验突出了跨领域专利检索中的重大挑战。数据集将公开可用(目前访问链接是这个存储库)。

DAPFAM is an open-access, domain-aware patent retrieval dataset built on patent families. This dataset includes 1247 domain-balanced full-text query families and 45336 full-text target families. Using an innovative labeling scheme based on International Patent Classification (IPC) codes, the dataset enriches clear relevance judgments: forward and backward citations are treated as positive links, while random samples serve as negative links, and explicitly differentiates between in-domain and out-of-domain relationships, yielding a total of 49869 evaluation pairs. The dataset is multi-jurisdictional, requires minimal preprocessing for retrieval evaluation, remains manageable in scale for resource-constrained entities, and supports sub-document-level retrieval experiments without excessive computational overhead. We detail our three-step data curation workflow, present comprehensive dataset statistics, and provide baseline experiments leveraging lexical and neural retrieval methods. Our baseline experiments highlight substantial challenges in cross-domain patent retrieval. The dataset will be made publicly available, with the current access link pointing to this repository.

创建时间:
2025-06-27
搜集汇总
数据集介绍
DAPFAM 数据集图片
构建方式
在专利检索领域,现有数据集多局限于单一司法管辖区、缺乏领域平衡与显式的域内/跨域标注。DAPFAM数据集基于Lens.org提供的全球多源专利数据,采用三级勋章架构(青铜、白银、黄金)进行逐步筛选与精炼。首先在青铜层收集原始专利记录并进行初步解析,白银层进行专利族部分聚合、语言过滤(仅保留完整英文文本)、日期过滤(最早申请日2000年后)以及引用阈值筛选(至少100次前向与后向引用)。黄金层完成专利族完整文本合并,并通过国际专利分类号(IPC)前三字符进行域标签分配。最终得到1247个领域均衡的查询族与45336个目标族,构建了包含49869个评估对的检索数据集。
特点
该数据集的核心创新在于显式的域内与跨域标注机制,通过比较查询与目标专利的IPC前三字符重叠情况,将相关文档精准划分为域内或跨域关系。数据集在查询层面实现了多技术领域的平衡覆盖,每个领域至少包含10个查询族,避免了传统数据集的领域偏差。同时,数据集整合了来自美国、日本、韩国、德国、中国等多个司法管辖区的专利族,以英文全文统一呈现,兼具全球视野与语言一致性。此外,数据集规模适中,支持子文档级别的检索实验,且预处理需求极低,便于中等计算资源的科研机构直接使用。
使用方法
DAPFAM数据集可直接用于专利检索系统的评估与训练,支持文档级与段落级两种检索模式。用户可依据提供的评估文件(包含查询ID、目标ID、相关性得分与域标签)开展精确率、召回率、nDCG及mAP等指标的基准测试。对于基于检索的模型训练,数据集提供了约20个正向样本(引用关系)与20个随机负样本,便于实施对比学习或排序学习。尤为重要的是,借助域标签,研究者可针对性分析检索系统在域内与跨域场景下的性能差异,从而开发领域自适应或跨域检索增强算法。
背景与挑战
背景概述
在专利信息检索领域,长期以来高质量、公开可用的数据集稀缺,限制了跨领域检索研究的深入发展。现有数据集如CLEF-IP、TREC Patent Track、MAREC等,普遍存在管辖权偏倚、查询域分布不均衡以及缺乏显式的域内/域外标注等缺陷。为弥补这一空白,来自法国斯特拉斯堡INSA的Iliass Ayaou及其研究团队于2025年构建了DAPFAM数据集。该数据集以简单专利族为单元,汇集了1,247个域均衡的全文本查询族和45,336个目标族,并通过国际专利分类(IPC)前三字符编码创新性地标注了域内与域外的相关性关系,为系统性研究跨域专利检索提供了标准化的评测基准,在专利信息检索研究领域具有里程碑式的影响。
当前挑战
DAPFAM数据集所面临的挑战主要体现在两个方面。首先,在解决的领域问题层面,跨域专利检索长期受到词汇鸿沟与领域语义漂移的困扰,传统词法匹配方法(如BM25)在同域检索中表现尚可,但在域外场景下召回率与排序质量显著下降,而神经检索模型在域外样本上的改进幅度有限,凸显了域适应技术的迫切需求。其次,在构建过程中,研究团队需克服多管辖权数据整合、非英语专利文本过滤、专利族聚合去重、以及基于引文网络的可扩展标注等多重技术障碍,特别是在确保查询域间均衡性的同时,维持数据集的实用规模与计算友好性,为后续深度学习方法的部署预留充分的扩展空间。
常用场景
经典使用场景
在专利信息检索研究领域,DAPFAM数据集被广泛用于评估和比较各类检索算法在专利文献上的表现。其经典使用场景包括基于词法的BM25检索、基于神经网络的Transformer嵌入检索,以及文档级与段落级两种粒度下的检索实验。数据集提供了1,247个跨领域均衡的查询族和45,336个目标族,每个查询族均附有基于前向和后向引用的明确相关性标签,以及基于IPC分类码的领域内与领域外标注。这使得研究者能够系统性地测试检索系统在处理相同领域与跨领域专利时的性能差异,尤其适用于探索段落级神经检索在专利长文本环境中的可行性与效果。
解决学术问题
DAPFAM数据集的核心贡献在于弥补了现有专利检索基准中领域感知标注缺失的空白。传统数据集如CLEF-IP、TREC Patent Track和MAREC多聚焦于单一司法管辖区或特定技术领域,缺乏对跨领域检索任务的系统性支持。DAPFAM通过引入基于IPC前三位代码的领域内与领域外标注机制,使研究者能够量化分析检索算法在领域偏移条件下的鲁棒性。这为探索领域自适应训练、多任务学习及对抗性域适应等前沿课题提供了标准化的实验平台,推动了跨学科专利检索理论的深入发展。
衍生相关工作
DAPFAM数据集的发布催生了一系列衍生研究,包括基于引文网络分析的专利价值预测模型、融合分类层级信息的查询扩展方法,以及面向困难负样本的对比学习框架。研究者利用其领域标注特性,开发了领域对抗性训练策略以增强跨领域检索的泛化能力,并探索了多任务学习架构同时优化检索精度与领域分类性能。段落级检索的基准实验还推动了面向专利文本的长上下文Transformer优化,如分段评分聚合策略(maxP、平均TopN)的改进。这些工作共同构建了从数据资源到算法创新的良性生态循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务