遇见数据集

Dis2Pat

收藏
arXiv2026-08-22 更新2026-08-25 收录
数据链接:
官方服务:

资源简介:

Dis2Pat是由剑桥大学等机构构建的披露到专利数据集,旨在模拟真实专利起草流程,输入为去法律化的发明者风格披露及附图,输出完整专利申请(权利要求和说明书)。数据集包含约9,433条样本,平均原始专利含11,207个tokens而伪披露仅1,196个tokens,通过从PatentDesc筛选授权专利并利用GPT-5-mini生成伪披露创建,经人工评估在幻觉、细节缺失、矛盾及去法律化方面均获高分(>9.7)。该数据集用于评估大型语言模型在长文本、法律约束下的专利生成能力,解决从非结构化披露生成合规专利的核心挑战。

Dis2Pat is a disclosure-to-patent dataset constructed by institutions including the University of Cambridge. It aims to simulate the real patent drafting workflow, taking de-legalized inventor-style disclosures and accompanying drawings as input, and outputting complete patent applications including claims and specifications. The dataset contains approximately 9,433 samples, with an average of 11,207 tokens per original patent and only 1,196 tokens per pseudo-disclosure. It was developed by screening granted patents from the PatentDesc dataset and generating pseudo-disclosures using GPT-5-mini. Human evaluation shows that it achieved high scores (>9.7) across four aspects: hallucination, missing details, inconsistencies, and de-legalization. This dataset is used to evaluate the patent generation capabilities of Large Language Models (LLMs) under long-text and legally constrained scenarios, addressing the core challenge of generating compliant patent applications from unstructured disclosures.

创建时间:
2026-08-22
原始信息汇总

Patent-MAF 数据集详情

基本信息

  • 数据集名称: Patent-MAF
  • 数据集地址: https://github.com/scylj1/Patent-MAF

内容概述

  • 该数据集涉及专利领域,具体为 Patent-MAF(专利MAF)。
  • 当前页面提供数据和代码,但状态显示为“即将发布”(coming soon)。

当前可用性

  • 代码与数据尚未公开,处于筹备阶段,暂无法获取或使用具体内容。
搜集汇总
数据集介绍
Dis2Pat 数据集图片
构建方式
Dis2Pat数据集的构建源于对真实专利撰写流程的深刻洞察,鉴于真实发明披露因保密与法律约束难以获取,研究团队巧妙运用LLM从公开的授权专利中提取并重构出伪披露文本。具体而言,以PatentDesc语料中的专利公开号为源,经严格筛选确保文档完整且附有不超过10幅附图,最终获得9433项专利。利用GPT-5-mini对这些专利的原文进行改写,产出结构化的发明披露,涵盖发明名称、需求背景、核心思想、运作机理等七个维度,既保留技术实质又剥离法律表述,形成了信息完整但去法律化的高质量输入。
特点
Dis2Pat数据集独具匠心,首次将发明人风格的披露文本引入专利生成研究,打破了以往数据集仅基于后期或高度结构化输入的局限。其伪披露文本平均仅1196词,技术术语密度从0.05骤降至0.001,且与源专利的ROUGE-L F1仅0.08,4-gram重叠率0.006,充分证明其非字面复制性。经专家评估,其在幻觉、细节遗漏、矛盾及去法律化四个维度均获得9.7以上的高分,展现了极佳的保真度与去法律化效果,为模型提供了贴近现实、颇具挑战的基准。
使用方法
Dis2Pat数据集可灵活用于多种场景的专利生成任务。研究者可直接以披露文本及其附图为输入,让模型生成完整的权利要求书与说明书,评估其端到端起草能力。亦可采用所述Patent-MAF多智能体框架,通过管理器、撰写器与润色器的协同,在本地开源模型上实现结构化起草与全局细化,兼顾隐私与性能。数据集提供清晰的训练与测试划分,并排除专利族重叠,便于进行公正的模型性能比较与消融实验。
背景与挑战
背景概述
Dis2Pat数据集由剑桥大学、中国科学院国家科学图书馆及中国科学院大学的研究团队于2026年创建,聚焦于发明披露到专利申请的端到端生成任务。该数据集旨在弥合现有专利生成基准与真实专利撰写流程之间的鸿沟,其核心研究问题是如何将非法律化、发明人风格的披露文本及附图直接转化为完整的专利申请文件。作为首个包含发明人风格披露及附图的披露到专利数据集,Dis2Pat为长文本、法律约束下的专利生成研究提供了重要基准,对推动专利智能撰写领域的发展具有深远影响。
当前挑战
Dis2Pat面临的挑战主要体现在领域问题与构建过程两个维度。在领域层面,专利撰写需处理长篇幅、严谨法律结构及跨文本与图像的语义对齐,且需从非结构化、非法律化的发明披露中准确提取核心技术与创新特征,这远超常规文本生成任务的复杂性。在构建层面,真实发明披露因保密和法律约束无法公开获取,研究团队不得不借助LLM从授权专利中合成伪披露,同时需严格控制去法律化程度、保持技术内容完整性,并避免引入幻觉或矛盾,确保数据质量与可靠性。
常用场景
经典使用场景
Dis2Pat数据集专为发明人风格的技术披露到完整专利申请的自动撰写任务而设计,其经典应用场景是评测和推动大语言模型在真实专利撰写流程中的端到端性能。该数据集模拟了专利代理人面临的初始工作:将非正式、非法律化的发明披露,连同技术示意图,转化为包含权利要求书和详细说明书的完整专利文件。这一场景精准映射了发明人早期提交的技术交底书到法律文件转化的核心环节,填补了现有基准在输入形式上与实际专利撰写工作流之间的缺口。
解决学术问题
该数据集有效回应了长期困扰专利自然语言处理领域的学术难题:如何在缺乏真实发明披露数据的情况下,系统性地研究与评估从早期发明材料到法律专利文件的生成过程。既有数据集或依赖后期结构化输入,或仅聚焦单一撰写子任务,难以支撑完整专利申请的生成研究。Dis2Pat通过受控的LLM重写过程构建大规模伪披露数据,并引入多模态信息,使得研究者能够在兼顾隐私与数据可得性的前提下,深入探究法律约束下的长文本生成、技术内容保持以及图文融合等关键科学问题。
衍生相关工作
围绕Dis2Pat数据集,衍生了一系列开创性的研究。其中最为突出的是专利多Agent起草框架Patent-MAF,通过将撰写过程分解为管理、起草与润色等专业化角色,并基于可本地部署的开源模型实现,系统性地提升了完整专利申请的生成质量,尤其在跨部分一致性方面表现卓越。此外,数据集的构建理念与评估方法也启发了后续研究,如针对专利生成结果的法律质量自动评估、多模态专利撰写的进一步探索,以及面向不同法域或语言的专利草拟适配研究,共同推动了专利智能撰写领域的快速发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务