遇见数据集

专利内审研究数据

收藏
浙江省数据知识产权登记平台2026-09-01 更新2026-09-02 收录
官方服务:

资源简介:

通过对专利代理业务系统中提交的专利申请文本进行自动化采集与分析。该数据集采集了基础信息字段、文本特征字段、相似性分析字段、三性评估字段、综合评估字段、审查模式字段。解决了专利代理人完成专利撰写之后需要人工审核,效率低下的问题。1.采用中文分词工具对专利文本进行分词处理,使用TF-IDF算法将文本转换为数值向量,计算词频-逆文档频率,构建专利技术特征向量。2.基于文本向量,在现有专利数据库中检索相似专利,采用余弦相似度算法计算文本相似度,公式:Cosine Similarity = (A·B) / (||A|| × ||B||)。A·B:向量A与向量B的点积,||A||、||B||:向量的模长。记录最高相似度,统计支撑映射项数(权利要求与现有专利的映射关系数量)。3.文本内容通过NLP/AI模型计算。新颖性分=最高相似度差异×40% +技术特征差异度×35% +技术领域独特性×25%,创造性分=问题解决难度×30% +技术效果提升×30% + 特征组合创造性×25%+趋势契合度×15%由大模型做语义理解打分,创造性分=问题解决难度×30% +技术效果提升×30% +特征组合创造性×25% +趋势契合度×15%,由大模型做语义理解打分。4.采用加权融合算法计算综合评分。公式:综合评分 = (新颖性分W1+ 创造性分W2 + 实用性分W3)/3 + 修正因子。修正因子:综合判断系统投喂数据,结合最高相似度、相似专利、支撑映射项数,采用rules、deepseek等单一或组合方式算法,综合得出修正指数。 5.输出风险等级判定:基于综合评分,预测专利授权概率,输出授权概率百分比(范围0%-100%)。风险判定:低风险:综合评分≥85分。中风险:综合评分72-84之间。中高风险:综合评分60-71之间。高风险:低于60分(不包含60分)。 6.输出专利文本改进生成规则:低风险:可以提交专利申请。中高风险:当系统综合评分为中高风险时,建议修改。修改规则为:新颖性分 < 50,触发新颖性改进,补充创新点描述。创造性分 < 50,触发创造性改进,补充阐述技术问题的解决方案及技术效果。实用性分 < 70,触发实用性改进,完善实施例,增强技术方案的可操作性。支撑映射项数 = 0,检查权利要求书与说明书的对应关系。输入文本长度 < 3000字,补充技术细节,完善专利文本内容。高风险:当判定为高风险时,返回技术重新修改方案。

创建时间:
2026-06-26
搜集汇总
数据集介绍
专利内审研究数据 数据集图片
背景与挑战
背景概述
该数据集通过自动化采集与分析专利代理业务系统中的专利申请文本,构建了包含基础信息、文本特征、相似性分析、三性评估、综合评估及审查模式等多维度字段的数据资源。其核心流程利用中文分词、TF-IDF向量化及余弦相似度计算,结合NLP/AI模型和加权融合算法,对专利的新颖性、创造性和实用性进行量化评分,最终输出授权概率、风险等级及改进建议,有效解决了专利撰写后人工审核效率低下的问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务