my-patents-data
收藏资源简介:
该数据集名为全球专利出版物与中国专利族质量指标,包含两个Parquet文件,用于表格分类和特征提取任务。第一个文件cn_family_quality_master_gft.parquet以专利族为观察单位,涵盖2003年至2019年的中国核心发明专利族,包含约10,790,043行数据。该文件集成了专利质量评估的完整流程,包括语义知识重组、严格历史语义新颖性、基于IPC的知识重组稳健性度量、三年和五年远期引用、CD3和CD5破坏性度量、全窗口和五年期PageRank,以及语义KNN图的低通和高通/图傅里叶变换分量。第二个文件global_invention_patents_with_quality.parquet以专利出版物记录为观察单位,将全球发明专利申请出版物表与中国专利族质量主表通过family_id进行左连接,保留所有原始出版物级别的行和列,匹配到同一专利族的出版物获得相同的族级质量指标,并通过quality_matched标识匹配状态,未匹配的全球出版物保留在文件中但质量字段为空。该文件预期包含约121,309,581行数据。方法上,缺失的知识重组、破坏性指标或图傅里叶变换值未被零值替换,PageRank零值伴随in_citation_graph指标以标识是否在可识别引用图中。该数据集为私有资源,使用前需审查源数据许可、再分发权利和披露要求。
数据集概览:Global Patent Publications with Chinese Patent-Family Quality Measures
数据集地址:https://huggingface.co/datasets/niban73/my-patents-data
语言:英文、中文
任务类别:表格分类、特征提取
文件结构
-
data/cn_family_quality_master_gft.parquet- 每个条目代表一个中国焦点发明专利族,时间范围为 2003–2019 年。
- 包含累积专利质量指标,如:
- 语义知识重组(semantic KI)
- 严格历史语义新颖性
- 基于IPC的KI鲁棒性度量
- 三年和五年向前引用
- CD3和CD5颠覆性度量
- 全窗口和五年PageRank
- 语义KNN图的低通/高通/GFT分量
- 预计行数:10,790,043
-
data/global_invention_patents_with_quality.parquet- 原始全球发明专利公开表,通过
family_id左连接到专利族质量主表。 - 保留原始公开级别的行和列。
- 属于同一匹配族的所有公开记录共享相同的族级质量指标。
quality_matched = true标识已匹配到中国焦点族质量表的公开记录。- 未匹配的全球公开记录保留在文件中,质量字段为空。
- 预计行数:121,309,581
- 原始全球发明专利公开表,通过
观测单元说明
- 质量主表:专利族(patent family)
- 全球结果表:专利公开记录(patent publication record)
- 匹配键:
family_id
重要方法论说明
- 缺失的KI、CD或GFT值未以零填充。
- 对于无法识别引用图之外的专利族,其PageRank为零值,并附有
in_citation_graph指示符。 - 该仓库创建时为私有状态,更改可见性前需审查源数据许可、再分发权利和披露要求。




