遇见数据集

us-patents-citation-company-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集为美国专利、引用与受让人关系图(USPTO / PatentsView),由DataForge基于USPTO/PatentsView官方批量数据构建。包含自1976年至今的约910万项美国授权专利,以及完整的引用网络、受让人、发明人和CPC分类信息。全图版本总计超过2.55亿行数据。数据集以多个表(config)形式组织,包括:patents(专利主表,约9,075,421行)、citations(引用关系,约145,878,465行)、assignees(受让人,约8,385,078行)、inventors(发明人,约22,884,194行)、cpc(CPC分类,约56,755,723行)、assignee_entities(受让人实体,约552,495行)、citation_metrics(引用指标,约9,075,421行)、company_citations(公司引用,约2,229,371行)、company_profiles(公司画像,约481,780行)、cpc_trends(CPC趋势,约29,847行)。数据以Parquet格式存储,提供Snappy压缩分片。该数据集适用于创新与研发格局分析、现有技术及引用网络研究、公司技术画像、以及基于专利文本元数据的AI训练。学术与个人使用遵循CC BY-NC 4.0许可(需署名并回链至data.zalize.com),商业使用需获取DataForge商业许可。上游数据(USPTO PatentsView)遵循CC BY 4.0。

This dataset is a US patent, citation, and assignee relationship graph (USPTO/PatentsView), constructed by DataForge based on the official bulk data from USPTO/PatentsView. It contains approximately 9.1 million US granted patents from 1976 to the present, along with a complete citation network, assignees, inventors, and CPC classification information. The full graph version totals over 255 million rows of data. The dataset is organized into multiple tables (configs), including: patents (main patent table, ~9,075,421 rows), citations (citation relationships, ~145,878,465 rows), assignees (~8,385,078 rows), inventors (~22,884,194 rows), cpc (CPC classification, ~56,755,723 rows), assignee_entities (~552,495 rows), citation_metrics (~9,075,421 rows), company_citations (~2,229,371 rows), company_profiles (~481,780 rows), and cpc_trends (~29,847 rows). Data is stored in Parquet format with Snappy compression shards. This dataset is suitable for innovation and R&D landscape analysis, prior art and citation network studies, company technology profiling, and AI training based on patent text metadata. Academic and personal use follows CC BY-NC 4.0 license (attribution and backlink to data.zalize.com required), while commercial use requires a commercial license from DataForge. Upstream data (USPTO PatentsView) follows CC BY 4.0.

创建时间:
2026-08-08
原始信息汇总

数据集概述

该数据集为美国专利、引用及受让人图谱数据集,基于美国专利商标局(USPTO)/PatentsView的官方批量数据构建,涵盖1976年至今的910万项美国授权专利及其完整的引用图谱、受让人、发明人和CPC分类信息。

关键信息

  • 名称:US Patents, Citations & Assignee Graph (USPTO / PatentsView)
  • 许可协议:CC BY-NC 4.0(学术/个人使用),商业使用需获得DataForge商业许可;上游数据为USPTO PatentsView批量数据,遵循CC BY 4.0
  • 语言:英语
  • 任务类型:文本分类
  • 数据规模:1亿至10亿条记录
  • 数据格式:Parquet(snappy压缩)

数据内容与规模

数据表 行数 Parquet分片数 大小
assignee_entities 552,495 1 48.0 MB
assignees 8,385,078 1 390.2 MB
citation_metrics 9,075,421 1 92.8 MB
citations 145,878,465 2 1,314.5 MB
company_citations 2,229,371 1 36.5 MB
company_profiles 481,780 1 13.2 MB
cpc 56,755,723 2 614.6 MB
cpc_trends 29,847 1 0.3 MB
inventors 22,884,194 2 741.1 MB
patents 9,075,421 6 3,637.5 MB

此外还提供两个归档压缩包:

  • patents-tier1-S-2026-08-02.zip:核心专利数据,9,075,421行,7.92 GB
  • patents-tier1-M-2026-08-02.zip:完整图谱数据,255,347,795行,17.24 GB

数据配置

共包含10个可加载的数据配置:

  • assignee_entitiesassigneescitation_metricscitationscompany_citations
  • company_profilescpccpc_trendsinventorspatents

使用场景

  • 创新与研发格局分析
  • 现有技术和引文网络研究
  • 公司技术画像刻画
  • 面向专利文本元数据的AI训练

数据来源与方法

数据来源于USPTO/PatentsView批量下载,配套提供数据字典、数据表说明和质量评估报告。原始发布压缩包内含CSV/JSONL副本、数据字典、数据表说明及质量评估报告。

引用方式

PatentsView (CC BY 4.0); packaged by DataForge (data.zalize.com) — https://data.zalize.com/datasets/us-patents-citation-company-dataset

搜集汇总
数据集介绍
us-patents-citation-company-dataset 数据集图片
构建方式
本数据集源自美国专利商标局(USPTO)及PatentsView的公开批量数据,经DataForge精心整合与结构化处理而成。其核心包含自1976年至今逾910万项美国授权专利的详尽元数据,并构建了完整的引用图谱、专利权人(assignee)、发明人及CPC分类信息。数据集采用多表分片存储,涵盖专利、引用、发明人、公司档案等十个独立配置,以Parquet格式高效压缩,总行数超过2.55亿,确保了数据访问的便捷性与可扩展性。
使用方法
用户可通过多种方式便捷使用此数据集。在Python环境中,推荐使用HuggingFace的`datasets`库进行加载,例如`load_dataset("zalizedata/us-patents-citation-company-dataset", "assignee_entities", split="train")`。同时,支持Pandas、Polars及DuckDB直接读取Parquet分片,如`pd.read_parquet("hf://.../*.parquet")`或`duckdb.sql("SELECT * FROM 'hf://.../*.parquet'")`。该数据集适用于前沿检索、引用网络分析、公司技术画像构建以及专利元数据的AI训练等多元场景,且许可协议明确区分学术与商业用途,确保合规使用。
背景与挑战
背景概述
该数据集由DataForge开放数据计划于近期构建,基于美国专利商标局(USPTO)及PatentsView的批量数据,整合了自1976年至今的910余万项美国授权专利及其完整引用网络、受让人、发明人和CPC分类信息,全图版本包含超过2.55亿行数据。核心研究问题聚焦于通过专利引用图谱揭示技术创新轨迹、企业技术布局及研发竞争力演化。数据集为创新经济学、科技政策及产业分析提供了大规模结构化基础设施,显著促进了专利计量学与人工智能驱动的技术情报研究,其影响力已延伸至学术界的知识扩散分析及产业界的竞争情报实践。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题层面,专利数据的高维稀疏性与引用网络的复杂动态性长期困扰着技术演化分析,传统分类体系难以捕捉跨领域知识流动,企业技术画像的构建亦受限于受让人名称消歧及数据碎片化。在构建过程中,整合多源批量数据需应对实体匹配误差、时间跨度内的格式变迁及大规模图数据的存储与高效检索难题,同时确保数据质量与更新一致性,兼顾学术开放与商业使用的许可兼容性,为后续研究者设置了较高的数据治理门槛。
常用场景
经典使用场景
该数据集汇聚了自1976年至今逾910万项美国授权专利及其完整的引用图谱、受让人、发明人与CPC分类信息,为科技创新研究提供了翔实的数据基石。其经典使用场景在于构建大规模专利引用网络,进而分析技术演进的脉络与知识流动的轨迹。研究者可借此挖掘核心技术领域的发展趋势,识别具有里程碑意义的专利节点,并探索跨领域技术融合的规律。同时,该数据集亦为专利质量评估、创新产出度量及技术生命周期研究提供了标准化的数据支撑,广泛应用于科学计量学与创新管理的前沿探索。
解决学术问题
该数据集有效解决了学术研究中长期困扰的创新量化难题。通过提供完整的专利引用关系和受让人实体信息,它使得学者能够精确追踪知识溢出效应,突破传统依赖单一专利指标的局限。其构建的引用度量体系,为衡量专利影响力、技术前沿性及企业创新能力提供了可靠且可复现的量化工具。此外,数据集内含的公司与技术分类关联数据,极大促进了产业创新生态、技术竞争格局及区域创新差异等重大议题的实证研究,为创新经济学与科技政策学领域提供了前所未有的分析深度。
实际应用
在实际应用层面,该数据集已成为企业技术情报与投资决策的关键基础设施。众多科技公司利用其庞大的引用图与受让人档案,进行专利组合的战略性管理,评估自身技术地位并洞悉竞争对手的研发方向。知识产权服务机构亦借此增强其专利检索与无效分析能力,提升服务效能。更广泛地,该数据集还服务于政府科技规划与区域创新政策的制定,通过对技术热点的实时监控,辅助资源的高效配置,推动产学研协同创新生态的构建。
数据集最近研究
最新研究方向
该数据集以USPTO官方专利数据为底蕴,融合完整的引用图谱与受让人、发明人及CPC分类信息,为创新研究提供了前所未有的全景视角。当前,其前沿方向聚焦于构建大规模知识图谱以驱动技术洞察与竞争情报分析,尤其在人工智能辅助的专利价值评估、企业技术战略演化追踪以及跨领域知识流动的量化研究中展现出巨大潜力。结合全球对知识产权密集型产业和开放式创新的关注,该数据集正成为连接专利数据科学与商业智能的桥梁,推动从静态文献计量向动态网络分析的范式跃迁,为揭示创新生态系统的复杂结构与演化规律提供了坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务