INPI-France/FR-Patent-2024-Chunked
收藏资源简介:
--- license: apache-2.0 language: - fr configs: - config_name: default data_files: - split: train path: - train-00000.parquet - train-00001.parquet - train-00002.parquet - train-00003.parquet - train-00004.parquet - train-00005.parquet - train-00006.parquet - train-00007.parquet - train-00008.parquet - train-00009.parquet - train-00010.parquet - train-00011.parquet - train-00012.parquet - train-00013.parquet - train-00014.parquet - train-00015.parquet - train-00016.parquet - train-00017.parquet - train-00018.parquet - train-00019.parquet - train-00020.parquet - train-00021.parquet - train-00022.parquet - train-00023.parquet - train-00024.parquet - train-00025.parquet - train-00026.parquet - train-00027.parquet - train-00028.parquet - train-00029.parquet - train-00030.parquet - train-00031.parquet - train-00032.parquet - train-00033.parquet - train-00034.parquet --- # 🇫🇷 Brevets français 2024 Chunké 🇫🇷 Dataset de **brevets français publiés en 2024**, extrait depuis les XML d’origine et **chunké** au niveau des balises `<p>` xml Format : **Parquet**, prêt pour chargement streaming / distribué. --- ## Source Données issues de **documents publics de brevets français (A1, 2024)**. Extraction, structuration et découpage réalisés de manière indépendante grace a un acces aux API/FTP PI (sur demande a l'inpi). --- ## Génération Entrée : - **35 479 fichiers XML** Sortie : - **3 321 782 lignes** - **35 shards Parquet** --- ## Schéma Chaque ligne correspond à un chunk de texte. Colonnes : - `publication_number` - `kind` - `publication_date` - `data_type` - `section` - `claim_id` - `text` - `text_len` --- ## Usage prévu - pré-entraînement LLM (fr) - NLP technique / juridique - RAG / indexation vectorielle - benchmarks tokenizer / tokenizer-free - data engineering à grande échelle --- ## Notes - pas de réécriture du texte - pas de nettoyage sémantique lourd - chunks bruts, déterministes - dataset orienté **compute / scale** --- ## Licence Apache 2.0 En cas de confusion liée au nom ou à la présentation du dataset ou de l’organisation, **les éléments concernés pourront être modifiés**.
许可证:Apache 2.0 数据集语言:法语 配置信息: - 配置名称:默认配置 数据文件配置: - 数据拆分:训练集 - 数据文件路径:train-00000.parquet、train-00001.parquet、train-00002.parquet、train-00003.parquet、train-00004.parquet、train-00005.parquet、train-00006.parquet、train-00007.parquet、train-00008.parquet、train-00009.parquet、train-00010.parquet、train-00011.parquet、train-00012.parquet、train-00013.parquet、train-00014.parquet、train-00015.parquet、train-00016.parquet、train-00017.parquet、train-00018.parquet、train-00019.parquet、train-00020.parquet、train-00021.parquet、train-00022.parquet、train-00023.parquet、train-00024.parquet、train-00025.parquet、train-00026.parquet、train-00027.parquet、train-00028.parquet、train-00029.parquet、train-00030.parquet、train-00031.parquet、train-00032.parquet、train-00033.parquet、train-00034.parquet --- # 🇫🇷 2024年法国专利分块数据集 🇫🇷 本数据集收录2024年发布的法国专利,源自原始XML文件,并按照XML的`<p>`标签进行分块处理。数据格式为Parquet,支持流式加载与分布式加载。 --- ## 数据来源 本数据集源自2024年法国公开专利文档(A1类)。数据的提取、结构化与分块工作由独立团队通过PI API/FTP接口完成,接口权限需向法国国家工业产权局(INPI)申请。 --- ## 数据生成 - 输入:35479个XML文件 - 输出:3321782条数据行,分为35个Parquet分片 --- ## 数据字段结构 每条数据对应一个文本分块,包含以下字段: - `publication_number`:专利公开号 - `kind`:专利类型标识 - `publication_date`:公开日期 - `data_type`:数据类型 - `section`:所属章节 - `claim_id`:权利要求编号 - `text`:文本内容 - `text_len`:文本长度 --- ## 预期用途 - 法语大语言模型(LLM)预训练 - 技术与法律领域自然语言处理(NLP) - 检索增强生成(RAG)与向量索引构建 - 分词器与非分词器基准测试 - 大规模数据工程实践 --- ## 使用说明 - 未对原始文本进行任何重写处理 - 未进行重度语义清洗操作 - 分块结果为原始未加工版本,分块逻辑具有确定性 - 本数据集面向计算性能与扩展性优化设计 --- ## 许可证 Apache 2.0 若因数据集名称、展示形式或相关组织产生混淆,相关内容可能会进行调整。



