遇见数据集

ri-conicet

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

RI CONICET 数据集是阿根廷国家科学技术研究委员会(CONICET)机构知识库 CONICET Digital 的快照。该数据集收录了 CONICET 全部科研产出的元数据,以及开放获取的 PDF 全文。数据来源为 ri.conicet.gov.ar 的 OAI-PMH 2.0 接口,由阿根廷国立里奥内格罗大学(UNRN)的应用科学、工程与技术研究所(CITA)维护,并定期自动更新。数据集包含约 26.6 万条记录,每条记录对应一篇科研产出,其元数据字段包括:item_id(唯一标识符)、title(标题)、creators(作者列表)、subjects(关键词/主题)、description(摘要)、date(出版日期)、type(文献类型)、language(语言代码,多为 spa)、publisher(出版机构)、rights(访问权限,如开放获取、受限等)、formats(比特流格式)、deleted(是否已删除)、fetched_at(采集时间戳)、pdf(PDF 文件路径,仅开放获取且有 PDF 时存在)、embedding(PDF 文本的 1024 维浮点嵌入向量,基于 Jina embeddings v5 omni 模型)。数据以 Parquet 格式存储元数据,PDF 按 shard 组织。该数据集适用于学术研究、文献计量分析、自然语言处理、信息检索等任务。使用时需注意尊重各作品的版权条款,大部分采用 CC BY-NC 许可,受限或 embargo 状态的出版物不包含 PDF。

The RI CONICET dataset is a snapshot of CONICET Digital, the institutional repository of the National Scientific and Technical Research Council (CONICET) of Argentina. It contains metadata for all scientific outputs of CONICET, as well as open-access PDF full texts. The data is sourced from the OAI-PMH 2.0 interface of ri.conicet.gov.ar, maintained by the Institute of Applied Sciences, Engineering and Technology (CITA) of the National University of Río Negro (UNRN), and is regularly updated automatically. The dataset includes approximately 266,000 records, each corresponding to a scientific output, with metadata fields including: item_id (unique identifier), title, creators (list of authors), subjects (keywords/topics), description (abstract), date (publication date), type (document type), language (language code, mostly spa), publisher (publishing institution), rights (access rights, such as open access, restricted, etc.), formats (bitstream formats), deleted (whether deleted), fetched_at (collection timestamp), pdf (PDF file path, only available for open-access items with PDF), and embedding (1024-dimensional floating-point embedding vector of the PDF text, based on the Jina embeddings v5 omni model). Metadata is stored in Parquet format, and PDFs are organized by shard. The dataset is suitable for academic research, bibliometric analysis, natural language processing, information retrieval, and other tasks. Users should respect the copyright terms of each work; most are licensed under CC BY-NC, and restricted or embargoed publications do not include PDFs.

创建时间:
2026-08-28
原始信息汇总

数据集概述

RI CONICET 是一个包含阿根廷国家科学与技术研究委员会(CONICET)机构知识库完整元数据及开放获取PDF文件的快照数据集,数据源自 CONICET Digital 机构知识库(ri.conicet.gov.ar,基于 DSpace 系统),涵盖 266,824 篇科技出版物。该数据集由 CITA - UNRN(国立里奥内格罗大学应用科学、工程与技术研究所)维护,通过 OAI-PMH 2.0 协议从 ri.conicet.gov.ar 自动采集,并持续增量更新。数据集中元数据快照与 PDF 语料库会随时间增长并自动更新。

数据规模与语言

  • 数据量:100K 至 1M 条记录之间
  • 主要语言:西班牙语(es)
  • 许可证:其他(具体作品遵循各自版权条款)
  • 出版类型:文献类型使用 info:eu-repo/semantics/... 语义词汇标记

数据集结构

路径 内容
data/metadata.parquet 元数据表,每行对应一篇出版物
papers/<shard>/<item_id>.pdf 开放获取PDF文件,<shard>item_id // 20000 的两位数分片(例如 papers/08/179477.pdf

元数据字段说明

列名 类型 描述
item_id str DSpace 唯一ID(如 179477),由它可推导 handle 和 OAI ID
title str 出版物标题
creators list[str] 作者列表
subjects list[str] 关键词或学科分类
description str 摘要
date str 出版日期(格式为 AAAA 或 AAAA-MM)
type str 文献类型(info:eu-repo/semantics/...
language str ISO 639 语言代码(主要为 spa
publisher str 出版机构
rights str 访问权限(openAccessrestrictedAccessembargoedAccessclosedAccess 等)
formats list[str] 位流格式(如 application/pdf
deleted bool 是否已从知识库删除(罕见)
fetched_at datetime 记录采集时间
pdf str/None 若已发布PDF则为 papers/<shard>/<item_id>.pdf,否则为 None
embedding list[float] (1024) / None PDF文本的float32嵌入向量(模型为 citecca-embeddings,即 Jina embeddings v5 omni,1024维);若无开放PDF、PDF为扫描件无可提取文本或仍在处理中则为 None

关键说明

  • 开放获取 定义为 rights == "info:eu-repo/semantics/openAccess"
  • pdfNone 的两种情况:闭锁/受限出版物(不公开PDF)以及开放出版物但PDF尚未采集(语料库持续增长,列会随快照更新)
  • pdfNone 时,文件一定存在于数据集中
  • OAI ID 和 handle 均由 item_id 推导,不重复存储

使用方式

Python 加载(使用 Hugging Face datasets 库):

python from datasets import load_dataset

ds = load_dataset("UNRN/ri-conicet", data_files="data/metadata.parquet", split="train") ds[0]["title"]

仅筛选有PDF的开放获取出版物

ds.filter(lambda r: r["pdf"] is not None)

PDF 下载

bash

下载单个PDF(分片路径:papers/<item_id // 20000>/<id>.pdf)

hf download UNRN/ri-conicet papers/08/179477.pdf

下载完整语料库(体积达数千GB,请谨慎操作)

hf download UNRN/ri-conicet papers

许可证与使用说明

  • 每篇出版物的权利归其作者/机构所有,多数采用 CC BY-NC 类许可
  • 受限或处于禁运期的出版物 不包含 PDF(需向作者申请访问)
  • 建议仅用于研究目的,非商业用途,并遵守各作品的使用条款

引用方式

参考引用格式(BibTeX):

@misc{ri-conicet-hf-2026, title = {RI CONICET: metadatos completos y PDFs de acceso abierto}, author = {CITA - Universidad Nacional de Rio Negro}, month = aug, year = {2026}, publisher = {Hugging Face}, journal = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/UNRN/ri-conicet}} }

⚠️ 注意:该数据集仍在建设中,数据采集持续进行,元数据快照和PDF语料库会随时间自动更新。如需一次性获取完整知识库,请等待采集完成。

搜集汇总
数据集介绍
ri-conicet 数据集图片
构建方式
该数据集依托阿根廷国家科学与技术研究理事会(CONICET)机构知识库 ri.conicet.gov.ar,通过OAI-PMH 2.0协议批量采集元数据,并同步下载开放获取的PDF全文。元数据以Parquet格式存储,每条记录对应一篇出版物,涵盖题名、作者、关键词、摘要、出版日期、文献类型、语言、出版社、权利声明、格式、删除状态、采集时间等字段,并附带可选的PDF路径及基于Jina embeddings v5模型生成的1024维文本嵌入向量。PDF文件按分片规则(每20000篇为一个分片)存储于papers目录下,以二进制文件形式提供全文内容。该快照会定期自动更新,以纳入新发表的文献,确保数据集的时效性。
特点
该数据集的核心优势在于其完整的元数据与开放获取全文的集成,覆盖CONICET全部266,824篇科研成果,语种以西班牙语为主。每条记录均包含标准化字段,如权利声明区分开放获取、受限访问、 embargo 及封闭访问等状态,并仅对开放获取且具有可提取文本的PDF提供嵌入向量。数据集支持按权限过滤,用户可便捷地筛选出含PDF的开放获取文献。其分布式的分片存储结构便于大规模下载与处理,同时自动化的更新机制保证了数据的新鲜度,为科学计量分析、文本挖掘及自然语言处理研究提供了高质量、大规模的真实语料库。
使用方法
用户可通过Hugging Face datasets库直接加载元数据表,例如使用load_dataset函数指定Parquet文件路径,即可获得可迭代的数据集对象,支持基于pandas的过滤操作,如筛选含有PDF的开放获取记录。对于需要全文的研究,可借助huggingface_hub库或命令行工具下载指定PDF文件,或一次性获取整个papers目录(注意其容量庞大)。此外,数据集中已包含的嵌入向量可直接用于语义检索或聚类分析,无需额外计算。使用时需遵守各出版物自身的许可协议,尤其是非商业用途的限制,并建议引用数据集的官方引用信息以确保学术规范。
背景与挑战
背景概述
ri-conicet数据集由阿根廷国家科学与技术研究理事会(CONICET)下属的里奥内格罗国立大学应用科学、工程与技术研究所(CITA-UNRN)于2026年创建,旨在系统化整理CONICET Digital机构知识库(基于DSpace,含266,824篇出版物)的全部元数据与开放获取PDF全文。该数据集通过OAI-PMH 2.0协议自动收割,覆盖阿根廷全国科研产出的多学科领域,包含标题、作者、关键词、摘要、日期、类型、语言、权利等丰富字段,并创新性地为每篇PDF提供1024维嵌入向量(基于Jina embeddings v5 omni模型),为科学计量分析、自然语言处理及人工智能研究提供了规模可观且结构化的语料基础。作为开放科学基础设施的重要补充,该数据集填补了拉美地区大规模机构知识库结构化数据集的空白,有望推动西班牙语学术文本挖掘、科研评价及知识图谱构建等领域的进步。
当前挑战
该数据集构建面临多重挑战。从领域问题看,科研文献数据的异构性显著,不同学科、不同时期的元数据规范不统一,需处理多语言(主要为西班牙语)及复杂文档类型(如预印本、会议论文、技术报告)的分类与归一化;同时,版权与开放获取的边界需精细划分,以合规方式仅收录允许公开的PDF,并避免侵犯作者权益。从构建过程看,数据采集依赖OAI-PMH协议,存在服务器响应延迟、分页限制及记录更新追踪等技术难点;元数据质量参差不齐,需清洗字段缺失、重复及格式错误;PDF文本提取对扫描版文档难以奏效,嵌入计算需处理大规模计算资源消耗,且快照更新机制需平衡时效性与完整性,确保在持续增长的数据流中保持数据集的一致性与可复现性。
常用场景
经典使用场景
该数据集作为阿根廷国家科学与技术研究委员会(CONICET)机构知识库的完整快照,囊括了超过26万条科研产出元的元数据与开放获取全文PDF,为科学计量学、知识图谱构建及大规模学术文献分析提供了极为丰富的语料基础。其经典使用方式在于借助HuggingFace datasets库进行高效的元数据检索与过滤,进而结合内嵌的1024维文本向量开展语义层面的文献聚类、主题演化追踪及研究前沿识别等前沿探索,亦可作为训练科学文献表示模型的可再生资源。
衍生相关工作
此数据集的发布催生了一系列衍生的学术探索,包括基于其大规模PDF语料微调领域特定的科学语言模型,发展针对西班牙语学术文本的命名实体识别与关系抽取技术,以及构建阿根廷科研知识图谱。此外,研究者可借助其时间跨度数据,分析科研主题的动态演变与社会关注度的关联,从而为科技预测学和创新政策研究提供实证素材。其开放的架构亦为后续融合多源异构数据、开展跨国家科研体系比较研究提供了可复用的范式。
数据集最近研究
最新研究方向
该数据集的最新研究方向聚焦于阿根廷国家科学与技术研究委员会(CONICET)全部科研成果的开放获取与元数据整合,通过OAI-PMH协议系统化采集DSpace仓库中的26万余条出版物记录,并配套开放获取PDF全文及基于Jina v5模型的1024维语义嵌入。这一举措在开放科学运动持续深化的背景下,为拉丁美洲科研产出提供了规模化、结构化的语料基础,尤其针对西班牙语学术文本的语义检索、知识图谱构建及科研态势分析等前沿应用开辟了新路径。数据集的动态更新机制与嵌入式表征设计,使其成为训练领域特定语言模型、开展文献计量学研究和促进南半球科研数据互操作的宝贵资源,对提升区域科研可见度与全球学术对话产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务