遇见数据集

copernicus-rag-core

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

Copernicus RAG core是一个经过完整处理的核心数据集,专为基于四个Copernicus数据存储(CMEMS海洋、CDS气候、ADS大气、EWDS早期预警)的三层检索增强生成(RAG)系统而构建。该数据集不包含原始PDF或图像,而是提供了结构化的中间产物,包括原始Markdown文档、文本分块、已生成的768维嵌入向量、预构建的Qdrant混合索引(支持稠密+BM25稀疏检索)、完整的链接元数据侧文件以及用于从零开始重建所有内容的完整流水线脚本。数据集内容组织为四个层级:L1(发现层,包含1,418个数据集卡片)、L2(分析层,包含CMEMS、CDS/ADS/EWDS的文档以及C3S EQC质量报告,共约54,864个点)、L3(方法层,包含430,066个已解析的学术论文点,链接到相关数据集)。数据总规模约为485,348个点。数据集适用于地球观测、气候科学、海洋学、大气科学和灾害预警等领域的科学信息检索与问答任务。使用前需注意部分论文和笔记本内容受版权限制(CC-NC/ND或无许可证),建议在私有环境中使用。

Copernicus RAG core is a fully processed core dataset built for a three-layer retrieval-augmented generation (RAG) system based on four Copernicus data stores (CMEMS ocean, CDS climate, ADS atmosphere, EWDS early warning). The dataset does not contain raw PDFs or images but provides structured intermediates, including original Markdown documents, text chunks, generated 768-dimensional embeddings, pre-built Qdrant hybrid indexes (supporting dense + BM25 sparse retrieval), complete link metadata side files, and full pipeline scripts for rebuilding everything from scratch. The dataset content is organized into four levels: L1 (discovery layer, containing 1,418 dataset cards), L2 (analysis layer, containing documents from CMEMS, CDS/ADS/EWDS, and C3S EQC quality reports, totaling approximately 54,864 points), L3 (method layer, containing 430,066 parsed academic paper points linked to relevant datasets). The total data size is approximately 485,348 points. The dataset is suitable for scientific information retrieval and question-answering tasks in fields such as Earth observation, climate science, oceanography, atmospheric science, and disaster warning. Note that some papers and notebook content are subject to copyright restrictions (CC-NC/ND or no license), and it is recommended to use in a private environment.

创建时间:
2026-07-23
原始信息汇总

数据集概述

  • 数据集名称: copernicus-rag-core
  • 简介: 一个经过完整处理的三级RAG核心数据集,覆盖所有四个Copernicus数据存储库:CMEMS (海洋)、CDS (气候)、ADS (大气)、EWDS (早期预警)。包含原始Markdown文件、文本块、预计算的768维嵌入、预构建的Qdrant索引、所有链接的侧车文件,以及全套重建脚本。不含PDF和图像。

数据集层级与内容

层级 集合名称 数据点数量 内容描述
L1 发现 copernicus_docs 1,418 所有四个存储库的数据集卡片
L2 分析 marine_docs 29,249 CMEMS的PUM/QUID/SQO文档(807份文档 / 306个产品)
L2 分析 cds_docs 23,341 CDS/ADS/EWDS的PUG/ATBD文档(766份文档 / 165个数据集)
L2 分析 eqc_qa 1,274 C3S EQC质量报告(74份)
L3 方法 publications 430,066 已解析的论文,并与数据集关联(12,411篇论文)

数据集文件结构

  • originals_md/: 原始Markdown文件,包括:cmems/ (813个), cds_ads_ewds/ (772个), eqc_reports/ (74个), notebooks/ (194个), publications_md.tar.gz (11,209个,使用MinerU-VLM解析,仅包含CC许可/公共领域论文)
  • chunks/: 每个集合的文本块JSONL文件 (chunks.jsonl + papers.jsonl)
  • embeddings/: 嵌入向量文件 (*.jsonl.gz),使用gemini-embedding-2-preview模型,768维,L2归一化
  • indexes/: 4个预构建的嵌入式Qdrant目录 (tar.gz),支持混合密集+BM25搜索,论文有效负载已重新链接
  • metadata/: 元数据文件,包括:catalog.jsonunified_metadata.json (1,436个)、links_by_dataset.json (234个数据集 / 8,917篇论文 / 31,190个链接)
  • scripts/: 完整的数据集生成或重建脚本
  • REBUILD.md: 从头开始重建或切换开源LLM的完整指南

快速启动

提供两种方式将RAG数据库接入Qdrant:

  • A) 预构建嵌入式索引(最快): 下载并解压indexes/*.tar.gz文件,使用QdrantClient(path=...)直接加载。
  • B) 完整Qdrant服务器: 使用server/目录下的docker-compose.ymlload_all.py脚本,将预构建索引流式加载到Qdrant服务器中。

重建脚本 (scripts/)

包含所有必需的重建脚本,按组件组织:

  • marine_rag/: CMEMS数据处理管道
  • deep_docs/: CDS/ADS/EWDS数据处理管道
  • eqc_qa/: EQC报告处理管道
  • pubs_rag/: L3出版物处理管道,包括链接构建
  • meta_harvest/: 所有四个存储库的上游元数据收割
  • 其他: publications/notebook_harvest/、测试套件和构建辅助脚本

数据关联

  • 论文↔数据集:通过注册表和旗舰引用图谱建立关联(约10,689条链接),存储于Qdrant有效负载和侧车文件中。
  • Notebooks通过matched_dataset_id与数据集卡片关联。
  • 数据集卡片包含n_linked_publicationshas_eqc_docs字段。

技术细节

  • 嵌入模型: gemini-embedding-2-preview,768维,L2归一化,检索类型为RETRIEVAL_DOCUMENT
  • 许可信息: 数据集本身为Copernicus许可。论文许可:9,813篇CC-BY/SA/PD,1,396篇CC-NC/ND,1,202篇无许可(原始文本已移除,文本块和向量保留)。该数据集被标记为私有数据集。
搜集汇总
数据集介绍
copernicus-rag-core 数据集图片
构建方式
该数据集基于哥白尼四大数据存储库(CMEMS海洋、CDS气候、ADS大气、EWDS早期预警)的原始文档,经过系统化处理构建而成。构建流程涵盖将原始PDF与图像之外的文档转换为Markdown格式,随后进行文本分块,并利用gemini-embedding-2-preview模型生成768维L2归一化嵌入向量。最终形成包含预构建Qdrant索引、元数据侧车文件及完整重建脚本的四层RAG核心数据库,其中L1层为发现层,包含1,418个文档卡片;L2分析层包含超过5.3万个文档点;L3方法层收录了1.2万余篇经解析的出版物。
使用方法
该数据集提供两种快速接入方式:嵌入式Qdrant模式最为便捷,用户可直接下载预构建索引并解压,通过Qdrant客户端以本地模式加载,无需额外计算资源即可执行混合检索查询。若需部署为服务,可使用server/目录下的完整部署工具包,通过Docker启动Qdrant服务器后运行加载脚本,实现所有集合的一对一导入。高级用户亦可参考REBUILD.md指南,利用scripts/下的完整重建流水线,从原始文档开始重新生成整个数据库或替换嵌入模型,实现完全定制化部署。
背景与挑战
背景概述
欧洲哥白尼计划是全球最大的地球观测与数据服务体系,涵盖海洋、气候、大气及应急预警四大核心领域。为打破这些异构数据源之间的信息孤岛,实现跨领域知识的统一检索与融合推理,dmpantiu团队于2024年构建了copernicus-rag-core数据集。该数据集以检索增强生成技术为内核,系统整合了哥白尼四大数据商店的官方文档、质量报告及逾万篇科学论文,并基于Gemini嵌入模型生成高维向量索引。其核心创新在于构建了三层检索架构,实现了从数据发现到深层分析再到学术方法引用的逐步聚焦,为地球科学领域的大模型知识增强提供了标准化基准。该数据集的发布显著降低了非欧空间机构利用哥白尼数据的门槛,推动了基于真实地球观测数据的智能问询与自动化决策研究。
当前挑战
该数据集应对的核心挑战在于消除多模态异构数据源之间的语义鸿沟与组织壁垒。哥白尼各数据商店的文档格式、术语体系及粒度差异极大,而CMEMS的海洋产品手册与CDS的气候标准文档在概念层级上并不直接对应,传统关键词检索难以实现跨领域精准关联。构建过程中遭遇的技术挑战包括对大量PDF格式的科学文献进行高质量Markdown转换,需借助MinerU-VLM等工具对复杂排版与公式进行结构化抽取;同时需处理超过4万篇论文的版权合规问题,通过OpenAlex与Unpaywall审核机制剔除了1202篇无许可证文本,仅保留向量表示以确保知识可用。此外,混合检索架构的工程实现需在同一向量空间中融合稠密嵌入与稀疏BM25索引,并在Qdrant中完成跨集合的论文-数据集关联链接,对数据管线的一致性与可复现性提出了极高要求。
常用场景
经典使用场景
在遥感对地观测与地球科学领域中,Copernicus RAG Core数据集是构建多源异构知识检索增强生成(RAG)系统的标杆性资源。其核心使用场景在于整合欧洲哥白尼计划四大数据仓库——海洋环境监测服务(CMEMS)、气候变化服务(CDS)、大气监测服务(ADS)及早期预警系统(EWDS)——的结构化与非结构化文档,形成包含数据集卡片、产品用户手册、算法理论基准文档及质量报告的多层级语料库。研究者可基于该数据集的L1发现层、L2分析层与L3方法层,实现从基础数据检索到复杂科学问题推理的端到端流程,尤其适用于需要跨存储库获取上下文信息的问答系统搭建与验证。
解决学术问题
该数据集有效解决了遥感领域长期存在的知识碎片化与跨模态语义鸿沟问题。在学术研究中,由于哥白尼各服务系统采用独立的数据模型与元数据标准,研究者难以在海量异构文档中高效定位关联信息。通过统一嵌入表示与预构建的Qdrant索引,数据集将离散的海洋、气候、大气及预警文档转化为768维密集向量与BM25稀疏向量的混合检索空间,使得跨数据域的知识关联成为可能。其预置的论文-数据集链接与旗舰论文引用图谱,显著提升了科学文献与观测数据的对齐精度,为验证RAG在环境科学中的可靠性提供了标准化测试基准。
实际应用
在实际业务场景中,该数据集直接支撑哥白尼RAG-MCP服务工具箱中12项工具的运行,广泛服务于环境监测、气候变化影响评估与灾害预警等任务。例如,海洋学家可快速检索CMEMS产品用户手册与质量信息文档,结合同源论文获取算法实现细节;气候变化研究者则能通过CDS与ADS的联合查询,分析大气成分与气候变量的时空关联。数据集的预构建嵌入式索引支持直接部署至Qdrant向量数据库,无需重新计算嵌入向量,使得生产级环境下的实时问答响应成为可能,尤其适用于政府决策支持与公共环境信息服务系统的快速搭建。
数据集最近研究
最新研究方向
当前,哥白尼计划(Copernicus)作为全球最大的地球观测数据源之一,其多模态、多尺度数据的高效检索与融合分析成为前沿焦点。该数据集开创性地构建了覆盖海洋(CMEMS)、气候(CDS)、大气(ADS)与早期预警(EWDS)四大核心存储的三层检索增强生成(RAG)管线,将技术栈从单纯的API查询跃升至语义理解与知识推理层面。其集成43万篇经语义链接的学术文献及海量产品文档,并通过混合密集-稀疏向量索引与预建Qdrant索引,实现了跨层级、跨语境的零延迟查询。这一范式在2026年7月验证中达成50/50的测试通过率,标志着地球观测领域知识基础设施从“数据可用”向“知识即服务”的关键跨越,为灾害响应、气候变化归因等紧迫议题提供了可复现的智能分析底座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务