遇见数据集

egms-qa-dataset

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

EGMS-QA 是一个基于欧洲地面运动服务(EGMS)持久散射体位移时间序列的自然语言问答数据集。该数据集通过 Hugging Face 的 datasets 库加载,包含默认的训练、验证和测试划分,其中训练集有 554,000 条记录,验证集和测试集各有 68,200 条记录。每条记录包含自然语言问题、答案,以及相关的 tile ID、任务 ID、答案类型、措辞 ID 和可审计的规范目标元数据。数据来源于欧盟哥白尼土地监测服务(Copernicus Land Monitoring Service)的 EGMS 测量值,经过处理并组织成重叠的 7 公里研究图块,再结合 EGMS-QA 生成的标签和问题构建而成。该数据集适用于问答任务,特别是针对时间序列数据的自然语言理解与推理。注意:该数据集并非官方 EU、EEA、Copernicus 或 EGMS 产品,不用于建立因果关系、预测未来运动或替代专业 InSAR 和岩土工程评估。

EGMS-QA is a natural language question answering dataset based on the European Ground Motion Service (EGMS) persistent scatterer displacement time series. The dataset is loaded via the Hugging Face datasets library and includes default training, validation, and test splits, with 554,000 records in the training set and 68,200 records each in the validation and test sets. Each record contains a natural language question, answer, and associated metadata such as tile ID, task ID, answer type, wording ID, and auditable canonical target metadata. The data originates from EGMS measurements provided by the Copernicus Land Monitoring Service of the European Union, processed and organized into overlapping 7 km study tiles, combined with labels and questions generated by EGMS-QA. This dataset is suitable for question answering tasks, especially for natural language understanding and reasoning on time series data. Note: This dataset is not an official EU, EEA, Copernicus, or EGMS product and is not intended for establishing causal relationships, predicting future motion, or replacing professional InSAR and geotechnical assessments.

创建时间:
2026-09-03
原始信息汇总

数据集概述

EGMS-QA 是一个针对欧洲地面运动服务(EGMS)永久散射体位移时间序列的自然语言问答数据集。它结合了可加载的问答数据集与复现编码器、任务构建和翻译器实验所需的工件。

内容与结构

数据集包含多个发布层级,涵盖问答数据、源瓦片、表征缓存、标签、参考表及元数据。默认配置仅读取问答数据,不会下载体积庞大的源瓦片存储。

  • data/qa/:默认的问答训练/验证/测试数据划分
  • artifacts/source_tiles/:10,000 个模型可用的 EGMS 7 公里源瓦片
  • artifacts/representations/:经校验的 egms_tokens_10k.pt 缓存
  • artifacts/labels/:64 种依赖令牌任务的规范目标表
  • artifacts/reference_tables/:任务族 A–X 的确定性参考值表
  • metadata/:划分、规范化、任务目录、问答审计、来源、发布清单及哈希记录

数据规模与划分

问答数据规模为:训练集 554,000 条、验证集 68,200 条、测试集 68,200 条。每个记录包含可见的自然语言问题与答案,以及瓦片标识、任务标识、答案类型、措辞标识和可审计的规范目标元数据。

使用方式

问答加载:可通过 load_dataset("risenyard/egms-qa-dataset") 直接加载,测试集首个记录通过 dataset["test"][0] 查看。

完整实验复现:需克隆代码仓库并安装,再下载数据集并执行审计与安装命令,以链接瓦片、令牌、问答和任务输出路径。安装器不会复制瓦片存储,且拒绝覆盖已有路径。可通过 --verify-hashes 参数进行完整的字节级完整性校验,其中瓦片哈希与运行时路径索引在元数据的 Parquet 文件中。

源瓦片契约

NPZ 文件为处理后的源瓦片,每个瓦片包含:

  • coords [N,2]:EPSG:3035 坐标
  • time_series [N,294]:以毫米为单位的模型就绪位移值
  • pid [N]bbox [4]:标识与边界信息
  • 高度、均方根误差、平均速度、加速度、季节性及其不确定性字段

编码器直接使用存储的 [0,294) 切片,该值与原始索引 [8,302) 位级相等。瓦片间存在重叠,一个散射体标识可能出现在多个瓦片中。固定瓦片划分为 8,000/1,000/1,000。

规范化契约

metadata/normalization.json 是复现编码器预训练的关键预处理状态,其统计参数仅基于 8,000 瓦片的训练集在存储窗口上拟合。该文件在编码器模型中亦有镜像副本,两处副本的 SHA256 哈希一致。

来源、条款与限制

数据集基于欧盟哥白尼土地监测服务信息生成,EGMS 测量数据被筛选、排列为重叠的研究瓦片,并与自定义标签和问题结合。这不是官方产品,QA 记录与派生标签采用 CC-BY-4.0 许可,哥白尼派生数据保留 CLMS 归因与修改条件。数据仅描述测量变形历史,不用于确定成因、预测未来运动、认证结构安全或替代专家 InSAR 与岩土工程评估。

搜集汇总
数据集介绍
egms-qa-dataset 数据集图片
构建方式
该数据集源自欧洲地面运动服务(EGMS)的永久散射体位移时间序列,通过精细的工程化流程构建而成。研究团队将官方EGMS测量数据裁剪为10,000个7公里重叠瓦片,每个瓦片包含坐标、294个时间步的位移值及多种物理参数。在任务构建阶段,开发了64种依赖令牌的任务体系,并生成确定性参考值表,最终形成了包含554,000个训练样本、68,200个验证与测试样本的自然语言问答对。每个记录均附带瓦片标识、任务类型、答案类型及可审计的规范目标元数据,确保数据的一致性与可追溯性。
特点
该数据集的核心特色在于其多层级释放架构与高度可复现性。默认配置仅加载轻量级的QA数据,而完整的实验支持通过版本化工件(包括源瓦片、令牌缓存及标签表)实现端到端复现。数据规范化参数仅在训练分割上拟合,并随编码器模型独立发布,保证了预处理状态的一致性。所有工件均通过SHA256校验和审计,支持字节级完整性验证。此外,数据集明确遵循CC-BY-4.0与CLMS数据政策,并详尽记录了数据来源与限制,提升了研究的可信度。
使用方法
使用者可通过Hugging Face的`datasets`库直接调用`risenyard/egms-qa-dataset`,获取划分好的训练、验证与测试集,每条记录包含自然语言问答及辅助元数据,便于进行下游问答任务微调或评估。对于需要完整实验复现的研究者,可通过命令行工具`hf download`获取完整发布包,执行`audit`与`install`命令以链接瓦片、令牌与输出目录,并可选`--verify-hashes`进行完整性校验。此外,编码器模型与翻译器模型均已独立发布,支持灵活集成至自定义工作流。
背景与挑战
背景概述
EGMS-QA数据集的诞生源于对欧洲地面运动服务(EGMS)中持续散射体位移时间序列的自然语言问答需求,是遥感与自然语言处理交叉领域的一项前沿成果。该数据集由risenyard团队于近年来创建,依托欧洲联盟哥白尼土地监测服务的地面运动数据,通过精心设计的10,000个7公里研究瓦片,构建了包含554,000条训练样本的大规模问答基准。其核心研究问题在于将复杂的InSAR时序信号转换为可解释的自然语言表达,从而突破传统遥感数据专业解读的瓶颈,为地理空间信息的智能语义检索开辟新路径,对推动时序遥感数据的可及性与跨学科应用具有里程碑意义。
当前挑战
该领域面临的首要挑战是将密集的持续性散射体位移信号转化为清晰、准确的语义问答,需克服InSAR数据中噪声、非视距变形及地理空间异质性带来的表述歧义,同时确保多时相分析的物理一致性。构建过程亦颇为艰巨,涉及海量瓦片数据的规范化处理与归一化拟合,需在严格保证训练、验证、测试分裂不泄露的前提下,设计64种任务,并解决瓦片重叠导致的样本去重难题。此外,数据清洗与标注质量审计、元数据完整性维护及其与Copernicus数据政策的合规性,均构成数据工程层面的显著障碍,最终在可复现性、精确性与实用性间求取平衡。
常用场景
经典使用场景
EGMS-QA数据集是遥感与自然语言处理交叉领域的创新性资源,它以欧洲地面运动服务(EGMS)提供的永久散射体位移时间序列为基础,构建了一个大规模、高质量的问答语料库。该数据集的核心使用场景在于训练和评估能够理解并回答关于地表形变复杂问题的智能模型,涵盖从位移趋势查询、异常事件识别到地理空间推理等多样化任务。研究者可利用其三段式划分(训练、验证、测试集)以及丰富的元数据,开展端到端的基于视觉与文本的问答研究,推动地球观测数据与自然语言交互的深度融合,为遥感信息的自动化解析与智能检索提供坚实支撑。
实际应用
在实际应用中,EGMS-QA数据集为多个领域提供了便捷的地表形变信息获取途径。城市规划部门可借助基于该数据集训练的问答系统,快速获取针对特定区域的地面沉降状况,辅助决策土地使用与基础设施建设。环境监测机构能够通过自然语言交互,高效查询长时间序列下的形变趋势,用于评估地热开采、地下水抽取等人类活动引发的地表影响。此外,保险公司和建筑工程公司可利用此技术,对潜在的不稳定区域进行初步风险筛查。该数据集还支持灾害应急响应,当发生地面塌陷或山体滑坡时,响应团队通过简单的询问即可获得相关区域的形变历史与当前状态,为现场救援和灾后评估提供及时、直观的参考数据,显著降低专业数据分析的准入门槛。
衍生相关工作
围绕EGMS-QA数据集,诞生了一系列影响深远的相关工作。首先,配套发布的预训练编码器(egms-qa-encoder)针对EGMS时间序列进行了专门的表示学习,成为后续众多地表形变分析模型的基础组件,其高效的令牌化与特征提取方法启发了类似遥感序列数据的处理范式。其次,任务翻译器(egms-qa-translator)的提出,搭建了原始观测数据与高层语义之间的桥梁,其将多任务学习与问答生成结合的理念,被扩展至其他地理空间问答任务中。数据集中详尽的规范化合约与可复现实验框架,也形成了标准化的基准,促使研究者在此之上提出新的模型结构、评估指标及数据增强策略,极大丰富了基于雷达干涉测量的自然语言处理研究方向,并促进了跨区域、跨传感器的形变问答研究的涌现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务