egms-qa-dataset
收藏资源简介:
EGMS-QA 是一个基于欧洲地面运动服务(EGMS)持久散射体位移时间序列的自然语言问答数据集。该数据集通过 Hugging Face 的 datasets 库加载,包含默认的训练、验证和测试划分,其中训练集有 554,000 条记录,验证集和测试集各有 68,200 条记录。每条记录包含自然语言问题、答案,以及相关的 tile ID、任务 ID、答案类型、措辞 ID 和可审计的规范目标元数据。数据来源于欧盟哥白尼土地监测服务(Copernicus Land Monitoring Service)的 EGMS 测量值,经过处理并组织成重叠的 7 公里研究图块,再结合 EGMS-QA 生成的标签和问题构建而成。该数据集适用于问答任务,特别是针对时间序列数据的自然语言理解与推理。注意:该数据集并非官方 EU、EEA、Copernicus 或 EGMS 产品,不用于建立因果关系、预测未来运动或替代专业 InSAR 和岩土工程评估。
EGMS-QA is a natural language question answering dataset based on the European Ground Motion Service (EGMS) persistent scatterer displacement time series. The dataset is loaded via the Hugging Face datasets library and includes default training, validation, and test splits, with 554,000 records in the training set and 68,200 records each in the validation and test sets. Each record contains a natural language question, answer, and associated metadata such as tile ID, task ID, answer type, wording ID, and auditable canonical target metadata. The data originates from EGMS measurements provided by the Copernicus Land Monitoring Service of the European Union, processed and organized into overlapping 7 km study tiles, combined with labels and questions generated by EGMS-QA. This dataset is suitable for question answering tasks, especially for natural language understanding and reasoning on time series data. Note: This dataset is not an official EU, EEA, Copernicus, or EGMS product and is not intended for establishing causal relationships, predicting future motion, or replacing professional InSAR and geotechnical assessments.
数据集概述
EGMS-QA 是一个针对欧洲地面运动服务(EGMS)永久散射体位移时间序列的自然语言问答数据集。它结合了可加载的问答数据集与复现编码器、任务构建和翻译器实验所需的工件。
内容与结构
数据集包含多个发布层级,涵盖问答数据、源瓦片、表征缓存、标签、参考表及元数据。默认配置仅读取问答数据,不会下载体积庞大的源瓦片存储。
data/qa/:默认的问答训练/验证/测试数据划分artifacts/source_tiles/:10,000 个模型可用的 EGMS 7 公里源瓦片artifacts/representations/:经校验的egms_tokens_10k.pt缓存artifacts/labels/:64 种依赖令牌任务的规范目标表artifacts/reference_tables/:任务族 A–X 的确定性参考值表metadata/:划分、规范化、任务目录、问答审计、来源、发布清单及哈希记录
数据规模与划分
问答数据规模为:训练集 554,000 条、验证集 68,200 条、测试集 68,200 条。每个记录包含可见的自然语言问题与答案,以及瓦片标识、任务标识、答案类型、措辞标识和可审计的规范目标元数据。
使用方式
问答加载:可通过 load_dataset("risenyard/egms-qa-dataset") 直接加载,测试集首个记录通过 dataset["test"][0] 查看。
完整实验复现:需克隆代码仓库并安装,再下载数据集并执行审计与安装命令,以链接瓦片、令牌、问答和任务输出路径。安装器不会复制瓦片存储,且拒绝覆盖已有路径。可通过 --verify-hashes 参数进行完整的字节级完整性校验,其中瓦片哈希与运行时路径索引在元数据的 Parquet 文件中。
源瓦片契约
NPZ 文件为处理后的源瓦片,每个瓦片包含:
coords [N,2]:EPSG:3035 坐标time_series [N,294]:以毫米为单位的模型就绪位移值pid [N]、bbox [4]:标识与边界信息- 高度、均方根误差、平均速度、加速度、季节性及其不确定性字段
编码器直接使用存储的 [0,294) 切片,该值与原始索引 [8,302) 位级相等。瓦片间存在重叠,一个散射体标识可能出现在多个瓦片中。固定瓦片划分为 8,000/1,000/1,000。
规范化契约
metadata/normalization.json 是复现编码器预训练的关键预处理状态,其统计参数仅基于 8,000 瓦片的训练集在存储窗口上拟合。该文件在编码器模型中亦有镜像副本,两处副本的 SHA256 哈希一致。
来源、条款与限制
数据集基于欧盟哥白尼土地监测服务信息生成,EGMS 测量数据被筛选、排列为重叠的研究瓦片,并与自定义标签和问题结合。这不是官方产品,QA 记录与派生标签采用 CC-BY-4.0 许可,哥白尼派生数据保留 CLMS 归因与修改条件。数据仅描述测量变形历史,不用于确定成因、预测未来运动、认证结构安全或替代专家 InSAR 与岩土工程评估。





