遇见数据集

GeoChrono-Data

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

ChronoBench是一个用于高分辨率长时序遥感理解的综合性、多维度、多粒度基准测试数据集。它旨在解决现有方法局限于静态或双时相比较、未能充分利用连续长期景观变化轨迹的问题。该数据集将长期遥感理解分解为一个四层认知层次结构:地物感知、时序识别、长期记忆和时空推理,共包含12个子任务。数据集包含17,689个经过严格验证的问答对,这些数据源自美国39个主要城市500个不同区域的3,469张高分辨率图像。图像尺寸为1024×1024,时间跨度长,覆盖了丰富多样的土地覆盖动态变化。数据构建基于人类标注的像素级语义变化掩码,采用完全基于规则的自动化流程生成地面真值答案,并经过两阶段人工质量控制以确保可靠性。数据以JSON格式组织,每个条目包含图像序列路径、时间戳、问题文本、答案选项和地面真值等信息。需要注意的是,本仓库仅提供标注文件,底层图像需从DVL-Suite数据集下载并按指定目录结构放置后使用。ChronoBench专门用于模型评估,而配套的ChronoInstruct(包含1,534个图像序列和104,949个问答对)用于模型训练。该数据集适用于视觉问答、图像分类、变化检测、时空推理等任务,是评估和提升多模态大语言模型在长时序遥感理解方面能力的基准工具。

ChronoBench is a comprehensive, multi-dimensional, and multi-granularity benchmark dataset for high-resolution long-term remote sensing understanding. It aims to address the limitations of existing methods that are confined to static or bi-temporal comparisons and fail to fully utilize continuous long-term landscape change trajectories. The dataset decomposes long-term remote sensing understanding into a four-layer cognitive hierarchy: object perception, temporal recognition, long-term memory, and spatio-temporal reasoning, comprising a total of 12 subtasks. It contains 17,689 rigorously validated question-answer pairs derived from 3,469 high-resolution images across 500 different areas in 39 major U.S. cities. The images have a size of 1024×1024, span long time periods, and cover diverse land cover dynamics. Data construction is based on human-annotated pixel-level semantic change masks, employing a fully rule-based automated process to generate ground-truth answers, with two-stage manual quality control to ensure reliability. The data is organized in JSON format, with each entry including image sequence paths, timestamps, question text, answer options, and ground truth. Note that this repository only provides annotation files; the underlying images must be downloaded from the DVL-Suite dataset and placed in a specified directory structure for use. ChronoBench is specifically designed for model evaluation, while the companion dataset ChronoInstruct (containing 1,534 image sequences and 104,949 question-answer pairs) is used for model training. This dataset is suitable for tasks such as visual question answering, image classification, change detection, and spatio-temporal reasoning, serving as a benchmark tool for evaluating and enhancing the capabilities of multimodal large language models in long-term remote sensing understanding.

创建时间:
2026-07-15
原始信息汇总

数据集概述:ChronoBench & ChronoInstruct(GeoChrono-Data)

基本信息

  • 数据集名称:ChronoBench & ChronoInstruct
  • 许可证:Apache 2.0
  • 任务类别:视觉问答、图像分类
  • 语言:英语
  • 数据规模:100K < n < 1M
  • 标签:遥感、时间理解、多模态、基准测试、地球观测、变化检测、长期记忆、时空推理、多图像、VQA

数据集构成

ChronoBench(评估基准)

  • QA对数量:17,689个经过严格验证的问答对
  • 图像数量:3,469张高分辨率图像(1024×1024)
  • 空间覆盖:涵盖美国39个主要城市的500个不同区域
  • 用途:仅用于评估,不可用于训练

ChronoInstruct(指令微调数据集)

  • 图像序列数量:1,534个
  • QA对数量:104,949个
  • 答案格式:多选题、短文本、自由形式自然语言回答
  • 用途:用于模型训练

认知层级设计

数据集将长期遥感理解分解为四级认知层次:

层级 能力 核心问题
L0 土地覆盖感知 在给定时间点,这里有什么?
L1 时间识别 在指定时间点之间发生了什么变化?
L2 长期记忆 变化何时发生?完整的演变历史是什么?
L3 时空推理 通过跨地点和时间的比较可以推断出什么?

子任务分类

层级 子任务 缩写 QA数量 格式
L0 对象感知 OP 1,330 单选
L1 双时间类别级变化识别 BCC 1,314 多选
L1 双时间类别级面积变化识别 BCAC 3,914 单选
L1 长时间类别级变化识别 LCC 737 多选
L1 双时间对象级变化识别 BOC 3,630 多选
L2 对象出现记忆 OAM 2,206 单选
L2 对象变化记忆 OCM 1,510 单选
L2 对象历史记忆 OHM 880 有序序列
L3 对象建造顺序 OCO 966 单选
L3 跨序列对象建造顺序 CSOCO 410 单选
L3 区域发展比较 RDC 177 单选
L3 类别级变化幅度估计 CCME 615 单选

数据统计

  • QA对分布:L0(7.5%)、L1(54.2%)、L2(26.0%)、L3(12.3%)
  • 平均使用帧数:每个QA对平均使用7.26个时间帧
  • 问题格式分布:单选(62.9%)、多选(32.1%)、有序序列(5.0%)

数据格式

每个基准JSON文件包含问答条目列表,标准条目字段包括:

  • image_list:时间图像序列的相对路径
  • time_stamps:每帧的获取日期(YYYYMMDD格式)
  • prompts:问题文本
  • options_list / options_str:候选答案及其格式化字符串
  • ground_truth / ground_truth_option:真实答案文本和选项字母
  • task / cls_description / task_type:任务类别、子任务描述和问题格式

跨序列条目包含两组字段:image_list_1 / time_stamps_1image_list_2 / time_stamps_2

数据构建流程

  • 基于人工标注的语义变化掩码,采用完全基于规则的构建流程
  • 经过两阶段人工质量控制流程
  • ChronoInstruct的自由形式自然语言回答由Gemini-3-Flash生成,同样经过两阶段质量控制

图像准备说明

本仓库仅托管QA注释JSON文件,底层图像属于DVL-Suite,需单独下载并放置到相应目录。

性能结果

方法 LCP TR LTM STR OA
人类专家 97.04 89.78 91.73 95.56 92.28
Gemini-3-Flash 65.51 61.38 47.52 59.89 57.48
GPT-5.4 43.53 67.57 39.21 50.42 56.29
Qwen3-VL-32B 43.76 57.88 24.06 47.23 46.73
GeoChrono 88.65 83.03 68.10 72.92 78.34

人类专家平均总体准确率达92.28%,而最佳商业模型Gemini-3-Flash仅达57.48%。GeoChrono模型总体准确率达78.34%,超越领先商业模型超过20个百分点。

搜集汇总
数据集介绍
GeoChrono-Data 数据集图片
构建方式
GeoChrono-Data数据集由ChronoBench与ChronoInstruct两大部分构成,其构建依托于DynamicVL团队提供的人工标注语义变化掩码,采用完全基于规则的自动化流水线。针对每个子任务,确定性规则程序遍历语义掩码以提取真实答案,并搭配五种风格多样的提示模板,同时将选项顺序完全随机化以消除位置偏差。生成的问答对需经历两阶段人工质量控制:多名独立标注员首先对照原始影像与语义掩码逐条审核,再由领域专家裁决策略性抽样的争议样本。ChronoInstruct中的自由形式自然语言回答则由Gemini-3-Flash基于提取的真实信息生成,并同样经过两阶段人工质控流程。
使用方法
该数据集面向评估与训练两个场景,使用前需先从DVL-Suite仓库下载对应影像文件,并将其按预设目录结构放置于ChronoBench与ChronoInstruct的images文件夹下,随后设定CHRONOBENCH_DATA_ROOT环境变量指向评估子集根目录。用户可通过读取各子任务对应的JSON文件获取问答样本,每条样本包含图像列表、时间戳、问题文本及选项,支持单张图像与跨序列两种格式。在推理时,将图像与对应年份标签交错输入,后接问题与选项即可。完整的评估代码、模型封装及多选、单选与有序序列任务的指标计算均在官方GitHub仓库中提供,便于研究者复现基准测试或微调自己的模型。
背景与挑战
背景概述
GeoChrono-Data 数据集由北京邮电大学等机构的研究人员于2026年创建,核心研究问题聚焦于遥感领域中的长时间序列理解能力,旨在突破现有模型仅能处理静态快照或双时相变化的局限。该数据集通过构建包含17,689个严格验证的问答对和1,534个图像序列的多模态基准,系统评估了多模态大语言模型在土地覆盖感知、时间识别、长期记忆和时空推理四个认知层次上的表现,其研究成果被ACM MM 2026收录,对推动遥感智能从瞬时感知向连续轨迹理解转型具有里程碑意义。
当前挑战
数据集所解决的领域挑战在于现有遥感解释方法忽略了景观演变的连续长时动态,无法支撑对复杂时空过程的深度推理,而构建过程中面临的挑战包括:需从覆盖39个美国主要城市、500个不同区域的3,469张高分辨率影像中提取精准语义变化掩膜,并设计四层次12个子任务的认知递进框架,同时通过纯规则化生成和两阶段人工质控确保问答对的可靠性,最终实现人类专家准确率92.28%但最佳商业模型仅57.48%的显著鸿沟,凸显了长期记忆维度机器认知的薄弱性。
常用场景
经典使用场景
GeoChrono-Data在遥感智能解译领域开辟了长时序理解的经典研究范式,尤其适用于评估和提升多模态大语言模型在长时间跨度下的场景认知能力。研究者通常利用其四级认知层次框架——涵盖土地覆盖感知、时间识别、长期记忆与时空推理——对模型进行全方位的诊断性测试。该数据集提供的17,689个经过严格人工校验的问答对,结合高分辨率时序影像序列,成为检验模型是否具备超越静态分类或双时相变化检测能力的黄金标准。其在模型推理时所需的跨帧图像与时间标签交错输入格式,亦为多图像时序理解任务树立了标准化评估流程。
解决学术问题
该数据集直面现有遥感视觉模型仅能处理静态快照或双时相比较的致命局限,系统性揭示了多模态大模型在长时序演化轨迹理解中的根本性短板。其核心学术贡献在于将长时间跨度下的土地覆盖变迁分解为可量化的认知层级,精准定位了当前顶尖模型(包括Gemini-3-Flash与GPT-5.4)在长期记忆维度上较人类专家存在高达44个百分点差距的关键瓶颈。通过构建从简单对象感知到复杂跨场景发展比较的12项子任务,该数据集首次为时空推理能力提供了严谨的评测基准,促使学界正视并致力于解决时序连续性理解这一亟需突破的挑战。
实际应用
在实际应用中,GeoChrono-Data驱动的模型可服务于城市动态监测与规划决策支持系统,通过解析长时序遥感影像自动识别建筑扩张模式、植被覆盖演变轨迹及土地利用类型的完整变迁历史。基于该数据集训练的时序理解能力能够赋能智能农业管理,例如精准追踪农田轮作周期与作物生长阶段变化,辅助制定科学的灌溉与施肥计划。此外,其时空推理特性使其在自然灾害评估中发挥关键作用,能够自动比对受灾区域的重建进度与发展态势,为灾后恢复提供客观动态的时空信息图谱,显著提升遥感信息服务的深度与精度。
数据集最近研究
最新研究方向
GeoChrono-Data聚焦于遥感领域长期时序理解的前沿挑战,通过构建多层级认知基准ChronoBench与大规模指令微调数据集ChronoInstruct,系统评估多模态大语言模型在土地覆盖感知、时序识别、长期记忆与时空推理四个维度的能力。当前研究热点集中在揭示现有模型在长期记忆维度的显著缺陷(人类专家准确率91.73% vs 最优模型47.52%),并推动时序感知编码器与高效压缩机制的研发,GeoChrono模型已实现超20%的性能提升。该研究呼应了地球观测中动态变化监测与智慧城市建设的迫切需求,为遥感智能系统从静态快照向连续演化轨迹理解转型奠定了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务