遇见数据集

Prompting-MammAlps

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

MammAlps-S2是一个在瑞士国家公园采集的野生动物监测相机陷阱视频数据集,涵盖2023年和2024年两个夏季野外季节。该数据集包含2,865个视频片段(1920×1080分辨率MP4格式,总时长约18.4小时,未压缩大小约75GB),记录了7种阿尔卑斯哺乳动物物种(包括马鹿、狍、赤狐、狼、雪兔、岩羚羊和貂)的活动。每个视频片段均标注了逐帧边界框、持久性动物轨迹、物种标签、行为动作/活动标签以及人口统计属性(鹿种的年龄和成年鹿的性别)。数据集分为训练集(2,090个视频)和测试集(775个视频),采用随机划分采集日的方式保持标签分布平衡。基于这些密集标注,研究者构建了Prompting-MammAlps文本到视频检索基准,包含135个自然语言查询,每个查询与完全满足查询内容的训练/测试视频子集相关联。查询按生态相关性(稀有事件、求偶相关、社交互动、相机反应、常见事件)和检索复杂性(单属性、多属性、多个体、复杂推理、视频比较)进行分类。数据集适用于物种识别、行为识别与分割、遮挡下的多动物跟踪、时空动作定位和文本到视频检索等研究任务。数据采集使用Browning Spec Ops Elite HP5相机陷阱,部署在瑞士国家公园内的三个站点,共15个独特相机视角。注释过程包括物种视觉鉴定和行为标注,行为标注方案基于已发表的蹄类动物行为谱,最终形成23个动作和12个活动的词汇表。数据集采用CC BY-NC 4.0许可证(非商业用途),仅包含英语内容。

MammAlps-S2 is a wildlife monitoring camera trap video dataset collected in the Swiss National Park, covering two summer field seasons in 2023 and 2024. The dataset contains 2,865 video clips (MP4 format with 1920×1080 resolution, total duration approximately 18.4 hours, uncompressed size about 75GB), capturing activities of 7 Alpine mammal species (including red deer, roe deer, red fox, wolf, mountain hare, chamois, and pine marten). Each video clip is annotated with per-frame bounding boxes, persistent animal trajectories, species labels, behavior action/activity labels, and demographic attributes (age for deer species and sex for adult deer). The dataset is split into a training set (2,090 videos) and a test set (775 videos), with random partitioning of collection days to maintain balanced label distributions. Based on these dense annotations, researchers constructed the Prompting-MammAlps text-to-video retrieval benchmark, comprising 135 natural language queries, each associated with a subset of training/test videos that fully satisfy the query content. Queries are categorized by ecological relevance (rare events, courtship-related, social interactions, camera reactions, common events) and retrieval complexity (single attribute, multiple attributes, multiple individuals, complex reasoning, video comparison). The dataset is suitable for research tasks such as species identification, behavior recognition and segmentation, multi-animal tracking under occlusion, spatio-temporal action localization, and text-to-video retrieval. Data collection used Browning Spec Ops Elite HP5 camera traps, deployed at three sites within the Swiss National Park, totaling 15 unique camera perspectives. The annotation process includes species visual identification and behavior labeling, with a behavior labeling scheme based on published ungulate ethograms, resulting in a vocabulary of 23 actions and 12 activities. The dataset is licensed under CC BY-NC 4.0 (non-commercial use) and contains only English content.

创建时间:
2026-06-29
原始信息汇总

数据集概述

基本信息

  • 数据集名称: MammAlps-S2 & Prompting-MammAlps
  • 许可证: CC BY-NC 4.0(非商业用途)
  • 语言: 英文
  • 任务类别: 视频分类、其他(物种识别、行为识别与分割、多动物遮挡跟踪、时空动作定位、文本到视频检索)
  • 数据集大小: 1K < n < 10K
  • 注释创建者: 专家生成
  • 语言创建者: 专家生成
  • 多语言性: 单语(英文)

数据集描述

MammAlps-S2是一个相机陷阱视频数据集,用于监测瑞士国家公园的野生动物,覆盖2023年和2024年两个夏季野外季节。包含7种高山哺乳动物的视频片段,带有每帧边界框、个体轨迹、行为标签和帧级属性(鹿科动物的年龄和成年鹿的性别)。它扩展了原始的MammAlps数据集,新增了一个季节的数据、精细化标签和额外属性。

基于这些密集注释,构建了一个文本到视频检索(TVR)基准——Prompting-MammAlps。135个自然语言查询,每个查询关联到内容完全满足该查询的部分训练/测试视频。

数据集结构

项目 数值
数据模态 视频片段(MP4, 1920×1080)、文本查询
注释类型 动物轨迹 + 帧级属性
总视频数 2,865
训练/测试划分 2,090 / 775 个视频
总时长 18.4 小时
视频时长 最短 1.2 秒 — 平均 23.1 秒 — 最长 120.8 秒
数据集大小(未压缩) ~75 GB
物种数 7
动作数 23
活动数 12
天气类别数 4
TVR查询数 135
每个查询的视频数(训练) 最少 0 — 平均 57.8 — 最多 1,110
每个查询的视频数(测试) 最少 0 — 平均 20.8 — 最多 373
记录时间 2023年8月–10月 和 2024年6月–8月
注释格式 JSON(每个视频)、CSV元数据索引

数据字段

每个注释JSON文件包含两个顶层键:infoframes

info — 视频级元数据:

  • file_id: 字符串,唯一视频标识符
  • site_id: 字符串,站点标识符(S1、S2 或 S3)
  • cam_id: 字符串,相机标识符(如 C1)
  • width: 整数,帧宽(1920)
  • height: 整数,帧高(1080)
  • attributes.weather: 字符串,视频级天气标签(sunnyclearovercastrainy

frames — 每帧对象列表:

  • frame_id: 整数,零基帧索引
  • detections: 列表,该帧检测对象列表(可能为空)

每个检测对象包含:

  • track_id: 整数,视频内跨帧的持久动物身份
  • segment_id: 整数,轨迹片段标识符
  • bbox: 列表[整数],边界框 [x_min, y_min, x_max, y_max](像素)
  • attributes.Species: 字符串,物种标签
  • attributes.Action: 字符串,主要动作标签
  • attributes.Action2: 字符串,次要动作标签或 "none"
  • attributes.Activity: 字符串,活动标签
  • attributes.Deer_age: 字符串,adult / juvenile(仅鹿科动物)
  • attributes.Deer_adult_sex: 字符串,male / female(仅成年鹿)

数据划分

  • 训练集: 2,090 个视频
  • 测试集: 775 个视频

划分方式:按采集日期随机划分,同时保持各集合标签分布相似。

TVR基准 — Prompting-MammAlps

135个自然语言查询,沿两个独立轴分类:

生态相关性ECOLOGY):

类别 描述
RARE 具有生态意义的稀有事件
COURTSHIP 求偶相关行为
SOCIAL 其他社交互动
CAMERA_REACTION 动物对相机陷阱的反应
COMMON 频繁基线事件

检索复杂度VISION):

类别 描述
SINGLE_ATTR 指定单一属性的查询
MULTI_ATTR 组合两个或更多属性的查询
MULTI_INDIV 需要同时涉及两个或更多个体信息的查询
COMPLEX 需要时序或关系推理的查询
VIDEO_COMPARISON 引用另一视频并要求相关内容的查询

视频仅在其包含至少一个完全满足查询所有元素的行为片段时才关联该查询;部分匹配被排除。

数据集创建

  • 策展方: 环境计算科学与地球观测实验室(EPFL)和计算神经科学与AI的Mathis Group(EPFL)
  • 资助方: EPFL SV-ENAC I-PhD项目;瑞士SNF基金 320030-227871
  • 共享方: ECEO, EPFL
  • 源数据: 使用Browning Spec Ops Elite HP5相机陷阱在瑞士国家公园三个站点录制
  • 物种: 红鹿、狍、赤狐、狼、山兔、岩羚羊、貂
  • 行为注释方案: 源自两个已发表的有蹄类动物行为谱,最终词汇表包含23个动作和12个活动
  • 注释者: Valentin Gabeff(野生动物行为与生态学领域专家)、Jennifer Shan
  • TVR查询定义: Valentin Gabeff 与 Blair Costelloe 合作

偏差、风险与局限性

  • 视频经过裁剪(使用MegaDetector检测),可能引入假阴/假阳性
  • 不同年份采集时期不同,模型可能无法跨季节泛化
  • 相机陷阱偏向检测大型和中型脊椎动物
  • 所有视频来自瑞士国家公园内三个站点,泛化到其他栖息地无保证

引用

BibTeX引用信息尚未提供。有关原始MammAlps数据集的更多信息,请访问:MammAlps

版本记录

版本 日期 备注
v0 2026-06-30 初始发布

联系方式

  • Valentin Gabeff(数据集策展人)
  • Devis Tuia(项目负责人)
  • Alexander Mathis(项目负责人)

相关链接

搜集汇总
数据集介绍
Prompting-MammAlps 数据集图片
构建方式
Prompting-MammAlps 数据集源自瑞士国家公园内为期两个夏季的野外监测活动(2023年与2024年),通过部署 Browning Spec Ops Elite HP5 红外触发相机,在三处典型高山林地生境中共获取 2,865 段高清视频片段。原始素材经 MegaDetector 模型剔除误触发片段并裁剪有效动物出没区间,随后利用改进的 ByteTrack 算法生成逐帧检测框与个体轨迹,最后经由 CVAT 平台人工校正以去除身份切换、轨迹遗漏及残留误检。在此基础上,由野生动物行为学专家依据已有 ungulate ethogram 体系,为每帧标注物种、行为动作、活动类型以及鹿科个体的年龄与性别属性,从而构建起密集的逐帧语义标注体系。此外,研究团队还精心设计了 135 条自然语言查询,每条查询均与训练集或测试集中完全满足其语义条件的视频子集严格关联,形成文本-视频检索基准。
使用方法
数据集以标准化的目录结构组织,视频文件与 JSON 格式的逐帧标注文件分别存放于训练集与测试集子目录下,同时提供 CSV 元数据索引文件与完整的标签映射字典。使用者可通过 Hugging Face Hub 的 snapshot_download 接口一键下载完整数据集,亦可单独获取轻量级的标注文件与查询关联信息。建议利用元数据中提供的采样权重列 weighted_sampler 处理类别不均衡问题,并在模型评估时注意跨季节分布偏移的影响——例如 2023 年夏季因马鹿发情期导致更多该物种活动记录,而 2024 年则呈现更多狍求偶事件。对于文本-视频检索任务,需将查询文本与视频 ID 的关联文件加载为字典结构,通过视频 ID 拼接对应的站点与相机子目录路径以定位实际媒体文件,从而实现基于自然语言描述的精准视频检索与评估。
背景与挑战
背景概述
Prompting-MammAlps数据集由瑞士洛桑联邦理工学院(EPFL)的环境计算科学与地球观测实验室与计算神经科学与AI研究组于2025年联合创建,核心研究问题聚焦于基于自然语言查询的野生动物视频检索。该数据集构建于MammAlps-S2基础之上,后者收录了瑞士国家公园2023至2024年两个夏季的2865段相机陷阱视频,涵盖七种高山哺乳动物,并提供了逐帧边界框、个体轨迹、行为标签及年龄性别等细粒度注释。作为文本-视频检索基准,Prompting-MammAlps设计了135个生态学意义明确的自然语言查询,横跨罕见行为、求偶、社会互动、相机反应及常见事件五大类别,并依据检索复杂度分为单属性、多属性、多个体、时序推理及视频对比等维度,为野生动物智能监测与多模态信息检索研究提供了标准化的评估平台。
当前挑战
该数据集所应对的领域挑战在于解决复杂自然场景下野生动物视频的细粒度语义理解与跨模态检索问题,特别是稀有物种、特定行为组合及时序关系的精准描述与匹配。构建过程中面临的挑战包括:多相机视野下个体身份的持续追踪与遮挡处理,需结合MegaDetector与ByteTrack算法并辅以人工校正;行为注释体系需从现有130余种有蹄类动物行为谱中筛选并适配相机陷阱可观测行为,最终凝练为23种动作与12种活动;跨季节数据分布差异显著(如求偶期与育幼期物种丰度变化),模型泛化能力面临考验;过滤假阳性触发视频(101段空镜头)以模拟真实部署噪声,同时确保查询与视频的全满足匹配逻辑无歧义,共同构成了数据集构建的核心技术难点。
常用场景
经典使用场景
MammAlps-S2与Prompting-MammAlps数据集聚焦于高山野生动物监测,其经典使用场景集中在基于视频的物种识别、行为识别与分割、多目标跟踪以及时空动作定位。该数据集提供了来自瑞士国家公园三个地点、跨越两个夏季的2865段相机陷阱视频,并附有逐帧的边界框、个体轨迹、23种精细动作与12种复杂活动的行为标签,以及鹿科动物的年龄与性别属性。这些丰富的标注层次使得研究人员能够在真实野外条件下系统性地评估和提升计算机视觉模型在多物种、多行为场景下的识别与定位能力。此外,Prompting-MammAlps基准测试通过135条自然语言查询,将文本与视频内容关联,为文本到视频检索任务提供了贴合生态学需求的测试平台,推动了跨模态理解在生态监控领域的发展。
解决学术问题
该数据集的核心学术贡献在于解决了高山野生动物视频分析中标注数据稀缺且粒度不足的关键问题。传统相机陷阱数据集多局限于物种分类或简单行为计数,缺乏对个体交互、连续行为序列及跨季节动态的精细刻画。MammAlps-S2通过提供多季节、多视角的密集标注,使研究者能够深入探讨行为识别模型在不同生态阶段(如鹿科动物发情期与非繁殖期)的泛化能力,以及多目标跟踪算法在遮挡、光照变化下的鲁棒性。同时,Prompting-MammAlps基准测试填补了生态领域文本-视频检索研究的空白,推动了自然语言查询与复杂时空内容匹配之间的桥梁构建,为行为生态学中的假设验证和自动化数据筛选提供了量化评价范式。
实际应用
在应用层面,MammAlps-S2及Prompting-MammAlps旨在赋能野生动物保护与生态监测的自动化分析流程。保护区管理者可利用基于该数据集训练的模型自动识别入侵物种、检测珍稀行为(如求偶、哺育),并追踪个体活动范围与群体动态,从而替代昂贵且耗时的人工视频审查。结合文本检索能力,研究人员能够通过自然语言快速从海量监控视频中定位特定生态事件,例如“一只成年雄鹿在阴天鸣叫”或“两只幼崽追逐嬉戏”,显著提升数据挖掘效率。此外,该数据集还可服务于环境教育中的多媒体展示,以及为智能相机陷阱系统的演进提供算法验证基础,推动非侵入式监测技术在偏远保护区的部署与应用。
数据集最近研究
最新研究方向
基于野生动物监测的密集标注视频数据集,Prompting-MammAlps 推动了文本-视频检索(TVR)在生态学中的应用,通过135条自然语言查询与多维度行为标签的关联,探索了复杂时空推理与多目标交互的检索能力。该基准不仅反映了真实野外监测中稀有事件、社会行为与摄像机反应等生态学前沿动向,还通过多属性、多个体与视频间比较等视觉复杂度分类,为跨模态学习在生物多样性保护与行为生态学中的落地提供了关键评估平台,其发布正值AI辅助生态监控亟需标准化测评体系的热点时期,对推动非侵入式野生动物智能分析具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务