BioVITATrain
收藏资源简介:
BioVITATrain是由大阪大学等机构构建的多模态生物数据集,涵盖视觉-文本-声学三模态对齐研究。该数据集包含130万音频片段(平均时长24.6秒)和230万图像,覆盖14,133个物种并标注34种生态特征,数据来源于iNaturalist、Xeno-Canto等开放平台。通过三阶段构建流程(音频筛选、细粒度标注、视觉数据整合)确保多模态一致性,并采用GPT-5辅助生态特征标注。该数据集旨在推动跨模态物种识别研究,解决生物多样性监测中多感官信息融合的挑战,适用于计算机视觉、生态声学及跨模态检索等领域。
BioVITATrain is a multimodal biological dataset constructed by Osaka University and other institutions, focusing on visual-text-acoustic tri-modal alignment research. This dataset contains 1.3 million audio clips (with an average duration of 24.6 seconds) and 2.3 million images, covering 14,133 species and annotated with 34 ecological traits. The data is sourced from open platforms such as iNaturalist and Xeno-Canto. It adopts a three-stage construction pipeline including audio screening, fine-grained annotation, and visual data integration to ensure multimodal consistency, and leverages GPT-5 to assist with ecological trait annotation. This dataset aims to advance cross-modal species recognition research, address the challenges of multi-sensory information fusion in biodiversity monitoring, and is applicable to fields such as computer vision, eco-acoustics, and cross-modal retrieval.

- 1BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment大阪大学; 东京大学; 东京科学研究所; OMRON SINIC X · 2026年



