遇见数据集

FutureOmni

收藏
魔搭社区2026-07-08 更新2026-07-15 收录
官方服务:

资源简介:

<div align="center"> <img src="logo0.png?raw=true" width="180" alt="FutureOmni Logo"> # FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs [![Paper](https://img.shields.io/badge/Paper-Arxiv-red)](https://arxiv.org/abs/2601.13836) [![GitHub](https://img.shields.io/badge/GitHub-Repository-black)](https://github.com/OpenMOSS/FutureOmni) </div> > **Predicting the future requires listening as well as seeing.** ## 📖 Dataset Summary Although Multimodal Large Language Models (MLLMs) demonstrate strong omni-modal perception, their ability to forecast future events from audio–visual cues remains largely unexplored, as existing benchmarks focus mainly on retrospective understanding. **FutureOmni** is the first benchmark designed to evaluate **omni-modal future forecasting** from audio–visual environments. To succeed, models must perform cross-modal causal and temporal reasoning while effectively leveraging internal knowledge to predict future events. The dataset consists of 1,034 high-quality multiple-choice QA pairs over 919 videos. ## 🚀 Quick Start ```python from datasets import load_dataset # Load the benchmark evaluation set dataset_test = load_dataset("OpenMOSS-Team/FutureOmni", split="test") print(dataset_test[0]) ```

提供机构:
maas
创建时间:
2026-01-15
二维码
社区交流群
二维码
科研交流群
商业服务