遇见数据集

zero233344/UrbanVideo-Bench

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

UrbanVideo-Bench是一个基准测试数据集,旨在评估视频-语言模型(Video-LLMs)是否能像人类一样自然地处理连续的第一人称视觉观察,包括回忆、感知、推理和导航能力。数据集包含两个部分:超过5,000个多项选择题(MCQ)数据和超过1,000个视频片段。文本数据存储在MCQ.parquet文件中,包含问题ID、视频ID、问题类别、问题文本和答案等字段;视频数据存储在videos文件夹中。该数据集专注于城市空间中的具身智能任务,用于测试模型在现实场景中的视觉-语言理解性能。

--- 许可证:MIT协议 任务类别: - 视觉问答(Visual Question Answering) 语言: - 英语 标签: - 视频(Video) - 文本(Text) - 具身(Embodied) 数据规模类别: - 1000 < 样本量 < 10000 配置项: - 配置名称:基准测试集 数据文件:MCQ.parquet --- # 【ACL 2025 口头报告】UrbanVideo-Bench:面向城市空间视频数据的具身智能视觉语言模型评测基准 本仓库收录了该论文提出的数据集,共包含两个组成部分:5000余条多项选择题问答(Multiple-Choice Question Answering, MCQ)数据,以及1000余段视频片段。 - **预印本**:https://arxiv.org/pdf/2503.06157 - **项目主页**:https://embodiedcity.github.io/UrbanVideo-Bench/ - **代码仓库**:https://github.com/EmbodiedCity/UrbanVideo-Bench.code ## 数据集说明 本基准测试旨在评测视频大语言模型(Video-LLMs)能否像人类一样自然处理连续的第一人称视觉观测数据,以实现回忆、感知、推理与导航能力。 - **文本数据**:存储于`MCQ.parquet`文件中。 - **视频数据**:存储于`videos`文件夹内。 `MCQ.parquet`包含以下字段: | 字段名 | 描述 | |:----------------------|:-----------------------------------------| | `Question_id` | 每条多项选择题的全局唯一索引 | | `video_id` | 对应多项选择题的视频文件名 | | `question_category` | 该多项选择题所属的任务类别 | | `question` | 包含题干与所有选项的问题文本 | | `answer` | 该多项选择题的标准答案(Ground Truth) | 例如,本基准已针对17款主流视频大语言模型在该数据集上的性能开展评测。如需获取详细的评测结果与分析,请参阅原论文。 ![UrbanVideo-Bench 评测结果](evaluations.jpg) ## 引用格式 bibtex @misc{zhao2025urbanvideobench, title={UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces}, author={Baining Zhao and Jianjie Fang and Zichao Dai and Ziyou Wang and Jirong Zha and Weichen Zhang and Chen Gao and Yue Wang and Jinqiang Cui and Xinlei Chen and Yong Li}, year={2025}, eprint={2503.06157}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2503.06157}, }

提供机构:
zero233344
二维码
社区交流群
二维码
科研交流群
商业服务