culturalmoment-benchmark
收藏资源简介:
Cultural Moment Benchmark (CMB) 是一个用于评估视觉语言模型在东南亚视频中对文化时刻推理能力的基准数据集。该基准测试包含三个渐进阶段:第一阶段命名文化概念,第二阶段在视频中视觉识别该概念,第三阶段时间定位其子事件。每个概念在三种上下文模式(重置、携带、反馈)下进行评估。数据集覆盖东南亚七个国家(印度尼西亚、泰国、越南、菲律宾、马来西亚、新加坡、缅甸)的 306 个专家策划的文化概念,分为五个类别(如庆典、仪式等)。这些概念来自 624 个源视频,共包含 631 个时间定位对。当前提供样本数据(一个概念,Nyepi 印度尼西亚庆典),用于探索数据格式。完整版包含所有 306 个概念,正在准备中。该数据集仅提供标注信息,不包含源视频,但完整版将包含基准文件名到 YouTube 源的映射。数据文件包括 MCQ 问答条目(JSON 格式)、时间定位标注(CSV 格式)和文化概念变体(CSV 格式)。该基准适用于视觉问答、视频文本到文本、文化理解等任务。
Cultural Moment Benchmark (CMB) is a benchmark dataset for evaluating vision-language models on reasoning about cultural moments in Southeast Asian videos. The benchmark consists of three progressive stages: first naming the cultural concept, second visually identifying the concept in a video, and third temporally localizing its sub-events. Each concept is evaluated under three context modes (reset, carry, feedback). The dataset covers 306 expert-curated cultural concepts across seven Southeast Asian countries (Indonesia, Thailand, Vietnam, Philippines, Malaysia, Singapore, Myanmar), divided into five categories (e.g., celebrations, rituals). These concepts are derived from 624 source videos, containing a total of 631 temporal localization pairs. Currently, sample data (one concept, Nyepi Indonesian celebration) is provided for exploring data format. The full version containing all 306 concepts is under preparation. The dataset provides only annotation information, not source videos, but the full version will include mappings from benchmark filenames to YouTube sources. Data files include MCQ question-answer entries (JSON format), temporal localization annotations (CSV format), and cultural concept variants (CSV format). The benchmark is suitable for tasks such as visual question answering, video-text-to-text, and cultural understanding.
Cultural Moment Benchmark (CMB) 数据集详情
基本信息
- 数据集名称:Cultural Moment Benchmark (CMB)
- 许可证:CC-BY-NC-SA-4.0(知识共享-非商业性使用-相同方式共享 4.0)
- 语言:英语
- 数据规模:少于1K条样本
- 任务类型:视觉问答、视频到文本生成
- 标签:视频、基准测试、文化、文化理解、东南亚、时间定位、多项选择
数据集简介
CMB是一个用于评估视觉-语言模型在东南亚视频中推理文化时刻能力的基准数据集。每个文化概念通过三个阶段进行测试:概念命名、视频视觉识别、子事件时间定位,并支持三种上下文模式(Reset、Carry、Feedback)。
数据规模与来源
- 覆盖7个东南亚国家的306个专家精选文化概念
- 涵盖5个类别
- 来源于624个源视频
- 包含631个时间定位对
当前可用性
目前仅发布1个完整的端到端示例概念(印尼的Nyepi静居日庆典),完整306概念版本正在准备中。数据集仅提供标注数据,不包含源视频,完整的基准文件名与YouTube来源的映射将在后续版本中提供。
数据文件结构
- data/sample/celebration_mcq.json:示例概念的阶段1和阶段2多项选择题条目
- data/sample/mcq_list.jsonl:用于数据集查看器的扁平化多项选择题条目
- data/sample/vmr_videos.csv:阶段3时间定位数据,每行包含视频文件名、子事件问题、开始和结束时间
- data/sample/cultural_concepts.csv:文化概念的命名变体(通用/官方名称,拉丁/本地文字)
注意事项:当前样本仅用于探索数据格式,样本结果不能用于与完整基准的对比评估。
相关资源
- 论文(EMNLP 2026):https://arxiv.org/abs/2608.23065
- 项目页面与排行榜:https://culturalmoment-benchmark.github.io/
- 相关图像基准(Seeing Culture Benchmark):https://huggingface.co/datasets/Multimedia-SMU/seeingculture-benchmark




