遇见数据集

culturalmoment-benchmark

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

Cultural Moment Benchmark (CMB) 是一个用于评估视觉语言模型在东南亚视频中对文化时刻推理能力的基准数据集。该基准测试包含三个渐进阶段:第一阶段命名文化概念,第二阶段在视频中视觉识别该概念,第三阶段时间定位其子事件。每个概念在三种上下文模式(重置、携带、反馈)下进行评估。数据集覆盖东南亚七个国家(印度尼西亚、泰国、越南、菲律宾、马来西亚、新加坡、缅甸)的 306 个专家策划的文化概念,分为五个类别(如庆典、仪式等)。这些概念来自 624 个源视频,共包含 631 个时间定位对。当前提供样本数据(一个概念,Nyepi 印度尼西亚庆典),用于探索数据格式。完整版包含所有 306 个概念,正在准备中。该数据集仅提供标注信息,不包含源视频,但完整版将包含基准文件名到 YouTube 源的映射。数据文件包括 MCQ 问答条目(JSON 格式)、时间定位标注(CSV 格式)和文化概念变体(CSV 格式)。该基准适用于视觉问答、视频文本到文本、文化理解等任务。

Cultural Moment Benchmark (CMB) is a benchmark dataset for evaluating vision-language models on reasoning about cultural moments in Southeast Asian videos. The benchmark consists of three progressive stages: first naming the cultural concept, second visually identifying the concept in a video, and third temporally localizing its sub-events. Each concept is evaluated under three context modes (reset, carry, feedback). The dataset covers 306 expert-curated cultural concepts across seven Southeast Asian countries (Indonesia, Thailand, Vietnam, Philippines, Malaysia, Singapore, Myanmar), divided into five categories (e.g., celebrations, rituals). These concepts are derived from 624 source videos, containing a total of 631 temporal localization pairs. Currently, sample data (one concept, Nyepi Indonesian celebration) is provided for exploring data format. The full version containing all 306 concepts is under preparation. The dataset provides only annotation information, not source videos, but the full version will include mappings from benchmark filenames to YouTube sources. Data files include MCQ question-answer entries (JSON format), temporal localization annotations (CSV format), and cultural concept variants (CSV format). The benchmark is suitable for tasks such as visual question answering, video-text-to-text, and cultural understanding.

创建时间:
2026-08-25
原始信息汇总

Cultural Moment Benchmark (CMB) 数据集详情

基本信息

  • 数据集名称:Cultural Moment Benchmark (CMB)
  • 许可证:CC-BY-NC-SA-4.0(知识共享-非商业性使用-相同方式共享 4.0)
  • 语言:英语
  • 数据规模:少于1K条样本
  • 任务类型:视觉问答、视频到文本生成
  • 标签:视频、基准测试、文化、文化理解、东南亚、时间定位、多项选择

数据集简介

CMB是一个用于评估视觉-语言模型在东南亚视频中推理文化时刻能力的基准数据集。每个文化概念通过三个阶段进行测试:概念命名、视频视觉识别、子事件时间定位,并支持三种上下文模式(Reset、Carry、Feedback)。

数据规模与来源

  • 覆盖7个东南亚国家的306个专家精选文化概念
  • 涵盖5个类别
  • 来源于624个源视频
  • 包含631个时间定位对

当前可用性

目前仅发布1个完整的端到端示例概念(印尼的Nyepi静居日庆典),完整306概念版本正在准备中。数据集仅提供标注数据,不包含源视频,完整的基准文件名与YouTube来源的映射将在后续版本中提供。

数据文件结构

  • data/sample/celebration_mcq.json:示例概念的阶段1和阶段2多项选择题条目
  • data/sample/mcq_list.jsonl:用于数据集查看器的扁平化多项选择题条目
  • data/sample/vmr_videos.csv:阶段3时间定位数据,每行包含视频文件名、子事件问题、开始和结束时间
  • data/sample/cultural_concepts.csv:文化概念的命名变体(通用/官方名称,拉丁/本地文字)

注意事项:当前样本仅用于探索数据格式,样本结果不能用于与完整基准的对比评估。

相关资源

  • 论文(EMNLP 2026):https://arxiv.org/abs/2608.23065
  • 项目页面与排行榜:https://culturalmoment-benchmark.github.io/
  • 相关图像基准(Seeing Culture Benchmark):https://huggingface.co/datasets/Multimedia-SMU/seeingculture-benchmark
搜集汇总
数据集介绍
culturalmoment-benchmark 数据集图片
构建方式
立足于东南亚多元文化语境下视频理解评测的迫切需求,该基准由领域专家对七国五类文化概念进行系统梳理与标注,从六百余段源视频中提炼出三百零六个经过验证的文化概念,并配套构建了六百三十一对时序定位数据。标注工作遵循三阶段递进范式:概念命名、视频视觉识别与子事件时序定位,同时在重置、携带与反馈三种上下文模式下进行评测设计,最终以分层抽样方式公开部分样本,其余条目保留为隐藏测试集,以支撑后续共享任务的开展。
特点
该基准的显著特征在于其跨文化与多阶段评测能力。覆盖东南亚七国五类文化概念,依托六百二十四段源视频与六百三十一对时序定位数据,构建起从概念辨识到视觉识别再到时序定位的完整评测链条。三种上下文模式的设计使模型文化推理能力得到多维度考察,而分层抽样公开与隐藏测试集并行的发布策略,兼顾了样本可探索性与评测严谨性,所有条目均经过专家校验以确保标注质量。
使用方法
该基准仅提供标注数据,源视频以YouTube标识符引用而不随发布重新分发,使用者需依据映射关系自行获取视频资源。调用时通过Hugging Face数据集加载接口按配置名称分别载入选择题、时序定位与概念命名三类样本,其中选择题以概念自身为正确答案配合三个干扰项构成四选一问题,时序定位任务则要求模型依据子事件描述定位起始与结束时间。该基准仅限测试用途,不得用于模型训练,使用需遵循非商业研究许可协议。
背景与挑战
背景概述
视觉语言模型在跨文化视频理解中的能力评估长期受限于数据资源的匮乏,尤其缺乏对东南亚多元文化语境的系统性覆盖。Cultural Moment Benchmark(CMB)由新加坡管理大学Multimedia-SMU团队于2026年构建,相关论文发表于EMNLP 2026。该基准涵盖东南亚七国306个专家策展概念与624段源视频,通过命名、视觉识别与时间定位三阶段任务,评估模型对文化时刻的推理与定位能力,填补了视频文化理解评测的空白,对推动多模态文化感知研究具有重要影响力。
当前挑战
该基准所应对的核心领域难题在于视觉语言模型能否在视频中真正理解并定位具有文化特异性的时刻,而非仅依赖表面视觉线索或语言先验。构建过程中的挑战同样显著:文化概念需经专家跨七国策展与验证,时间定位标注需精确到秒级,源视频受版权限制不可再分发,且需设计重置、携带、反馈三种上下文模式以控制信息泄漏。此外,样本与隐藏测试集的划分策略也需兼顾公平性与可复现性。
常用场景
经典使用场景
在视觉-语言模型的文化理解评测领域,Cultural Moment Benchmark(CMB)以其对东南亚视频文化时刻的细粒度考察而独树一帜。该数据集最经典的使用场景在于三阶段递进式评估:要求模型首先命名文化概念,继而在视频中视觉识别该概念,最终对其子事件进行时间定位。每一阶段均在Reset、Carry、Feedback三种上下文模式下展开,以此系统检验模型从语义感知到时空锚定的文化推理链条。这一设计使得研究者能够精准刻画模型在跨文化视频理解中的认知层次与薄弱环节。
衍生相关工作
CMB的发布催生了一系列围绕文化视频推理的衍生研究。其姊妹项目Seeing Culture Benchmark(SCB)将评测从视频延伸至图像领域,形成跨模态的文化理解评估体系。基于CMB的共享任务计划于ACL 2027 workshop举办,预计将吸引大量针对文化时序定位与多选推理的模型改进工作。此外,该数据集的三阶段评估协议已被后续研究采纳为文化视觉推理的标准范式,推动了文化感知预训练与提示学习等方向的探索。
数据集最近研究
最新研究方向
视觉-语言模型在视频文化理解中的评测正从静态图像向时序动态推理纵深演进,Cultural Moment Benchmark 以其对东南亚七国306个专家策展概念的三阶段评测框架,回应了多模态领域长期缺乏文化敏感基准的困境。该数据集将文化认知拆解为概念命名、视觉识别与子事件时序定位三个递进层次,并引入Reset、Carry、Feedback三种上下文模式,系统考察模型在文化语境下的推理一致性与时序 grounding 能力。其分阶段发布策略与计划中的ACL 2027共享任务,预示着文化视频理解正走向标准化竞赛与可复现评测的新阶段,对推动非西方文化视角下的多模态研究具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务