登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
InternVid-10M-FLT
InternVid-10M-FLT
收藏
OpenXLab
2026-04-18 收录
视频-文本表示学习
多模态理解
数据链接:
https://openxlab.org.cn/datasets/vd-foundation/InternVid-10M-FLT
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
InternVid是一个大规模的以视频为中心的多模态数据集,可用于学习强大且可迁移的视频-文本表示,用于多模态理解和生成。
应用场景:
提供机构:
vd-foundation
创建时间:
2023-12-13
相关数据集
MME-Unify
多模态理解
生成模型
MME-Unify是一个综合性的评估框架,旨在评估统一多模态理解和生成模型的能力。该数据集包含12个现有数据集中的任务,涵盖视觉问答、图像生成、视频理解等多种类型,共包含4104个样本。数据集的任务被分为多模态理解、多模态生成和统一任务三大类,以全面评估模型在不同模态下的理解和生成能力,以及它们如何相互增强。该数据集适用于评估统一多模态大语言模型在多模态理解和生成任务中的性能。
arXiv
2025-04-08 更新
84
0
MANBench/MANBench
多模态理解
问题回答
MANBench(多模态能力规范基准)是一个旨在评估人类和MLLMs(多模态语言模型)多模态能力的大型综合基准。该数据集包含9个任务,每个任务超过110个问题,共有1314个问题和2231张图片。MANBench的目标是提供一个公平和严格的评估框架,确保人类和机器性能的比较是在平等的基础上进行的。
Hugging Face
2025-02-11 更新
10
0
happy8825/MMLongBench_var6_deterministic
多模态理解
文档处理
### MMLongBench – 2025-12-14 20:07 UTC ``` Average accuracy: 48.79% (1072 samples with scores) Subset metrics by evidence source: Pure-text (Plain-text): sam
Hugging Face
2025-12-14 更新
9
0
MOMENTS (Multimodal Mental States)
心理理论
多模态理解
MOMENTS(多模态心理状态)是一个全面的基准测试,旨在通过现实、叙事丰富的场景来评估多模态大型语言模型(LLM)的ToM能力。数据集包括超过2344个多选题,涵盖了七个不同的ToM类别。基准测试具有长的视频上下文窗口和现实的社会互动,为深入了解角色的心理状态提供了更深入的见解。虽然视觉模态通常可以提高模型性能,但当前系统仍然难以有效地整合它,这突出了对AI在多模态理解人类行为方面的进一步研究的
arXiv
2025-07-06 更新
18
0
OVBench
对话系统
多模态理解
license: mit configs: - config_name: ovbench data_files: ovbench.json --- [repository](https://github.com/MCG-NJU/VideoChat-Online)  ![images](./assert/example.p
魔搭社区
2026-07-11 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广