登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MORE-MLLM
MORE-MLLM
收藏
kaggle
2025-04-29 更新
2025-06-07 收录
多模态关系抽取
跨模态理解
数据链接:
https://www.kaggle.com/datasets/marquis03/more-mllm
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A Multimodal Relation Extraction Dataset for MLLM
多模态关系抽取数据集,适用于大语言模型(MLLM)
应用场景:
创建时间:
2025-04-23
相关数据集
LVOmniBench
跨模态理解
长视频分析
LVOmniBench是由浙江大学、西湖大学等机构联合创建的首个专注于长音频-视频跨模态理解的基准数据集。该数据集包含275个高质量长视频,时长介于10至90分钟,总时长140小时,覆盖娱乐、生活方式等五大领域,并严格筛选动态视听内容。通过人工标注构建了1,014个需跨模态推理的多选题,涵盖感知、理解、推理和逻辑四个认知维度。该数据集旨在解决现有评估对长视频(如影视、纪录片)理解不足的问题,推动全
arXiv
2026-03-20 更新
72
0
neulab/PangeaBench-xmmmu
多语言视觉问答
跨模态理解
--- language: - ar - fr - hi - id - ja - pt - en license: mit size_categories: - 1K<n<10K task_categories: - visual-question-answering - question-answering - multiple-choice pretty_name: xmmmu dataset
Hugging Face
2024-11-03 更新
22
0
TextVR
视频检索
跨模态理解
TextVR是一个大规模跨模态视频检索数据集,包含42.2k句子查询和10.5k视频,覆盖8个场景领域。数据集要求模型同时理解视觉和文本语义,以进行视频检索。TextVR的创建涉及从YouTube和现有数据集收集视频,并通过专业团队进行标注。该数据集主要用于解决视频与语言领域的检索问题,特别是在需要文本阅读理解能力的场景中。
arXiv
2023-05-05 更新
14
0
LVOmniBench
跨模态理解
长视频处理
LVOmniBench是一个专门为长格式音频和视频的跨模态理解设计的新基准。我们策划了一系列多样化的长视频,时长从10到90分钟不等,平均时长为2,069秒。这一时长比现有的音频-视觉理解基准的时长大六倍以上。我们手动构建了1,014个高质量的多选题,这些问题明确设计为需要跨音频和视觉模态的联合推理,从而促进对OmniLLMs的更全面评估。每个QA按难度级别排名,长音频-视频理解对当前专有和开源模
github
2026-03-20 更新
38
0
Multimodal-Fatima/VQAv2_sample_validation
视觉问答
跨模态理解
--- dataset_info: features: - name: question_type dtype: string - name: multiple_choice_answer dtype: string - name: answers sequence: string - name: answers_original list:
Hugging Face
2023-06-09 更新
21
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广