登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
xxhe/g-retriever-scene-graphs
xxhe/g-retriever-scene-graphs
收藏
Hugging Face
2024-03-31 更新
2024-06-11 收录
场景图检索
跨模态理解
数据链接:
https://hf-mirror.com/datasets/xxhe/g-retriever-scene-graphs
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
许可证:Apache-2.0
应用场景:
提供机构:
xxhe
原始信息汇总
数据集概述
许可证信息
许可证类型
: Apache-2.0
相关数据集
LVOmniBench
跨模态理解
长视频分析
LVOmniBench是由浙江大学、西湖大学等机构联合创建的首个专注于长音频-视频跨模态理解的基准数据集。该数据集包含275个高质量长视频,时长介于10至90分钟,总时长140小时,覆盖娱乐、生活方式等五大领域,并严格筛选动态视听内容。通过人工标注构建了1,014个需跨模态推理的多选题,涵盖感知、理解、推理和逻辑四个认知维度。该数据集旨在解决现有评估对长视频(如影视、纪录片)理解不足的问题,推动全
arXiv
2026-03-20 更新
72
0
neulab/PangeaBench-xmmmu
多语言视觉问答
跨模态理解
--- language: - ar - fr - hi - id - ja - pt - en license: mit size_categories: - 1K<n<10K task_categories: - visual-question-answering - question-answering - multiple-choice pretty_name: xmmmu dataset
Hugging Face
2024-11-03 更新
22
0
HNC
图像-文本匹配
跨模态理解
HNC数据集是一个自动生成的硬负样本描述集,用于图像-文本匹配训练,旨在提升模型在视觉与语言领域中的细粒度跨模态理解能力。该数据集还包括一个手动创建的挑战性测试集,用于评估模型在细粒度跨模态不匹配任务上的表现。
Hugging Face
2024-07-03 更新
12
0
LVOmniBench
跨模态理解
长视频处理
LVOmniBench是一个专门为长格式音频和视频的跨模态理解设计的新基准。我们策划了一系列多样化的长视频,时长从10到90分钟不等,平均时长为2,069秒。这一时长比现有的音频-视觉理解基准的时长大六倍以上。我们手动构建了1,014个高质量的多选题,这些问题明确设计为需要跨音频和视觉模态的联合推理,从而促进对OmniLLMs的更全面评估。每个QA按难度级别排名,长音频-视频理解对当前专有和开源模
github
2026-03-20 更新
38
0
TextVR
视频检索
跨模态理解
TextVR是一个大规模跨模态视频检索数据集,包含42.2k句子查询和10.5k视频,覆盖8个场景领域。数据集要求模型同时理解视觉和文本语义,以进行视频检索。TextVR的创建涉及从YouTube和现有数据集收集视频,并通过专业团队进行标注。该数据集主要用于解决视频与语言领域的检索问题,特别是在需要文本阅读理解能力的场景中。
arXiv
2023-05-05 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广