登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Image-audio pairs (3 of 3)
Image-audio pairs (3 of 3)
收藏
kaggle
2024-06-28 更新
2024-06-22 收录
跨模态学习
图像音频配对
数据链接:
https://www.kaggle.com/datasets/jorvan/image-audio-pairs-3-of-3
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
(Pairs of related 512x512 images & 1 s audios)
一组相关的512x512图像对及1秒长的音频文件
应用场景:
创建时间:
2024-06-19
相关数据集
LasHeR Dataset
目标检测
跨模态学习
LasHeR consists of 1224 visible and thermal infrared video pairs with more than 730K frame pairs in total. Each frame pair is spatially aligned and manually annotated with a bounding box, making the d
paperswithcode.com
146
0
ActionHub
动作识别
跨模态学习
ActionHub数据集是一个包含1211种常见人类动作和360万个视频描述的大规模数据集。该数据集通过使用动作名称在视频网站上进行搜索,自动收集视频描述,无需额外的人工标注,因此成本低且易于扩展。ActionHub旨在解决零样本动作识别中的跨模态多样性问题,通过提供丰富的动作视频描述来增强文本模态的语义多样性,从而帮助模型更好地理解视频中的人类动作。数据集的创建过程涉及从七个现有的视频动作数据集
arXiv
2024-01-22 更新
61
0
counting-visual7w-18
跨模态学习
视觉问答
用于探测视觉与语言模型跨模态能力的计数数据集,源自Seeing Past Words: Testing the Cross-Modal Capabilities of Pretrained V&L Models论文。数据集包含来自Visual7W的图像、原始问题、答案及干扰答案,并以声明格式组织。
github
2021-12-16 更新
20
0
UniDex-Dataset
机器人操作
跨模态学习
UniDex-Dataset是由清华大学与上海启智研究院联合构建的大规模机器人操作数据集,源自人类第一视角视频的跨模态转换。该数据集包含900万帧配对的图像-点云-动作数据,涵盖8种灵巧手平台(6-24自由度)的5万条轨迹,覆盖日常工具使用等多样化任务。通过人机协同的指尖轨迹重定向和视觉对齐技术,将人类视频转化为机器人可执行轨迹,显著缩小了人机域差距。作为首个跨多形态灵巧手的预训练数据集,其核心价
arXiv
2026-03-24 更新
115
0
wchai/AuroraCap-trainset
视频描述
跨模态学习
AuroraCap Trainset是一个用于视频详细描述任务的数据集,包含超过2000万高质量的图像/视频-文本对。数据集的训练过程分为三个阶段:预训练阶段、视觉阶段和语言阶段。在预训练阶段,视觉特征与大型语言模型的词嵌入空间对齐;在视觉阶段,解冻预训练的视觉Transformer(ViT)并进行训练以获得更好的泛化能力;在语言阶段,进行端到端的训练,所有组件均可训练。数据集支持英语和中文,大小
Hugging Face
2024-10-13 更新
26
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广