登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Image-audio pairs (1 of 3)
Image-audio pairs (1 of 3)
收藏
kaggle
2024-06-17 更新
2024-06-22 收录
跨模态学习
多媒体分析
数据链接:
https://www.kaggle.com/datasets/jorvan/image-audio-pairs-1-of-3
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
(Pairs of related 512x512 images & 1 s audios)
成对的相关512x512图像与1秒音频
应用场景:
创建时间:
2024-06-17
相关数据集
moondream-data
跨模态学习
地理空间标注
该数据集包含图像和文本指令数据,主要面向空间标注任务。数据结构包含以下字段:图像数据(image)、操作指令文本(instruction)、二维坐标点(point,含x/y坐标)、边界框坐标(bbox,含x/y最小最大值)、元素类型(element_type)、元素标签(element_label)、来源网站名称(site_name)、原始URL(url)以及视口信息(viewport)。数据集分
Hugging Face
2026-03-11 更新
22
0
Voxel51/NYC_Smells
嗅觉感知
跨模态学习
New York Smells是一个大规模多模态数据集,将视觉图像与电子鼻(e-nose)嗅觉信号配对,这些信号是在纽约市的各种环境中捕获的。该数据集支持嗅觉和视觉之间的跨模态学习,填补了机器感知研究中嗅觉感知的空白。数据集包含7,000个嗅觉-图像对,来自3,500个不同的对象,覆盖60个记录会话。数据集由哥伦比亚大学、康奈尔大学和Osmo Labs的研究团队收集。
Hugging Face
2025-12-18 更新
17
0
VGG-Sound
音视频对应
多媒体分析
Audio-Visual Correspondent Dataset
kaggle
2021-01-10 更新
14
0
global-optima-research/AVSpeech
音频-视觉处理
多媒体分析
包含31164个来自AVSpeech测试集的视频数据集,这些视频从YouTube上下载。
Hugging Face
2025-06-16 更新
22
0
MDED-68
多域事件检测
多媒体分析
这是一个用于多域事件检测任务的数据集,即MDED-68数据集。该数据集包含23,874张Flickr图像,10,678篇来自数百个在线新闻媒体的新闻文章,以及1,337个YouTube视频。
github
2021-08-19 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广