登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Cross-modal generalization performance of FocusGate-Net.
Cross-modal generalization performance of FocusGate-Net.
收藏
NIAID Data Ecosystem
2026-05-10 收录
多模态学习
模型泛化评估
数据链接:
https://figshare.com/articles/dataset/Cross-modal_generalization_performance_of_FocusGate-Net_/30213064
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Cross-modal generalization performance of FocusGate-Net.
应用场景:
创建时间:
2025-09-25
相关数据集
MMIS
多模态学习
设计分析
MMIS数据集由MSA大学创建,专注于多模态室内场景的视觉生成和识别。该数据集包含近160,000张图像,每张图像附有对应的文本描述和音频记录,涵盖多种室内风格和布局。数据集的创建过程包括图像收集、文本描述生成和语音注释,旨在支持图像生成、检索、标注和分类等多模态表示学习任务。MMIS数据集的应用领域广泛,特别是在室内设计图像的分析和生成方面,旨在通过多模态信息融合解决实际问题。
arXiv
2024-07-08 更新
235
0
xywang1/MMC
多模态学习
自然语言处理
MMC数据集是一个用于多模态图表理解的大规模数据集,支持多种任务和图表类型。数据集包括三个主要配置:MMC-Instruction、MMC-Benchmark和MMC-Alignment。MMC-Instruction是一个大规模的多模态图表指令数据集,用于训练;MMC-Benchmark是一个全面的人工标注基准,用于测试和评估图表推理能力;MMC-Alignment用于训练图表与文本的对齐任务。
Hugging Face
2024-07-10 更新
114
0
siglip-adaptive-size
多模态学习
零样本学习
# SigLIP (shape-optimized model) SigLIP model pre-trained on WebLi at resolution 384x384. It was introduced in the paper [Sigmoid Loss for Language Image Pre-Training](https://arxiv.org/abs/2303.15
魔搭社区
2026-08-18 更新
35
0
CookGen
烹饪视频生成
多模态学习
CookGen是一个专注于烹饪领域的大规模视频数据集,由约翰斯·霍普金斯大学和字节跳动Seed团队创建。该数据集包含约200,000个视频片段,每个片段平均时长为9.5秒,数据来源于YouCook2和HowTo100M。数据集经过严格的质量过滤和字幕匹配处理,确保每个视频片段都具有清晰的叙事流程和详细的字幕描述。CookGen旨在支持长叙事视频生成的研究,特别是在烹饪领域,通过提供结构化的视频数据
arXiv
2025-01-11 更新
139
0
MUGEN
多模态学习
强化学习
我们展示了使用开源平台游戏CoinRun收集的大规模视频-音频-文本数据集MUGEN。我们进行了大量修改,通过引入音频和启用新的交互来使游戏更加丰富。我们训练了具有不同目标的RL代理来导航游戏并与13个对象和角色进行交互。这使我们能够自动提取各种视频和相关音频的大量集合。我们采样375K个视频剪辑 (每个3.2s),并从人类注释器收集文本描述。每个视频都有其他注释,这些注释是从游戏引擎中自动提取的
OpenDataLab
2026-07-12 更新
55
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广