登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Multimodal Foreign Language Learning Dataset
Multimodal Foreign Language Learning Dataset
收藏
kaggle
2025-10-10 更新
2025-12-20 收录
多模态学习
VR教育应用
数据链接:
https://www.kaggle.com/datasets/programmer3/multimodal-foreign-language-learning-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Speech, Text, Image for VR Teaching
用于虚拟现实(Virtual Reality, VR)教学的语音、文本与图像
应用场景:
创建时间:
2025-10-10
相关数据集
MMIS
多模态学习
设计分析
MMIS数据集由MSA大学创建,专注于多模态室内场景的视觉生成和识别。该数据集包含近160,000张图像,每张图像附有对应的文本描述和音频记录,涵盖多种室内风格和布局。数据集的创建过程包括图像收集、文本描述生成和语音注释,旨在支持图像生成、检索、标注和分类等多模态表示学习任务。MMIS数据集的应用领域广泛,特别是在室内设计图像的分析和生成方面,旨在通过多模态信息融合解决实际问题。
arXiv
2024-07-08 更新
235
0
xywang1/MMC
多模态学习
自然语言处理
MMC数据集是一个用于多模态图表理解的大规模数据集,支持多种任务和图表类型。数据集包括三个主要配置:MMC-Instruction、MMC-Benchmark和MMC-Alignment。MMC-Instruction是一个大规模的多模态图表指令数据集,用于训练;MMC-Benchmark是一个全面的人工标注基准,用于测试和评估图表推理能力;MMC-Alignment用于训练图表与文本的对齐任务。
Hugging Face
2024-07-10 更新
114
0
LanguageBind/MoE-LLaVA
视觉语言模型
多模态学习
--- license: apache-2.0 --- <a href="https://arxiv.org
Hugging Face
2024-02-15 更新
28
0
CookGen
烹饪视频生成
多模态学习
CookGen是一个专注于烹饪领域的大规模视频数据集,由约翰斯·霍普金斯大学和字节跳动Seed团队创建。该数据集包含约200,000个视频片段,每个片段平均时长为9.5秒,数据来源于YouCook2和HowTo100M。数据集经过严格的质量过滤和字幕匹配处理,确保每个视频片段都具有清晰的叙事流程和详细的字幕描述。CookGen旨在支持长叙事视频生成的研究,特别是在烹饪领域,通过提供结构化的视频数据
arXiv
2025-01-11 更新
139
0
siglip-adaptive-size
多模态学习
零样本学习
# SigLIP (shape-optimized model) SigLIP model pre-trained on WebLi at resolution 384x384. It was introduced in the paper [Sigmoid Loss for Language Image Pre-Training](https://arxiv.org/abs/2303.15
魔搭社区
2026-08-18 更新
35
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广