登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
高质量视频数据
高质量视频数据
收藏
杭州数据交易所
2026-04-13 更新
2026-06-18 收录
视频生成
视频理解
数据链接:
https://mall.hzdex.cn/data-exchange/111500400191476?from=/data-exchange
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
用于多模态大模型训练,提升语义理解、时序推理、视频生成、跨模态融合、时空特征提取等能力。
应用场景:
提供机构:
数据堂(北京)科技股份有限公司
创建时间:
2025-12-30
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集包含10万段高质量视频素材,内容覆盖人像、动物、访谈等场景,分辨率不低于1080p,存储总量达2-3PB。专为多模态大模型训练设计,可用于提升语义理解、时序推理、视频生成、跨模态融合及时空特征提取等核心能力。
以上内容由遇见数据集搜集并总结生成
相关数据集
VAST-27M
视频多模态
视频理解
VAST-27M是由中国科学院自动化研究所创建的大规模全模态视频字幕数据集,包含2700万个视频片段。每个视频片段都配有视觉、音频和字幕模态的字幕,这些字幕是通过训练单独的视觉和音频字幕生成器以及使用大型语言模型Vicuna-13b整合生成的。数据集的创建旨在推动多模态视频-文本预训练模型的研究,特别是在视觉-文本、音频-文本和全模态视频-文本任务中。VAST-27M数据集的应用领域广泛,包括视频
arXiv
2023-10-07 更新
425
0
STORYBENCH
视频生成
文本到视频
STORYBENCH是由谷歌研究院创建的一个多面性基准数据集,用于连续故事可视化任务。该数据集包含来自三个现有视频数据集的6000个视频,通过收集密集、丰富的标注,包括动作描述、时间戳和多模态基础,以及每个视频段的标签,以便于确定失败模式。STORYBENCH旨在可靠地评估即将推出的文本到视频模型,并包含三个难度递增的视频生成任务:动作执行、故事延续和故事生成。数据集的目标是鼓励未来在真实世界、文
arXiv
2023-10-13 更新
38
0
TIGER-Lab/GenAI-Bench
图像处理
视频生成
该数据集包含三个主要配置:图像编辑(image_edition)、图像生成(image_generation)和视频生成(video_generation)。图像编辑配置包括源提示、目标提示、指令提示、源图像、左右模型输出图像和投票类型等特征。图像生成配置包括提示、左右模型生成图像和投票类型等特征。视频生成配置包括提示、左右模型生成视频和投票类型等特征。每个配置都有训练集,分别包含919、1735
Hugging Face
2024-09-08 更新
27
0
VIDGEN-1M
视频生成
文本描述
VIDGEN-1M是由复旦大学和上海人工智能科学院联合创建的大型视频文本生成数据集,包含100万个高质量视频片段及其详细描述性合成字幕。该数据集通过多阶段精细筛选流程创建,确保了视频与字幕间的高时空一致性。数据集内容涵盖广泛,字幕平均长度为89.3字,能准确捕捉视频中的动态元素。VIDGEN-1M主要用于训练和评估文本到视频生成模型,旨在提高模型生成视频的质量和准确性。
arXiv
2024-08-06 更新
231
0
高质量中文期刊论文数据集
自然语言处理
学术研究
“高质量中文期刊论文数据集”,可以用于中文大模型的训练。1)帮助中文大模型学习到更丰富的、更先进的人类专业性知识以及某些特定领域的专业术语,从而更好的解答用户提出的专业问题。2)训练中文大模型的论文生成能力,从而应对各种不同领域的研究论文需求。根据用户的论文书写要求(例如用户只需提供主题、要点等),大模型自动生成符合用户要求的内容专业、逻辑性强、语意连贯的高质量论文。
北京市数据知识产权
2024-05-08 更新
29
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广