登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
小语种图像解析数据
小语种图像解析数据
收藏
杭州数据交易所
2026-06-18 更新
2026-06-19 收录
多模态预训练
小语种图像理解
数据链接:
https://mall.hzdex.cn/data-exchange/111500400191494?from=/data-exchange
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
用于多模态大模型训练,提升语义理解、时序推理、视频生成、跨模态融合、时空特征提取等能力。
应用场景:
提供机构:
数据堂(北京)科技股份有限公司
创建时间:
2025-12-30
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集包含德语、日语、俄语等14个小语种的图像解析数据,共计10万条,主要用于多模态大模型训练,旨在提升模型的语义理解、时序推理、视频生成及跨模态融合等能力。
以上内容由遇见数据集搜集并总结生成
相关数据集
高质量中文期刊论文数据集
自然语言处理
学术研究
“高质量中文期刊论文数据集”,可以用于中文大模型的训练。1)帮助中文大模型学习到更丰富的、更先进的人类专业性知识以及某些特定领域的专业术语,从而更好的解答用户提出的专业问题。2)训练中文大模型的论文生成能力,从而应对各种不同领域的研究论文需求。根据用户的论文书写要求(例如用户只需提供主题、要点等),大模型自动生成符合用户要求的内容专业、逻辑性强、语意连贯的高质量论文。
北京市数据知识产权
2024-05-08 更新
29
0
199小时澳大利亚英语语音数据_朗读(手机)
澳大利亚英语语音
朗读语音数据采集
澳大利亚英语语音数据_朗读(手机),基于给定的脚本朗读并录制,涵盖通用、交互、车载、家居等多类别,内容丰富。此数据集标注了文本内容等多种属性,由400余名来自不同地域和文化背景的澳大利亚人参与录制,口音正宗,文本经过人工校对,准确率高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和
国家数据集管理服务平台
2026-04-28 更新
6
0
新闻事件标注数据
新闻事件抽取
事件语义理解
用于训练BERT/RoBERTa、BiLSTM-CRF、事件触发词与元素分类器、ProxiModel、句子 - Transformer等。提升事件识别、实体抽取、关系与情感分析、多文档理解、关键词与摘要生成,增强对复杂句式、领域术语、长文本结构的鲁棒性。服务于新闻分析、舆情监控、智能检索、内容推荐、自动摘要、情报分析、内容合规与多语言传播等场景。
杭州数据交易所
2026-08-04 更新
4
0
CC12M (Conceptual 12M)
多模态预训练
图像字幕生成
概念12 M (CC12M),具有约1200万个图像文本对的数据集,旨在用于视觉和语言预训练。与概念字幕 (CC3M) 相比,它更大,涵盖了更多的视觉概念集,该概念集广泛用于图像字幕模型的预训练和端到端训练。
OpenXLab
8
0
201小时孟加拉语(印度)手机采集朗读语音数据
语音识别
孟加拉语音频
数据基于给定的脚本朗读并模拟录制,内容丰富。此数据集标注了文本内容等多种属性,由母语人参与采集,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循GDPR, CCPA, PIPL。
国家数据集管理服务平台
2026-04-28 更新
5
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广