登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
HiEn- Parallel Speech Corpus
HiEn- Parallel Speech Corpus
收藏
kaggle
2026-04-27 更新
2026-05-09 收录
语音翻译
数据链接:
https://www.kaggle.com/datasets/imjamal/hien-parallel-speech-corpus
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Parallel Speech dataset for speech translation task
面向语音翻译任务的并行语音数据集
应用场景:
创建时间:
2026-04-27
相关数据集
CVSS
语音翻译
多语言处理
CVSS是一个大规模多语言到英语的语音到语音翻译数据集,涵盖了21种语言到英语的句子级并行语音到语音翻译对。CVSS源自Common Voice语音数据集和CoVoST 2语音到文本翻译数据集,使用两种最先进的TTS模型进行合成。数据集包括两种版本的语音翻译,CVSS-C和CVSS-T,分别提供单一标准发音和源语音转换的发音。此外,CVSS还提供与翻译语音发音匹配的标准化翻译文本,适用于模型训练和
github
2022-08-26 更新
256
0
Itbanque/ScreenTalk_JA2ZH-XS
语音翻译
日语-中文
ScreenTalk_JA2ZH-XS是一个包含日语语音和简体中文翻译文本对的数据集,适用于训练和评估语音翻译和多语种语音理解模型。该数据集由真实世界的日本电影和电视剧中的对话组成,包含大约10,000个样本,总时长约30小时。
Hugging Face
2025-05-23 更新
21
0
StreamUni
语音翻译
机器学习
# The training dataset for the paper '[StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model](https://arxiv.org/abs/2507.07803v1)' ## Model - https://hugging
魔搭社区
2026-04-28 更新
12
0
jhu-clsp/seamless-align-expressive
语音翻译
多语言处理
Seamless-Align-Expressive数据集是一个用于翻译和音频到音频任务的多语言数据集,支持德语、英语、西班牙语、法语、意大利语和中文。数据集基于Meta AI发布的表达性语音到语音(S2S)数据,包含5种语言对的数据,压缩后约为228GB。数据集未进行分割,且数据可能包含个人身份信息、敏感内容或互联网上公开的有毒内容。数据集的创建过程中使用了SONAR Expressive编码器来
Hugging Face
2024-02-22 更新
50
0
1rsh/translate-awadhi-hi-karya
语音翻译
语言数据
该数据集包含音频和句子两种特征,分为训练集和测试集。训练集包含2724个示例,占用138027956.75559068字节;测试集包含237个示例,占用12105741.108409321字节。总下载大小为144229744字节,数据集总大小为150133697.864字节。
Hugging Face
2024-02-09 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广