登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BAAI-IndustryInstruction
BAAI-IndustryInstruction
收藏
智源
2024-09-24 更新
2025-04-26 收录
行业术语翻译
多语言处理
数据链接:
https://data.baai.ac.cn/datadetail/IndustryInstruction
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
包含多个行业的中英文对照名称,通过使用多种生成模型和去重、过滤技术构建,确保了数据的质量和多样性
应用场景:
提供机构:
智源研究院
创建时间:
2024-09-24
相关数据集
jhu-clsp/seamless-align-expressive
语音翻译
多语言处理
Seamless-Align-Expressive数据集是一个用于翻译和音频到音频任务的多语言数据集,支持德语、英语、西班牙语、法语、意大利语和中文。数据集基于Meta AI发布的表达性语音到语音(S2S)数据,包含5种语言对的数据,压缩后约为228GB。数据集未进行分割,且数据可能包含个人身份信息、敏感内容或互联网上公开的有毒内容。数据集的创建过程中使用了SONAR Expressive编码器来
Hugging Face
2024-02-22 更新
50
0
WenWW/KD_multilingual_dataset
多语言处理
文本数据
该数据集包含多种语言的文本数据,每种语言的数据集都有不同的字节大小和样本数量。数据集的特征包括文本内容(text)和唯一标识符(id)。数据集涵盖了德语(de)、法语(fr)、西班牙语(es)、意大利语(it)、波兰语(pl)、罗马尼亚语(ro)、荷兰语(nl)、希腊语(el)、匈牙利语(hu)、葡萄牙语(pt)、捷克语(cs)、瑞典语(sv)、保加利亚语(bg)、丹麦语(da)、芬兰语(fi)、
Hugging Face
2024-12-04 更新
18
0
fleurs_yo_en
语音翻译
多语言处理
这是一个从Google FLEURS数据集中提取的Yoruba-to-English翻译数据集。数据集包含训练集、验证集和测试集中的音频记录,分别对应13小时48分钟32秒、44分钟32秒和45分钟27秒的音频数据。所有音频都以16kHz采样。数据集的特征包括音频、Yoruba语言的转录和相应的英语翻译。
Hugging Face
2024-12-10 更新
9
0
britllm/TransWebEdu
多语言处理
教育科技
TransWebEdu是一个预训练规模的多语言平行语料库,支持十种语言:阿拉伯语、威尔士语、德语、英语、西班牙语、法语、印度尼西亚语、意大利语、俄语和斯瓦希里语。它专门用于从零开始预训练TransWebLLM模型,聚焦于多语言网络教育内容。
Hugging Face
2025-04-22 更新
21
0
sproos/wikipedia-title-text-pairs
多语言处理
自然语言处理
--- dataset_info: - config_name: ab features: - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1644341 num_examples: 1576 download_si
Hugging Face
2024-01-03 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广