遇见数据集

ted_multi

收藏
OpenCSG2024-07-19 更新2026-01-19 收录
官方服务:

资源简介:

TEDMulti是一个大规模多语种数据集,源自TED演讲的文本记录,包含60种语言的平行语料。数据集的每个样本由演讲名称和多语种翻译文本构成,并已过滤缺失或不完整的翻译。该数据集包含训练集、验证集和测试集,可用于机器翻译等任务。

TEDMulti is a large-scale multilingual dataset derived from the textual transcripts of TED Talks. It contains parallel corpora across 60 languages, with each sample consisting of talk titles and multilingual translated texts. Missing or incomplete translations have been filtered out from the dataset. This dataset includes training, validation, and test splits, and can be used for tasks such as machine translation.

提供机构:
AIWizards
创建时间:
2024-07-19
搜集汇总
数据集介绍
ted_multi 数据集图片
背景与挑战
背景概述
TEDMulti是一个基于TED演讲的大规模多语种平行语料数据集,覆盖60种语言,每个样本包含演讲名称和翻译文本,并已过滤不完整翻译。该数据集包含训练、验证和测试分割,适用于机器翻译等自然语言处理任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务