官方服务:
资源简介:
About 64 languages' parallel translations
该数据集包含约64种语言的平行翻译语料
应用场景:
创建时间:
2018-05-22
相关数据集
Corpus of Everyday Japanese Conversation
Corpus of Everyday Japanese Conversation是一个基于200小时录音数据(大约从2016年4月至2020年)的词汇和词频表。该项目旨在开发一个大规模的、平衡的日本日常对话语料库。由于受访者自行记录日常情境中的对话,因此可以收集到自然发生的对话。为了构建语料库设计的实证基础,我们调查了约250名成年人的普通对话行为。
github2023-06-23 更新310
rinto/dgt-tm
DGT-Translation Memory数据集包含了欧盟立法文件(Acquis Communautaire)的24种官方语言的平行文本,主要用于机器翻译、文本分类、文本生成等NLP任务。数据集以TMX格式存储,并通过Java和Python工具进行提取和预处理。数据涵盖了从2007年到2012年的欧盟立法文件,并且每年都会更新。数据集的使用受到欧盟委员会的许可条件限制,用户需要遵守相关的知识产权
Hugging Face2024-11-30 更新140
dgskorpus_mvp_07 – Freie Konversation (MEINE DGS – annotiert. Öffentliches Korpus der Deutschen Gebärdensprache, 2. Release)
Ein annotiertes Video aus MEINEDGS: The Public DGS Corpus consists of more than 50 hours of video data from the DGS-Korpus project made available together with annotations for research purposes. In th
DataCite Commons2020-09-14 更新90
qmeeus/vp-er-14l
--- dataset_info: - config_name: multilang features: - name: audio_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: text dtype: string - na
Hugging Face2024-02-14 更新220
SAW3-041 - Highlands Pidgin Part 1
Highlands Pidgin Course, Part 1. Stephen Wurm material for a course in Highlands Pidgin. Wurm is the speaker in these course recordings. Elicitation sessions in English and Highland Pidgin. Recorded i
Research Data Australia110



