canonical-dataset
收藏资源简介:
该数据集是一个平行语料数据集,名为 canonical-dataset。数据集包含英语(en)、德语(de)、意大利语(it)和俄语(ru)四种语言的对齐文本。数据仅提供测试集(test split),每个语言的数据文件分别存储在 data/en/test.jsonl、data/de/test.jsonl、data/it/test.jsonl 和 data/ru/test.jsonl 中。该数据集可用于多语言自然语言处理任务,如机器翻译、跨语言语义分析等。
This dataset is a parallel corpus dataset named canonical-dataset. It contains aligned texts in four languages: English (en), German (de), Italian (it), and Russian (ru). The data only provides a test split, with each languages data files stored in data/en/test.jsonl, data/de/test.jsonl, data/it/test.jsonl, and data/ru/test.jsonl respectively. This dataset can be used for multilingual natural language processing tasks such as machine translation and cross-lingual semantic analysis.
数据集名称为canonical-dataset,包含英语(en)、德语(de)、意大利语(it)和俄语(ru)四种语言的平行数据集。每个语言配置下仅包含一个测试集(test),数据文件存储路径分别为data/en/test.jsonl、data/de/test.jsonl、data/it/test.jsonl和data/ru/test.jsonl,数据格式为JSONL。该数据集适用于跨语言规则遵循任务,提供四种语言的平行测试数据,用于评估模型在多语言环境下的规则遵循能力。数据集详情页面地址为https://huggingface.co/datasets/crosslingual-rule-following/canonical-dataset。




