遇见数据集

Soikat/opus_books

收藏
Hugging Face2026-05-19 更新2026-05-31 收录
官方服务:

资源简介:

OpusBooks是一个多语言平行语料库,专门用于机器翻译任务。该数据集涵盖多种语言对,包括加泰罗尼亚语、德语、希腊语、英语、世界语、西班牙语、芬兰语、法语、匈牙利语、意大利语、荷兰语、挪威语、波兰语、葡萄牙语、俄语和瑞典语之间的双向翻译。数据规模在1千到1万条样本之间,每个语言对配置独立,仅包含训练集,数据以翻译对形式组织,每个样本包含唯一标识符和对应的翻译文本。数据集来源于原始文本,适用于构建和评估多语言翻译模型。

OpusBooks is a multilingual parallel corpus designed for machine translation tasks. The dataset covers multiple language pairs, including translations between Catalan, German, Greek, English, Esperanto, Spanish, Finnish, French, Hungarian, Italian, Dutch, Norwegian, Polish, Portuguese, Russian, and Swedish. The size ranges from 1,000 to 10,000 samples, with each language pair configuration being independent and containing only a training split. The data is organized in translation pairs, where each sample includes a unique identifier and corresponding translated text. The dataset is derived from original sources and is suitable for building and evaluating multilingual translation models.

提供机构:
Soikat
二维码
社区交流群
二维码
科研交流群
商业服务