遇见数据集

hgissbkh/ALMA-Preference-Mono-xCOMET-QE-Choose-Low-Reject-Mid

收藏
Hugging Face2024-07-21 更新2024-07-22 收录
官方服务:

资源简介:

该数据集包含多种语言对的翻译数据,每个样本包括源语言、目标语言、源文本、参考文本、被拒绝的翻译、选择的翻译和基础翻译。此外,还提供了多个评分指标,如xcomet、kiwi和chrf等,用于评估翻译质量。数据集分为一个训练集,包含20575个样本。

This dataset contains translation data for multiple language pairs, with each sample including source language, target language, source text, reference text, rejected translation, chosen translation, and base translation. Additionally, it provides multiple scoring metrics such as xcomet, kiwi, and chrf for evaluating translation quality. The dataset is divided into a training set containing 20575 samples.

提供机构:
hgissbkh
原始信息汇总

数据集概述

数据集特征

  • lp: 字符串类型
  • src_lang: 字符串类型
  • tgt_lang: 字符串类型
  • src: 字符串类型
  • ref: 字符串类型
  • rejected: 字符串类型
  • chosen: 字符串类型
  • base: 字符串类型
  • rejected_xcomet: 浮点数类型
  • chosen_xcomet: 浮点数类型
  • base_xcomet: 浮点数类型
  • rejected_kiwi: 浮点数类型
  • chosen_kiwi: 浮点数类型
  • base_kiwi: 浮点数类型
  • rejected_chrf: 浮点数类型
  • chosen_chrf: 浮点数类型
  • base_chrf: 浮点数类型

数据集分割

  • train:
    • 字节数: 16791507
    • 样本数: 20575

数据集大小

  • 下载大小: 11178008 字节
  • 数据集大小: 16791507 字节

配置

  • config_name: default
    • 数据文件:
      • 分割: train
      • 路径: data/train-*
二维码
社区交流群
二维码
科研交流群
商业服务