MT-PREF|机器翻译数据集|偏好分析数据集
收藏MT-Pref 数据集概述
数据集简介
MT-Pref 数据集是一个用于机器翻译(MT)的偏好数据集,旨在通过自动评估指标来模拟用户偏好。该数据集包含 18,000 个实例,涵盖 18 种语言方向,文本来源包括多个领域,时间范围为 2022 年之后。
数据集内容
- 数据来源: 数据集包含多个高质量机器翻译系统生成的翻译结果,并由专业语言学家进行句子级别的质量评估。
- 自动评估指标: 数据集提供了多种自动评估指标的评分,用于分析这些指标在恢复人类偏好方面的能力。
- 附加数据: 数据集还包括在 WMT23 和 FLORES 基准测试上训练模型的所有评估结果,以确保可重复性。
数据集链接
MT-Pref 数据集可通过以下链接获取:sardinelab/MT-pref
数据集用途
该数据集主要用于训练和评估机器翻译模型,特别是那些旨在更好地处理语言细微差别和上下文特定变化的模型。通过使用 MT-Pref 数据集进行训练,模型在 WMT23 和 FLORES 基准测试上的翻译质量显著提升。

- 1Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine Translation电信研究所, 高等技术学院, 里斯本大学, Unbabel, ELLIS里斯本单位, 卡内基梅隆大学, MICS, 中央理工-高等电力学院, 巴黎-萨克雷大学 · 2024年
中国区域交通网络数据集
该数据集包含中国各区域的交通网络信息,包括道路、铁路、航空和水路等多种交通方式的网络结构和连接关系。数据集详细记录了各交通节点的位置、交通线路的类型、长度、容量以及相关的交通流量信息。
data.stats.gov.cn 收录
LIDC-IDRI
LIDC-IDRI 数据集包含来自四位经验丰富的胸部放射科医师的病变注释。 LIDC-IDRI 包含来自 1010 名肺部患者的 1018 份低剂量肺部 CT。
OpenDataLab 收录
中国近海地形数据集(渤海,黄海,东海,南海)
本数据集包含历年来通过收集和实测方法取得的中国近海水深点数据、地形图数据(ArcGIS格式),以及黄河口、莱州湾东部、辽东湾、山东南部沿海、南海部分海域的单波束、多波束水深测量数据,包括大尺度的低密度水深数据与局部高密度水深数据。
地球大数据科学工程 收录
giovannidemuri__sharegpt-ex50000-seed5_llama8b-er-v573-seed2-hx_256_ngt0.7_tp0.9
该数据集包含了用户与助手之间的对话,其中包含两个字段:用户发言和助手回应,均为字符串类型。训练集大小为38646852字节,共有44096条对话记录。
huggingface 收录
糖尿病预测数据集
糖尿病相关的医学研究或者健康数据
AI_Studio 收录
