RLHFlow/Argilla-Math-DPO-standard
收藏官方服务:
资源简介:
该数据集包含多个特征,其中chosen和rejected是两个列表类型的特征,每个列表包含content和role两个子特征,数据类型均为字符串。此外,数据集还包含chosen_rating和rejected_rating两个浮点数类型的特征,以及一个名为metadata的字符串类型特征。数据集分为一个训练集,包含2418个样本,总大小为7540044字节。
该数据集包含多个特征,其中chosen和rejected是两个列表类型的特征,每个列表包含content和role两个子特征,数据类型均为字符串。此外,数据集还包含chosen_rating和rejected_rating两个浮点数类型的特征,以及一个名为metadata的字符串类型特征。数据集分为一个训练集,包含2418个样本,总大小为7540044字节。
提供机构:
RLHFlow原始信息汇总
数据集概述
数据集特征
- chosen
- content: 字符串类型
- role: 字符串类型
- rejected
- content: 字符串类型
- role: 字符串类型
- chosen_rating: 浮点数类型
- rejected_rating: 浮点数类型
- metadata: 字符串类型
数据集划分
- train
- num_bytes: 7540044字节
- num_examples: 2418个样本
数据集大小
- download_size: 2926478字节
- dataset_size: 7540044字节
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集是一个用于直接偏好优化(DPO)的数学代数问题数据集,包含2,418条数据,每条数据由用户查询、模型生成的被选择(chosen)和被拒绝(rejected)回答以及对应的评分组成。数据集专注于代数表达式的简化、方程求解等数学任务,旨在通过偏好对比训练提升语言模型在数学推理上的准确性和步骤清晰度。
以上内容由遇见数据集搜集并总结生成



