teamcore/DPO_Pm3B_U0_beta0.25dr_dpoEurus_RM_7bbt_noise_flip_paper0.6g
收藏资源简介:
该数据集包含源文本(source)、指令(instruction)、模型输出(models)、完成情况(completions,包括有帮助性、诚实性、指令遵循性、真实性等多个子字段)、批评(critique)、自定义系统提示(custom_system_prompt)、细粒度分数(fine-grained_score)、模型名称(model)、总分(overall_score)、原则(principle)、响应(response)、正确答案(correct_answers)、错误答案(incorrect_answers)、提示(prompt)、选择(chosen)、拒绝(rejected)、选择分数(chosen_score_Eurus_RM_7b)、拒绝分数(rejected_score_Eurus_RM_7b)、BERT概率(bt_prob_Eurus_RM_7b)、生成奖励分数(reward_score_generated)、选择奖励分数(reward_score_chosen)、GPT分数(gpt_score)和GPT反馈(gpt_feedback)等字段。数据集被分为默认分割,包含1000个示例,总大小为18224585字节。
The dataset includes fields such as source text (source), instructions (instruction), model outputs (models), completions (including sub-fields like helpfulness, honesty, instruction following, truthfulness, etc.), critique, custom system prompt, fine-grained score, model name, overall score, principle, response, correct answers, incorrect answers, prompt, chosen, rejected, chosen score (chosen_score_Eurus_RM_7b), rejected score (rejected_score_Eurus_RM_7b), BERT probability (bt_prob_Eurus_RM_7b), generated reward score (reward_score_generated), chosen reward score (reward_score_chosen), GPT score (gpt_score), and GPT feedback (gpt_feedback). The dataset is split into a default partition, containing 1000 examples, with a total size of 18224585 bytes.



