xudongwu/DPR_Pm3B_U10_beta0.10g0.30gamma0.30
收藏官方服务:
资源简介:
该数据集包含多个配置,每个配置有100个示例,特征包括提示、被选回答、被拒回答、回答、奖励分数和GPT分数,可能用于训练或评估对话模型,特别是基于人类反馈的强化学习(RLHF)场景。
This dataset includes multiple configurations, each with 100 examples, featuring prompts, chosen responses, rejected responses, responses, reward scores, and GPT scores, likely used for training or evaluating dialogue models, particularly in reinforcement learning from human feedback (RLHF) scenarios.
提供机构:
xudongwu


