遇见数据集

xudongwu/DPR_Pm3B_U10_beta0.10g0.30gamma0.30

收藏
Hugging Face2026-04-27 更新2026-05-03 收录
官方服务:

资源简介:

该数据集包含多个配置,每个配置有100个示例,特征包括提示、被选回答、被拒回答、回答、奖励分数和GPT分数,可能用于训练或评估对话模型,特别是基于人类反馈的强化学习(RLHF)场景。

This dataset includes multiple configurations, each with 100 examples, featuring prompts, chosen responses, rejected responses, responses, reward scores, and GPT scores, likely used for training or evaluating dialogue models, particularly in reinforcement learning from human feedback (RLHF) scenarios.

提供机构:
xudongwu
二维码
社区交流群
二维码
科研交流群
商业服务