aklein4/offline-RL-binary-2
收藏官方服务:
资源简介:
这是一个用于强化学习从人类反馈(RLHF)和偏好学习的多源数据集集合,包含多个子数据集,如Anthropic的hh-rlhf、HuggingFaceH4的ultrafeedback_binarized、Magpie-Align的多个DPO变体、PKU-Alignment的SafeRLHF、RLHFlow的ORM数据、Skywork的奖励偏好数据、TIGER-Lab的代码对数据、abacusai的MetaMath DPO、allenai的多个偏好混合数据、kaist-ai的多方面收集数据、nvidia的数学和帮助指导数据、openbmb的UltraInteract对数据以及prometheus-eval的反馈收集数据。每个数据集示例包含输入(input)、输出(output)和奖励(reward)字段,以及来源(source)、领域(domain)、奖励类型(reward_type)和聚类键(cluster_key)等元数据,适用于训练奖励模型、策略优化和偏好对齐任务。
提供机构:
aklein4


