aklein4/offline-RL-binary
收藏资源简介:
这是一个包含多个子数据集的集合,专门用于强化学习从人类反馈(RLHF)和奖励模型训练。子数据集包括Anthropic--hh-rlhf、HuggingFaceH4--ultrafeedback_binarized--train_prefs、PKU-Alignment--PKU-SafeRLHF--default、RLHFlow--Deepseek-ORM-Data、RLHFlow--Mistral-ORM-Data、Skywork--Skywork-Reward-Preference-80K-v0.2、TIGER-Lab--AceCodePair-300K--default、abacusai--MetaMath_DPO_FewShot、nvidia--AceMath-RM-Training-Data、nvidia--HelpSteer3--preference、openbmb--UltraInteract_pair和prometheus-eval--Feedback-Collection。每个子数据集包含特征如input(输入文本)、output(输出文本)、reward(奖励值)、source(数据来源)、kind(数据类型)和可选的keep(保留标志),覆盖对话、代码生成、数学问题、用户反馈等多种任务场景,旨在支持模型训练中的偏好学习和奖励优化。
This is a collection of multiple sub-datasets specifically designed for Reinforcement Learning from Human Feedback (RLHF) and reward model training. The sub-datasets include Anthropic--hh-rlhf, HuggingFaceH4--ultrafeedback_binarized--train_prefs, PKU-Alignment--PKU-SafeRLHF--default, RLHFlow--Deepseek-ORM-Data, RLHFlow--Mistral-ORM-Data, Skywork--Skywork-Reward-Preference-80K-v0.2, TIGER-Lab--AceCodePair-300K--default, abacusai--MetaMath_DPO_FewShot, nvidia--AceMath-RM-Training-Data, nvidia--HelpSteer3--preference, openbmb--UltraInteract_pair, and prometheus-eval--Feedback-Collection. Each sub-dataset features columns such as input (input text), output (output text), reward (reward value), source (data source), kind (data type), and an optional keep (retention flag), covering various task scenarios like dialogue, code generation, mathematical problems, and user feedback, aimed at supporting preference learning and reward optimization in model training.



