Large-Scale Preference Dataset
收藏官方服务:
资源简介:
Training Powerful Reward & Critic Models with Aligned Language Models
使用对齐语言模型(Aligned Language Models)训练高性能奖励模型与评判模型
创建时间:
2023-11-26

Training Powerful Reward & Critic Models with Aligned Language Models
使用对齐语言模型(Aligned Language Models)训练高性能奖励模型与评判模型