遇见数据集

PPE-Human-Preference-V1

收藏
魔搭社区2025-11-07 更新2025-04-26 收录
官方服务:

资源简介:

# Overview This contains the human preference evaluation set for Preference Proxy Evaluations. This dataset is meant for benchmarking and evaluation, not for training. [Paper](https://arxiv.org/abs/2410.14872) [Code](https://github.com/lmarena/PPE) # License User prompts are licensed under CC-BY-4.0, and model outputs are governed by the terms of use set by the respective model providers. # Citation ``` @misc{frick2024evaluaterewardmodelsrlhf, title={How to Evaluate Reward Models for RLHF}, author={Evan Frick and Tianle Li and Connor Chen and Wei-Lin Chiang and Anastasios N. Angelopoulos and Jiantao Jiao and Banghua Zhu and Joseph E. Gonzalez and Ion Stoica}, year={2024}, eprint={2410.14872}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2410.14872}, } ```

# 数据集概览 本数据集为面向偏好代理评估(Preference Proxy Evaluations)的人工偏好评测集。 本数据集仅用于基准测试与模型评估,不可用于模型训练。 [论文](https://arxiv.org/abs/2410.14872) [代码](https://github.com/lmarena/PPE) # 授权协议 用户提示词(User prompts)采用CC-BY-4.0协议授权,模型生成输出需遵循对应模型提供商的使用条款。 # 引用信息 @misc{frick2024evaluaterewardmodelsrlhf, title={面向基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)的奖励模型评估}, author={Evan Frick and Tianle Li and Connor Chen and Wei-Lin Chiang and Anastasios N. Angelopoulos and Jiantao Jiao and Banghua Zhu and Joseph E. Gonzalez and Ion Stoica}, year={2024}, eprint={2410.14872}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2410.14872}, }

提供机构:
maas
创建时间:
2025-04-21
搜集汇总
数据集介绍
PPE-Human-Preference-V1 数据集图片
背景与挑战
背景概述
PPE-Human-Preference-V1是一个专门用于基准测试和评估的人类偏好数据集,不适用于训练目的。数据集包含用户提示和模型输出,分别遵循不同的许可协议,并与评估RLHF奖励模型的研究论文相关联。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务