登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Krisl7286/HH-RLHF-Personal-Copy-Helpfulness-First
Krisl7286/HH-RLHF-Personal-Copy-Helpfulness-First
收藏
Hugging Face
2025-09-14 更新
2025-10-25 收录
基于人类反馈的强化学习
对话助手对齐
数据链接:
https://hf-mirror.com/datasets/Krisl7286/HH-RLHF-Personal-Copy-Helpfulness-First
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-4.0 ---
许可证:知识共享署名4.0(CC BY 4.0)
应用场景:
提供机构:
Krisl7286
相关数据集
YYYYYYibo/gshf_vllm_1_part_2_mini_2
语言模型对齐
基于人类反馈的强化学习
该数据集包含用于训练和评估的对话数据,主要特征包括prompt、prompt_id、chosen、rejected、messages、score_chosen、score_rejected、reference_response和resp1。chosen和rejected是对话中的选择和拒绝响应,messages包含对话内容。数据集的分割部分只包含train_prefs,该分割有2500个样本,大小
Hugging Face
2024-07-04 更新
12
0
HFXM/hh-rlhf-Rule13
基于人类反馈的强化学习
AI模型对齐
该数据集包含两个字符串类型的特征:选中的(chosen)和被拒绝的(rejected)。数据集仅包含一个训练集分割,共有169352个样本,数据集大小为325133436字节。提供了一个默认配置,用于指定训练数据文件的路径。
Hugging Face
2025-01-02 更新
8
0
YYYYYYibo/gshf_vllm_2_part_3_mini_0
语言模型对齐
基于人类反馈的强化学习
--- dataset_info: features: - name: prompt dtype: string - name: prompt_id dtype: string - name: chosen list: - name: content dtype: string - name: role dtype:
Hugging Face
2024-07-05 更新
8
0
CodeDPO/rlhf_dataset_20250126_openrlhf_format
代码生成模型优化
基于人类反馈的强化学习
该数据集包含了问题、测试用例、推断和上下文消息等字段。它通过Qwen Coder 32B Instruct的过滤,用于测试用例和准确度的研究。数据集分为训练集,共有84924个示例,大小为1,136,916,895字节。
Hugging Face
2025-01-26 更新
9
0
PKU-SafeRLHF
AI安全对齐
基于人类反馈的强化学习
PKU-SafeRLHF 仓库提供了一个高质量的偏好数据集,包含83.4K条数据,标注了无害性和有用性两个维度。每条数据包括一个问题的两个回答,以及基于其有用性和无害性的安全元标签和偏好。该仓库包含来自 Alpaca-7B、Alpaca2-7B 和 Alpaca3-8B 的回复,并支持加载指定子集。数据集中的每个问答对都标有危害类别和严重程度,用于文本生成任务,并采用 CC-BY-NC-4.0 许
Opencsg
2024-07-19 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广