登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Anthropic/hh-rlhf
Anthropic/hh-rlhf
收藏
AI_Studio
2025-08-28 更新
2025-04-05 收录
人工智能
强化学习
数据链接:
https://aistudio.baidu.com/datasetdetail/323318
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
引入Anthropic/hh-rlhf数据集
引入Anthropic的hh-rlhf数据集
应用场景:
提供机构:
旭_1994
相关数据集
selfrew/llama3_8b_self_gen_n40_no_packed_2ep_reward_tmp07
问题解决
强化学习
该数据集包含多个特征,包括索引、目标、提示、级别、类型、解决方案、奖励(布尔序列)和我的解决方案(字符串序列)。数据集分为一个训练集,包含5000个样本,总大小为17354138字节,下载大小为5128570字节。
Hugging Face
2024-12-15 更新
7
0
Baidicoot/augmented_advbench_v3_filtered
人工智能
机器学习
--- dataset_info: features: - name: prompt dtype: string - name: completion_1 dtype: string - name: completion_2 dtype: string - name: completion_3 dtype: string - name: co
Hugging Face
2024-04-14 更新
7
0
aloha_ai_block_transfer
机器人技术
人工智能
该数据集为HuggingFace LeRobot格式机器人数据集。
Hugging Face
2025-02-08 更新
5
0
D-ExpTracker__rl_1e_v2__pv__v1
强化学习
实验跟踪
该数据集是针对rl_1e_v2__pv实验的跟踪器数据集,包含实验的元数据、超参数配置、日志、评估结果和训练数据元数据等多个部分。数据集以不同的配置名称组织,每个配置都有其对应的特征和训练/验证数据划分。
Hugging Face
2025-09-15 更新
7
0
luca0621/multi-RLHF-processed-llama1B-dataset-with-1000-rewards
自然语言处理
强化学习
该数据集包含查询(query)、响应(response)和奖励(reward)三个特征,其中查询和响应为字符串类型,奖励为浮点数类型。数据集分为训练集和测试集,训练集包含8000个样本,测试集包含2000个样本。总下载大小为2276183字节,数据集总大小为7148705字节。
Hugging Face
2024-11-30 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广