登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Replication Data for: A-Reinforcement-Learning-based-Follow-Up-Framework
Replication Data for: A-Reinforcement-Learning-based-Follow-Up-Framework
收藏
NIAID Data Ecosystem
2026-03-14 收录
强化学习
临床随访策略优化
数据链接:
https://doi.org/10.7910/DVN/ITHRUX
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
DOI: 10.5281/zenodo.7329036
应用场景:
创建时间:
2022-12-21
相关数据集
HuggingFaceH4/aws-pm-pilot
强化学习
机器学习
该数据集是用于基于人类反馈的强化学习(RLHF)的PM数据集的初步标注。数据集使用了开源模型的输出,这些模型在Anthropic的hh-rlhf数据集和Self-Instruct的种子数据集的混合数据上进行了训练。
Hugging Face
2023-03-20 更新
16
0
yonghoon96/antmaze-giant-navigate-20m-v0
强化学习
离线强化学习
--- license: mit task_categories: - reinforcement-learning tags: - offline-rl - goal-conditioned-rl - mujoco - antmaze size_categories: - 10M<n<100M --- # AntMaze-Giant-Navigate 20M Dataset This da
Hugging Face
2026-02-21 更新
10
0
selfrew/llama3_8b_self_gen_n40_no_packed_2ep_reward_tmp07
问题解决
强化学习
该数据集包含多个特征,包括索引、目标、提示、级别、类型、解决方案、奖励(布尔序列)和我的解决方案(字符串序列)。数据集分为一个训练集,包含5000个样本,总大小为17354138字节,下载大小为5128570字节。
Hugging Face
2024-12-15 更新
7
0
LangAGI-Lab/train-rl-o1-mini-annotated-math-numina-22k
强化学习
数学
该数据集使用MIT许可,包含英语语言的数据,大小在10K到100K之间。具体的数据集内容、用途和结构没有在README中描述。
Hugging Face
2025-02-06 更新
12
0
InsultedByMathematics/llama3-ultrafeedback-armo-infoNCA-K-3
自然语言处理
强化学习
该数据集包含多个响应及其对应的奖励值,以及提示和相关的token序列。数据集分为训练集和测试集,分别包含54328和1801个样本。数据集的下载大小为412739819字节,总大小为2321505543字节。
Hugging Face
2024-12-03 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广