登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Evaluation results obtained with Q-learning on ML-100K.
Evaluation results obtained with Q-learning on ML-100K.
收藏
Figshare
2025-02-20 更新
2026-04-28 收录
强化学习
电影推荐评估
数据链接:
https://figshare.com/articles/dataset/Evaluation_results_obtained_with_Q-learning_on_ML-100K_/28453153
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Evaluation results obtained with Q-learning on ML-100K.
应用场景:
创建时间:
2025-02-20
相关数据集
Quadcopter Flight Control Data
四旋翼控制
强化学习
该数据集汇总了针对四旋翼飞行器在障碍物遍布环境中的飞行控制任务,对不同强化学习算法性能评估的测试数据。它不仅包含了不同强化学习算法之间的性能对比,还探讨了由好奇心驱动的探索对算法效果的影响。
arXiv
15
0
gym_hil_microwave_test
机器人控制
强化学习
该数据集由LeRobot创建,采用apache-2.0许可证,属于机器人技术领域。数据集包含10个episodes,774帧,1个任务,数据文件大小为100MB,视频文件大小为200MB。数据以parquet格式存储,视频以mp4格式存储,帧率为10fps。数据集仅包含训练集。特征包括动作(delta_x, delta_y, delta_z, gripper)、下一状态奖励、完成标志、离散惩罚、前
Hugging Face
2026-04-03 更新
10
0
skandermoalla/qrpo-paper-llama-nosft-magpieair-armorm-temp1-ref50-offpolicy2random-armorm
强化学习
对齐
--- license: mit tags: - reinforcement-learning - alignment - qrpo --- # qrpo-paper-llama-nosft-magpieair-armorm-temp1-ref50-offpolicy2random-armorm Dataset with reference completions and rewards fo
Hugging Face
2025-12-08 更新
6
0
sungyub/table-r1-zero-verl
表格推理
强化学习
Table-R1-Zero是一个针对表格推理问题的数据集,转换为VERL格式,适用于强化学习训练工作流。该数据集包含69,265个表格推理问题,主要来源于WikiTableQuestions和其他表格问答基准数据集,设计用于训练语言模型理解和推理结构化表格数据。
Hugging Face
2025-11-05 更新
11
0
luca0621/multi-RLHF-processed-llama1B-dataset-with-1000-rewards
自然语言处理
强化学习
该数据集包含查询(query)、响应(response)和奖励(reward)三个特征,其中查询和响应为字符串类型,奖励为浮点数类型。数据集分为训练集和测试集,训练集包含8000个样本,测试集包含2000个样本。总下载大小为2276183字节,数据集总大小为7148705字节。
Hugging Face
2024-11-30 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广