登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Evaluation results obtained with SARSA on ML-100K.
Evaluation results obtained with SARSA on ML-100K.
收藏
NIAID Data Ecosystem
2026-05-02 收录
强化学习
电影推荐系统评估
数据链接:
https://figshare.com/articles/dataset/Evaluation_results_obtained_with_SARSA_on_ML-100K_/28453156
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Evaluation results obtained with SARSA on ML-100K.
应用场景:
创建时间:
2025-02-20
相关数据集
minesweeper
地雷游戏
强化学习
该数据集包含五个不同大小的舰船,它们被随机放置在一个10×10的网格中。在这个任务中,智能体必须在不了解舰船实际位置的情况下击沉所有舰船。对于击中舰船的步骤,系统会给予奖励,而对于每一步的时间消耗,则会施加惩罚。该任务的规模是基于10×10的网格,主要任务是处理部分可观测马尔可夫决策过程(Pomdps)中的决策制定。
arXiv
13
0
luca0621/multi-RLHF-processed-llama1B-dataset-with-1000-rewards
自然语言处理
强化学习
该数据集包含查询(query)、响应(response)和奖励(reward)三个特征,其中查询和响应为字符串类型,奖励为浮点数类型。数据集分为训练集和测试集,训练集包含8000个样本,测试集包含2000个样本。总下载大小为2276183字节,数据集总大小为7148705字节。
Hugging Face
2024-11-30 更新
7
0
maanas-writer/mem_agent-model_based-rl-memoryagent-14b-gsminf-ops_12-c4096-t2048-10s-agnostic
强化学习
问答系统
这是一个包含问题、上下文、正确答案、响应等信息的文本数据集,适用于问答或机器阅读理解等NLP任务。数据集分为训练集,共有80个示例。
Hugging Face
2025-11-07 更新
5
0
maanas-writer/mem_agent-model_based-rl-memoryagent-7b-housingqa-test-c1024-t512-10s-agnostic
问答系统
强化学习
该数据集包含问题、上下文、正确答案、响应、提取的答案、最终记忆、记忆长度、响应长度、上下文长度、相似度、正确性、响应URL、响应URL索引、模型名称、是否截断、原始上下文长度、截断的上下文长度和删除的token数量等字段。数据集分为训练集,提供了字节数和示例数。但具体的应用场景和详细描述未在README中给出。
Hugging Face
2025-11-13 更新
7
0
MoeReward/combined_rlhf_dataset_balanced
强化学习
数据平衡
这是一个包含context_messages字符串字段的数据集,被划分为训练集,共有9999个示例。数据集的总大小为2664743.85字节。
Hugging Face
2025-03-29 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广