登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Summary of free parameters of Q-learning models.
Summary of free parameters of Q-learning models.
收藏
Figshare
2015-12-03 更新
2026-04-29 收录
强化学习
Q学习参数优化
数据链接:
https://figshare.com/articles/dataset/_Summary_of_free_parameters_of_Q_learning_models_/1592507
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Summary of free parameters of Q-learning models.
应用场景:
创建时间:
2015-12-03
相关数据集
luca0621/multi-RLHF_turn_4_ckp
强化学习
序列生成
该数据集包含一个名为trajectory的特征,该特征是一个列表,包含content和role两个子特征,它们的类型均为字符串。数据集只有一个训练集(train),包含1000个样本,总大小为2373439字节。下载大小为1144256字节。配置部分指定了默认配置,数据文件路径为data/train-*。
Hugging Face
2024-11-27 更新
12
0
maanas-writer/mem_agent-model_based-rl-memoryagent-7b-bizbench-test-c27000-t512-1000s-agnostic
自然语言处理
强化学习
该数据集包含问题、上下文、正确答案、响应、提取的答案等多种文本信息,以及处理和评估模型所需的相关元数据。数据集分为训练集,并提供了详细的大小信息。
Hugging Face
2025-11-08 更新
6
0
II-Thought-RL-v0
强化学习
问题解答
II-Thought RL v0是一个大规模、多任务的数据集,专为强化学习设计。该数据集包含经过严格多步骤过滤的高质量问题-答案对,使用了Gemini 2.0 Flash和Qwen 32B作为质量评估工具。数据集涵盖了数学、编程、科学等多个领域,包括来自公开数据集的问题对和自定义的高质量问题对。数据集经过去重、质量评估和去污染流程,以确保数据完整性和训练适用性。
Hugging Face
2025-03-28 更新
5
0
qgallouedec/prj_gia_dataset_metaworld_handle_press_side_v2_1111
强化学习
智能代理
该数据集是为模仿学习环境handle-press-side-v2创建的,属于Generally Intelligent Agents项目的一部分。它包含了观察、动作、完成标志和奖励等数据,用于深度强化学习和多任务多模态学习的研究。
Hugging Face
2023-03-09 更新
12
0
Intelligent-Internet/II-Thought-RL-v0
强化学习
多任务学习
II-Thought RL v0是一个大规模、多任务的强化学习数据集,包含了经过严格多步骤筛选的高质量问题-答案对。数据集涵盖了数学、编程、科学等多个领域,旨在为强化学习模型提供多样化的训练材料。
Hugging Face
2025-03-28 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广