登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
DDQN training rewards on final episode, for 30 stocks.
DDQN training rewards on final episode, for 30 stocks.
收藏
NIAID Data Ecosystem
2026-03-13 收录
强化学习
股票策略优化
数据链接:
https://figshare.com/articles/dataset/DDQN_training_rewards_on_final_episode_for_30_stocks_/19197553
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
DDQN training rewards on final episode, for 30 stocks.
应用场景:
创建时间:
2022-02-18
相关数据集
EMDSAC-ft: Bridging the Gap in Offline-to-Online Reinforcement Learning through Value Distribution Learning
强化学习
离线到在线学习
Offline-to-online is a key strategy for advancing reinforcement learning towards practical applications. This approach not only reduces the risks and costs associated with online exploration, but also
DataCite Commons
2024-10-28 更新
11
0
Finger-Gaiting Manipulation Dataset
机器人控制
强化学习
该数据集旨在学习使用次优控制器进行手内操作技能的指关节控制。它包含了多种方法的结果,包括标准的非策略强化学习以及行为克隆损失版本。数据集涵盖了多种物体,如立方体、球体、圆柱体、十二面体和二十面体,针对的任务是灵巧的手内操作。
arXiv
9
0
luca0621/multi-RLHF-processed-llama1B-dataset-with-1000-rewards
自然语言处理
强化学习
该数据集包含查询(query)、响应(response)和奖励(reward)三个特征,其中查询和响应为字符串类型,奖励为浮点数类型。数据集分为训练集和测试集,训练集包含8000个样本,测试集包含2000个样本。总下载大小为2276183字节,数据集总大小为7148705字节。
Hugging Face
2024-11-30 更新
7
0
yonghoon96/antmaze-giant-navigate-20m-v0
强化学习
离线强化学习
--- license: mit task_categories: - reinforcement-learning tags: - offline-rl - goal-conditioned-rl - mujoco - antmaze size_categories: - 10M<n<100M --- # AntMaze-Giant-Navigate 20M Dataset This da
Hugging Face
2026-02-21 更新
10
0
ai2-adapt-dev/sft_v3.9_used_on_policy_p0_olmo2_7b
语言模型
强化学习
--- dataset_info: features: - name: prompt dtype: string - name: chosen list: - name: content dtype: string - name: role dtype: string - name: rejected list:
Hugging Face
2024-11-23 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广