登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Relative Actor Critic: Workstations
Relative Actor Critic: Workstations
收藏
Harvard Dataverse
2024-09-09 更新
2026-04-09 收录
强化学习
连续控制优化
数据链接:
https://dataverse.harvard.edu/citation?persistentId=doi:10.7910/DVN/TBE30Y
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
MATLAB Codes for Relative Actor Critic
应用场景:
提供机构:
University of Missouri System
创建时间:
2024-01-01
相关数据集
Flightmare Simulator
无人机仿真
强化学习
Flightmare 由两个主要组件组成:基于 Unity 构建的可配置渲染引擎和用于动态模拟的灵活物理引擎。这两个组件完全解耦,可以彼此独立运行。 Flightmare 具有几个理想的功能:(i)大型多模式传感器套件,包括提取场景 3D 点云的界面; (ii) 用于强化学习的 API,可以并行模拟数百个四旋翼; (iii) 与虚拟现实耳机的集成,用于与模拟环境进行交互。 Flightmare 可
OpenXLab
8
0
luca0621/multi-RLHF-processed-llama1B-dataset-with-1000-rewards
自然语言处理
强化学习
该数据集包含查询(query)、响应(response)和奖励(reward)三个特征,其中查询和响应为字符串类型,奖励为浮点数类型。数据集分为训练集和测试集,训练集包含8000个样本,测试集包含2000个样本。总下载大小为2276183字节,数据集总大小为7148705字节。
Hugging Face
2024-11-30 更新
7
0
FractalAIResearch/Fathom-V0.4-RL-Compression
学科文本生成
强化学习
Ramanujan-Ganit-R1-14B-RL是一个英文文本生成数据集,可能包含数学相关的文本内容,并在模型预训练后进行了后处理。具体的数据集内容和用途在README中未详细说明。
Hugging Face
2025-05-13 更新
6
0
erhwenkuo/rlhf_reward_single_round-chinese-zhtw
对话系统
强化学习
这些数据基于anthropic的论文《Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback》开源,旨在为后续的RLHF训练训练偏好(或奖励)模型。数据集来源于beyond/rlhf-reward-single-round-trans_chinese,并使用OpenCC进行简
Hugging Face
2023-10-04 更新
7
0
Hang917/robot_assets
机器人技术
强化学习
机器人资产数据集,包含机器人的几何形状、URDF、MuJoCo XML文件以及相关的网格资源,适用于机器人学和强化学习等相关领域。
Hugging Face
2025-11-08 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广