登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Maze Crawler Episodes 2026-06-02
Maze Crawler Episodes 2026-06-02
收藏
kaggle
2026-06-03 更新
2026-06-17 收录
游戏AI回放分析
强化学习训练数据
数据链接:
https://www.kaggle.com/datasets/kaggle/maze-crawler-episodes-2026-06-02
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Top episode replays for 2026-06-02.
2026年6月2日的热门剧集回放(Top Episode Replays)
应用场景:
创建时间:
2026-06-03
相关数据集
OPERA数据集
开放域推理生成
强化学习训练数据
OPERA数据集是由香港理工大学、美团龙猫团队等机构联合构建的大规模推理轨迹数据集,旨在为开放域任务提供高质量的强化学习训练数据。该数据集包含20,000条经过精心筛选的推理轨迹,每条轨迹通过困惑度引导的迭代合成方法生成,确保逻辑一致性和统计稳定性。数据创建过程采用认知制动机制和困惑度优先展开技术,模拟人类反思性推理模式,最终形成结构化推理链。该数据集主要应用于开放域创造性写作、逻辑推理等任务,旨
arXiv
2026-06-24 更新
18
0
DCAgent2/GLM-4.7-r2egym-patched-full-oracle-1samples-131k-run4
强化学习训练数据
语言模型
该数据集包含1747个训练示例,每个示例包括多轮对话(conversations,其中每轮有内容和角色)、代理(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)和验证器输出(verifier_output)等字段。所有字段均为字符
Hugging Face
2026-04-29 更新
5
0
awhiteawhite/assignment4-qwen25-pairrm-preference
大语言模型偏好对齐
强化学习训练数据
该数据集包含用于偏好学习或排名任务的指令、提示、选择、拒绝以及它们的排名信息。数据集包含49个训练样本,每个样本具有指令、提示、选择答案、拒绝答案以及它们的排名分数。
Hugging Face
2026-04-27 更新
3
0
annakosovskaia/NuminaMath-1.5-RL-Verifiable-cleaned
数学问题求解
强化学习训练数据
NuminaMath-1.5-RL-Verifiable (cleaned) 是一个经过清理和验证的数据集,源自原始数据集 nlile/NuminaMath-1.5-RL-Verifiable。该数据集通过多步骤处理生成,包括正则表达式/结构清理(去除问题编号前缀、解决方案前缀、内联/尾部标记等,并丢弃无效行如解决方案长度过短、包含缺失图像引用、问题字段实际包含解决方案/答案、多部分问题等)、LL
Hugging Face
2026-05-18 更新
5
0
Maze Crawler Episodes 2026-06-21
迷宫探索游戏回放
强化学习训练数据
Top episode replays for 2026-06-21.
kaggle
2026-06-22 更新
4
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广