遇见数据集

Chronocooked

收藏
arXiv2026-08-17 更新2026-08-19 收录
官方服务:

资源简介:

Chronocooked是一个面向强化学习智能体的隐式间隔计时基准测试套件,由根特大学IDLab和阿姆斯特丹自由大学共同创建。该环境基于Overcooked-AI简化而来,采用5×3或4×3网格世界,包含洋葱分配器、烤箱和交付柜台等元素,通过烹饪任务隐式要求智能体感知时间。数据集包含多个任务(如二分法、固定间隔、多计时器等),但未提供具体样本数量或Tokens数,其生成过程由环境与智能体交互自动产生。该基准旨在暴露智能体在时间感知和时序决策上的局限性,推动时间感知模型在人机交互及时间敏感社会场景中的发展。

Chronocooked is an implicit interval timing benchmark suite for reinforcement learning agents, co-created by IDLab of Ghent University and Vrije Universiteit Amsterdam. This environment is simplified from Overcooked-AI, utilizing 5×3 or 4×3 grid worlds that incorporate elements such as onion dispensers, ovens, and delivery counters. It implicitly demands agents to perceive time through cooking tasks. The dataset encompasses multiple tasks (e.g., dichotomy, fixed interval, multi-timer, etc.), with no specific sample count or token count specified, and is automatically generated through the interaction between the environment and agents. This benchmark is designed to expose the limitations of agents in temporal perception and sequential decision-making, thereby advancing the development of temporal perception models in human-computer interaction and time-sensitive social scenarios.

创建时间:
2026-08-17
原始信息汇总

数据集概述:ChronoCooked

ChronoCooked 是一个基于 Gymnasium 的强化学习基准测试环境,专门用于研究智能体在强化学习中的隐式间隔计时能力。该环境受 Overcooked 游戏启发,在 5×3 的网格世界中提供简化的烹饪任务,要求智能体基于未观察到的时序信息做出决策。

环境详情

  • 网格大小:5 × 3
  • 烤箱计时器:隐藏(不可观察)
  • 智能体数量:单智能体

任务变体

该数据集提供多种任务变体,以修改计时和环境动态:

  • 多计时器 / 精确计时器:包含过度烹饪缓冲
  • 二分任务:包含两个交付计数器和两个目标时长
  • 不确定性任务:包含紧急烤箱停止按钮
  • 双任务:包含带辅助奖励的水槽

动作空间

离散动作空间(6 个动作):

  • 0:等待
  • 1:向下
  • 2:向上
  • 3:向右
  • 4:向左
  • 5:交互

注意:不支持对角移动,且无法穿过物体。

观察空间

类型:Box(low=0, high=20, shape=(grid_shape), dtype=uint8)(多计时器变体的 high=30)

观察通道编码了以下信息:

  • 智能体位置
  • 物体位置
  • 智能体是否携带洋葱或汤
  • 烤箱状态
  • 水槽状态(若存在)

奖励机制

默认奖励

  • 成功交付汤:+1
  • 其他情况:0

任务相关奖励

  • 对未煮熟或过度烹饪的汤施加惩罚
  • 额外的小奖励(例如,双任务中的水槽交互)

回合终止条件

回合在以下情况结束:

  • 汤已交付(单次试验),或
  • 达到最大时间步数(200)

初始状态

智能体起始于网格中的随机空闲单元格。

仓库结构

  • rl_environments/:包含本项目使用的所有强化学习环境
  • train/:包含用于运行实验和训练智能体的训练脚本
  • eval/:包含每个任务的评估代码(Jupyter notebooks)
  • sb3_utils/:自定义特征提取和策略定义所需的实用函数,与 Stable-Baselines3 兼容

其他信息

env.reset(seed=...) 控制智能体的起始位置。该仓库提供了基于 Stable-Baselines3 中 PPO 算法实现的 CNN–MLP、CNN–LSTM–MLP、CNN-GRU-MLP 和 CNN–CTRNN–MLP 模型的训练脚本。

搜集汇总
数据集介绍
Chronocooked 数据集图片
构建方式
Chronocooked是一个基于Gymnasium的强化学习基准环境,灵感源自Overcooked游戏,但经过简化设计为单智能体场景。环境为5x3或4x3的网格世界,包含洋葱分配器、烤箱和交付柜台三个关键要素。智能体的核心任务是拾取洋葱、放入烤箱并等待烹饪完成,随后交付汤品。烤箱内置不可见的计时器,其目标持续时间(TD)是隐式的,智能体无法直接观测到时间信息。任务设计借鉴心理学中的二分任务和固定间隔任务,并在此基础上扩展出多计时器、双任务和不确定性任务等多个变体,以系统考察智能体的隐式时间感知能力。
特点
Chronocooked的显著特点在于其将时间感知以隐式方式融入强化学习任务,智能体的状态和奖励函数均不携带任何显式时间信息,迫使智能体必须推断时间以优化行为。环境保持高度简洁,便于进行受控实验并支持生物合理模型的测试。基准提供了一套全面的评估指标,包括心理测量曲线、二分点、韦伯分数、首次烤箱检查、标量属性等,能够从多个维度量化智能体的时间感知特性,如时间辨别能力、多间隔存储容量、分布外泛化能力以及与人类时间偏倚的一致性。所有任务均基于PPO算法在三种模型架构(非递归、递归和生物合理)上进行了基线测试,为后续研究提供了标准化对比框架。
使用方法
Chronocooked数据集主要通过Gymnasium接口供强化学习研究者使用。用户需根据任务需求选择合适的场景(如二分任务、固定间隔任务或多计时器任务),并配置相应的目标持续时间、缓冲时长等参数。环境支持自定义智能体模型,只需遵循Gymnasium的标准交互协议即可进行训练与评估。为全面检验智能体的时间感知能力,建议在多任务上训练并利用提供的评估指标进行深入分析,包括绘制心理测量曲线、计算韦伯分数和标量属性等。此外,环境代码和详细文档已在匿名仓库中公开,便于研究者复现实验结果并扩展新的时序任务。
背景与挑战
背景概述
时间感知是人类决策与行为协调的核心要素,然而人工智能体在复杂时间依赖任务中普遍缺乏对隐式时间间隔的推断能力。为此,Ghent University的Amrapali Pednekar等人于2026年提出Chronocooked基准测试套件,旨在系统评估强化学习代理的隐式区间计时能力。该套件受Overcooked游戏启发,设计了一系列烹饪场景,其中时间信息作为未观测变量,却对最优策略至关重要。环境保持简洁以支持受生物学启发的模型,并配套多种评估指标以量化代理的时间感知特征,如韦伯分数和标量属性。这一基准填补了时间感知标准化评估的空白,为人机交互和时序依赖社会部署的智能体研究提供了关键工具。
当前挑战
Chronocooked面临的挑战多维且深刻。在领域层面,现有强化学习代理虽在某些时序任务上表现优异,却难以验证其是否真正内化时间概念,而非依赖任务特定启发式策略;同时,缺乏标准化基准,导致不同模型间的时序能力比较困难。在构建层面,环境设计需在简化性与实验控制间取得平衡,以确保时间信息未被显式编码,同时保持任务可学习性;评估指标需从心理学与神经科学文献中提炼,涵盖人类计时偏差复制、多间隔处理、分布外泛化等能力,这要求对代理行为进行多维度精细度量。此外,受生物学启发的循环模型在复杂环境中计算负担较重,而简单环境的任务设计又需确保时间推断成为性能关键,这对测试集构建与奖励函数设计提出了双重考验。
常用场景
经典使用场景
Chronocooked数据集作为强化学习领域内首个专门针对隐式间隔计时能力评估的基准套件,其经典使用场景聚焦于揭示智能体在缺乏显式时间线索条件下进行时间感知与决策的潜在机制。该环境以简化版Overcooked游戏为蓝本,构建了单智能体在5×3或4×3网格世界中烹饪汤品的情境,其中烤箱的烹饪时长作为不可观测但至关重要的时间变量。研究者可借此场景系统性地探究非递归模型(如CNN-MLP)、递归模型(如CNN-LSTM-MLP)及生物合理性模型(如CNN-CTRNN-MLP)在二分任务、固定间隔任务、多计时器任务等情境下的时间判别、时间控制及时间泛化能力,从而深入解析不同架构智能体对时间信息的隐式编码与利用方式。
实际应用
在实际应用层面,Chronocooked所模拟的隐式计时场景与众多现实人机交互及自动化系统需求高度契合。例如,在服务机器人执行烹饪任务时,需依据食物烹饪时长自主决定动作时机,而无需依赖外部显式信号;在工业协作环境中,机器人需在无明确提示的情况下,根据工序耗时协调操作节奏。该数据集提供的评估指标(如首次烤箱检查时间)有助于优化策略,减少无谓动作能耗,提升交互流畅性与效率。此外,其面向生物合理性模型的支持,为开发更具人类认知特性的机器人控制器提供了验证平台,有望促进机器人在时间敏感型社会场景中的融入与协作能力。
衍生相关工作
Chronocooked的提出为时序强化学习研究开辟了衍生方向。一方面,它激发了针对不同记忆容量递归架构(如CTRNN与LSTM)在隐式计时任务上的对比研究,促使研究者探索更高效的时间表征与存储机制。另一方面,其标准化的评估范式(包括心理测量曲线、二分点、标量属性检验等)可被移植至其他领域,如心理物理学中的时间感知建模、神经科学中的时间细胞理论验证,以及元强化学习中的分布外泛化研究。此外,该基准鼓励将显式时间工程化模型(如时间自适应漂移扩散模型)纳入统一测试框架,推动时间感知模块在人工智能系统中的集成设计,从而衍生出更多关于时间感知、记忆与决策交互的前沿探索工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务