遇见数据集

jlov7/nanoAWM-minios

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

MiniOS是一个用于工具代理世界模型的确定性符号任务套件,来自nanoAWM项目。它是一个确定性、完全符号化的玩具操作系统,包含文件系统、终端/测试、git、浏览器/表单、数据库/表、邮件/日历、包/配置、审批、隐藏状态、不可逆操作、延迟后果和回滚等功能。每个任务都设计为展示“后果别名”现象,即两个候选操作在当前可见观察下看起来同样合理,但在未来奖励、可逆性、隐藏状态损坏或审批合规性方面存在显著差异。无记忆的响应策略无法在隐藏状态下达到最优,而历史条件化后果模型可以。数据集包含420个任务,分为15个家族,包括审批门控邮件发送、不可逆文件删除、延迟测试失败、数据库迁移隐藏不变量、git脏树、回滚恢复、包安装依赖冲突、跨表面依赖、模糊相同可见观察和对抗性失败变体等。任务分为训练(240个任务,每个任务使用3个词汇随机化变体,共720个)、验证(30个任务)、测试(60个任务,用于分布内评估)、模板保留(45个任务,用于分布内评估,但未保留模板)和分布外(45个任务,用于局部分布外压力测试)。数据以JSONL格式存储,每个任务包含任务ID、模板ID、种子、家族、拆分、描述、可见状态、候选操作集、隐藏状态和响应操作等字段。隐藏状态是环境真实值,用于运行环境和评分结果,但不作为规划时输入。数据集部分在词汇上可分离,评估拆分与训练共享词汇,因此需谨慎处理拆分名称。数据集主要用于研究隐藏状态下的后果建模,而非作为Web/操作系统基准或外部验证。

This dataset is the MiniOS task suite from nanoAWM. MiniOS is a deterministic, fully symbolic toy operating system: filesystem, terminal/tests, git, browser/forms, DB/table, email/calendar, package/config, approvals, hidden state, irreversible actions, delayed consequences, and rollback. Each task is constructed to exhibit consequence aliasing — two candidate actions that look equally reasonable from the current visible observation but diverge sharply in future reward, reversibility, hidden-state corruption, or approval compliance. A memoryless reactive policy provably cannot be optimal across the hidden states; a history-conditioned consequence model can. The dataset contains 420 tasks across 15 families, including approval-gated email send, irreversible file deletion, delayed test failure, database-migration hidden invariant, git dirty-tree, rollback recovery, package-install dependency conflict, cross-surface dependency, ambiguous same-visible-observation, and adversarial failure variants. Tasks are split into train (240 tasks, used with 3 vocabulary-randomized variants each → 720), val (30 tasks), test (60 tasks for in-distribution evaluation), template_holdout (45 tasks for in-distribution evaluation, but does not hold out templates), and ood (45 tasks for local out-of-distribution stress). Data is stored in JSONL format, with fields such as task_id, template_id, seed, family, split, description, visible_state, actions, hidden_state, and reactive_action. Hidden state is environment ground truth, needed to run the environment and score outcomes, but not a planning-time input. The dataset is partly lexically separable, and eval splits share vocabulary with training, so split names should be treated skeptically. It is intended for studying consequence modeling under hidden state, not as a web/OS benchmark or external validation.

提供机构:
jlov7
搜集汇总
数据集介绍
jlov7/nanoAWM-minios 数据集图片
构建方式
nanoAWM-MiniOS数据集是一个确定性符号化任务套件,旨在模拟一个精简的操作系统环境。它通过JSON Lines格式存储,包含420个任务,分布在15个任务族中,如受审批控制的邮件发送、不可逆文件删除、延迟测试失败等。任务基于可重复的随机种子确定性生成,并划分为训练集(240个任务)、验证集(30个)、测试集(60个)、模板保留集(45个)和分布外集(45个),每个任务包含任务ID、模板ID、种子、任务描述、可见状态、候选动作、隐藏状态及反应式动作等字段。
特点
该数据集的核心特点在于其设计的“后果别名”现象:两个从当前可见状态看似合理的候选动作,在未来奖励、可逆性、隐藏状态破坏或审批合规性方面却存在显著差异。这导致无记忆的反应式策略无法在隐藏状态下达到最优,而基于历史的条件模型则能实现更优的规划。数据集的隐藏状态为环境真实状态,仅供环境运行和结果评估使用,规避了向智能体泄漏信息的风险。同时,数据集坦诚地揭示了其评估分割存在词汇重叠,真实泛化能力需通过词汇不相交的套件衡量。
使用方法
使用该数据集时,可通过Python的json模块逐行读取JSON Lines文件,按split字段过滤得到训练、验证或测试子集。用户也可从GitHub仓库中的nanoAWM代码库,通过运行命令行工具确定性重新生成数据集。对于严格的泛化评估,可利用代码库中的泛化阶梯工具生成词汇不相交的套件,以获得模型在未见过的对象名称和动作标记上的真实表现。数据集遵循MIT许可协议,便于研究社区复现和扩展工作。
背景与挑战
背景概述
在智能体与工具交互的研究领域中,世界模型作为一种能够模拟环境动态并为规划提供支撑的架构,正逐渐成为提升自主决策能力的关键。nanoAWM-minios数据集由研究者Jason Lovell于2026年创建,其核心贡献在于提供了一个确定性、符号化的任务套件,旨在系统性地研究工具型智能体在面对隐藏状态时的后果建模能力。该数据集聚焦于后果别名化现象,即从当前可见状态看等价的两个动作,却可能在长期回报、可逆性或隐藏状态破坏上产生显著分歧。这一设定直击现有记忆无关反应策略的局限性,推动了面向隐藏状态的历史条件模型的发展,在智能体规划与工具使用的研究范式中具有独特的影响力。
当前挑战
该数据集所解决的领域问题在于传统反应式策略无法在隐藏状态下实现最优决策,智能体必须具备基于历史信息的后果推理能力。MiniOS通过设计15个任务家族共420个确定性任务,涵盖了审批限制的邮件发送、不可逆文件删除、延迟的测试失败等复杂场景,每个任务均展现出动作间的后果别名化特征。构建过程中的挑战包括确保任务的可复现性与隐蔽状态的真实性,同时需要平衡词汇分离度与泛化能力的评估——由于数据集在词汇层面部分可分离,纯关键词匹配器已能达到近73%的准确率,这迫使研究者必须采用词汇不相交的泛化套件来获得真实的泛化测量,最终学习型规划器在严格泛化条件下得分为0.524,远低于基线,揭示了该领域在克服词汇捷径和实现真正语义推理方面的严峻挑战。
常用场景
经典使用场景
nanoAWM-minios数据集,即MiniOS任务套件,专为研究工具型智能体的世界模型(world model)而设计。其最经典的使用场景在于构建和评估具备隐状态推理能力的规划算法(planner)。数据集模拟了一个确定性的符号化微型操作系统环境,涵盖文件系统、终端、Git、浏览器、数据库、邮件日历、包管理及审批等15个任务族。每个任务都精心构造了'后果混叠'(consequence aliasing)现象:从当前可见观察来看,多个候选行动看似同样合理,但实则导向截然不同的未来奖励、可逆性、隐状态污染或审批合规后果。该场景的核心在于迫使无记忆的反应式策略无法在所有隐状态下达到最优,从而验证一个能够基于历史信息进行后果建模的智能体是否具备更强的决策能力。因此,该数据集是学术界检验和对比不同世界模型架构(如Transformer、状态空间模型)在处理符号化规划任务时泛化能力的标准基准。
衍生相关工作
nanoAWM-minios数据集衍生出了一系列聚焦于符号化隐状态推理与可解释规划的开创性工作。最直接的关联工作是nanoAWM本身,即一个微型、可复现的动作条件世界模型(action-conditioned world model),它完全在MiniOS生成的任务上进行训练,并在词汇泛化(disjoint-vocabulary generalization)评估中仅凭0.524的准确率证明了世界模型相对于反应式标杆(仅0.067)的显著优势,同时揭示了词汇线索与真正因果推理之间的差距。这一基线对比催生了后续对'后果解耦表征学习'(consequence-disentangled representation learning)的研究,旨在让模型不再依赖表面词汇模式。此外,数据集对'后果混叠'现象的明确标注,直接推动了结构化因果模型(如神经符号规划器)在工具使用场景中的引入,相关论文开始探索如何将状态空间模型与显式约束求解器结合以处理高保真规划。还有研究以此为测试床,验证了将其与检索增强生成(RAG)结合,让模型通过外部记忆回溯隐状态,从而在不可逆操作中实现'后悔与回滚'机制。这些衍生工作共同夯实了nanoAWM-minios作为符号化世界模型研究核心基准的地位。
数据集最近研究
最新研究方向
以nanoAWM-minios为代表的MiniOS任务套件,聚焦于工具型智能体在确定性符号环境中进行后果建模与隐状态推理的前沿探索。该数据集精心设计了420个涵盖文件系统、版本控制、数据库迁移等15类场景的任务,核心挑战在于“后果混淆”——当前观测下看似合理的候选行动,其远期奖励、可逆性及隐状态完整性可能截然不同。这一设计直指传统无记忆反应式策略的局限,推动研究者构建基于历史信息的后果模型以应对隐状态下的最优决策。该工作还创新性地引入了词汇解耦泛化评估方法,在剔除训练集词汇特征后,学习型规划器仍能以0.524的得分显著超越基线,揭示了当前智能体在词汇匹配与深层因果推理之间的鸿沟。该数据集为构建具备内隐世界模型与长远规划能力的工具型智能体提供了可复现的标准化测试平台,对推动大语言模型代理的鲁棒性与泛化研究具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务