arc-agi3-agy-gemini3.1pro-tr87
收藏资源简介:
本数据集记录了agy-gemini3.1pro代理在ARC-AGI-3游戏tr87中的游戏轨迹,属于ARA-as-world-model泛化实验的一部分。代理在游戏过程中实时构建结构化世界模型(称为Agent-Native Research Artifact),并利用该模型解决无法通过冷探索破解的关卡。数据集采用每个harness×模型×游戏组合对应一个独立仓库的组织方式,便于不同代理组合之间的比较。数据在游戏过程中持续同步,每当世界模型结晶化时就会推送更新。数据集包含多个结构化目录:reasoning/(代理的世界模型和推理轨迹)、traces/(每个子代理的动作-推理轨迹,每行动作对应一条JSON行)、solutions/(进度快照和获胜动作脚本)、recordings/(会话级别的帧级录制)、episodes/(回合级别的剧集日志)、logs/(工具链日志和会话笔记)、scorecards/(ARC API评分卡)、predictions.jsonl(世界模型预测账本)、accounting/(资源消耗统计和ARA增长曲线)、demo/(消融研究和展示工件)以及索引文件。仓库使用L<n>-cleared标签标记每个关卡通关时的完整记录,为下游代理评估实验提供保持就绪的快照。
数据集概述
数据集名称: ARC-AGI-3 tr87 Agent Trajectories (agy-gemini3.1pro)
许可证: cc-by-4.0
任务类别: 强化学习、其他
语言: 英文
标签: arc-agi, arc-agi-3, agent-trajectories, game-playing, llm-agent, world-model
数据集描述: 该数据集包含了 harness×model 对 agy-gemini3.1pro 在 ARC-AGI-3 游戏 tr87 中的游戏轨迹。该智能体在游戏过程中实时构建结构化世界模型(Agent-Native Research Artifact),并借助该模型解决在冷探索中无法攻克的关卡。
数据集结构:
reasoning/ara-tr87/: 智能体的世界模型及推理轨迹,包含logic/、trace/、staging/子目录。traces/: 每个子智能体的动作-推理轨迹,每个动作一行 JSON,附带原因。solutions/GAME.md: 状态快照,包含进度、机制、难点和搁置原因。solutions/replay/: 每关获胜动作脚本(文件名为L<n>.txt)。recordings/: 帧级录制文件,每个会话一个文件(文件名格式为<game>-<hash>.<agent>.<guid>.recording.jsonl)。episodes/: 回合级事件日志(跨运行拼接)。logs/: harness 日志及自由格式会话笔记(Git 历史保留先前会话)。scorecards/: ARC API 记分卡(如有保存)。predictions.jsonl: 世界模型预测台账,包含咨询记录、置信度及后续验证结果。accounting/: 该游戏的台账行(Token/步骤)、指标部分、ARA 增长曲线。demo/: 消融/展示制品(如有)。sessions_index.json: 每个录制会话的条目,包含智能体、GUID、帧数和最终状态。manifest.json: 溯源信息,包含 harness×model ID、智能体模型、仓库提交、协议哈希和同步时间。
标签用途: 仓库标签 L<n>-cleared 标记每次关卡通关时的完整记录,供下游智能体评估实验作为 holdout 快照使用。
注意事项: 动作间间隔、死亡取证和惊喜分析均可从录制文件和轨迹中衍生,未单独存储。





