StuLife
收藏资源简介:
StuLife是一个用于经验驱动终身学习(ELL)的基准数据集,模拟学生从入学到学术和个人发展的整体大学旅程,涵盖三个核心阶段和十个详细子场景。它设计围绕三个关键范式转变:从被动到主动、从上下文到记忆、从模仿到学习,提供一个动态交互环境,其中任务高度互联,关键状态变量(如GPA、课程可用性、顾问关系和时间)根据代理的决策演变。代理必须自主获取实用技能(例如课程注册、调度、导航和沟通),将经验提炼为可重用知识,并维护持久记忆以支持未来决策。
StuLife is a benchmark dataset for experience-driven lifelong learning (ELL). It simulates the holistic college journey of students from enrollment to academic and personal development, encompassing three core stages and ten detailed sub-scenarios. Designed around three key paradigm shifts—from passivity to proactivity, from context to memory, and from imitation to learning—it offers a dynamic interactive environment where tasks are highly interconnected. Key state variables such as GPA, course availability, advisor relationships, and time evolve based on the AI agent’s decisions. The AI agent must autonomously acquire practical skills such as course registration, scheduling, navigation, and communication, distill experiences into reusable knowledge, and maintain persistent memory to support future decision-making.
数据集概述:ELL-StuLife
数据集简介
ELL-StuLife是一个基于Experience-driven Lifelong Learning(ELL)框架构建的基准数据集,用于模拟学生在大学校园中的完整旅程。该数据集旨在评估AI代理的长期记忆、规划、适应和自主决策能力,通过动态交互环境支持持续学习和自我进化。
核心框架:ELL
ELL框架基于四个核心原则构建:
- 经验探索:代理通过与环境的持续交互生成经验数据,支持迭代学习和自我修正。
- 长期记忆:经验数据被系统处理并整合为结构化记忆,支持长期检索和上下文感知推理。
- 技能学习:代理从经验中抽象可重用技能,并通过反思和应用进行验证与管理。
- 知识内化:频繁使用的规则和策略被内化为代理的核心推理过程,减少对外部检索的依赖。
数据集特性
设计原则
- 从被动到主动:代理需自主设定目标并主动行动。
- 从上下文到记忆:依赖持久化记忆而非短期上下文。
- 从模仿到学习:强调从经验中学习和知识提炼。
环境特点
- 持久化世界:校园环境为单一连续Python对象(
CampusEnvironment),所有操作永久改变世界状态。 - 状态化动态子系统:包含多个互联子系统(如日历、课程选择、地理等),状态实时变化。
- 时间驱动与自导向任务:代理需基于模拟时钟自主咨询日历决定行动。
系统架构
CampusEnvironment:世界模拟器,管理所有子系统并维护全局状态,提供统一工具API。CampusTask:任务控制器,加载任务描述并向代理提供上下文,执行代理动作并返回结果。ToolManager:工具管理器,生成tools.json文件,提供可用工具及其用法的机器可读手册。
模拟子系统
- 世界时间与日历系统:管理模拟时间流,支持个人、俱乐部和学术日程管理。
- 地图与地理系统:确定性校园导航系统,代理需先查找建筑ID并规划最优路径。
- 课程选择系统:动态系统,代理可浏览课程、管理草稿日程并使用优先级通行证注册。
- 预订系统:全局房间和设施预订系统,成功预订永久改变未来任务的可用性。
- 邮件与信息系统:支持发送格式化邮件和查询校园信息数据库。
任务规模与范围
数据集包含1284个任务,覆盖完整学年,涵盖以下场景:
- 学术诚信与规则学习
- 校园探索与设施定位
- 课程选择与日程管理
- 参加8门不同多会话课程
- 与学术顾问互动
- 图书馆资源使用与座位预订
- 期中与期末考试
- 加入并参与学生俱乐部
评估方法
任务成功需满足:
- 状态验证:最终环境状态与任务真实状态匹配。
- 约束满足:所有隐式和显式任务约束得到满足。
- 行为序列验证:复杂任务中代理遵循逻辑行动序列。
实验运行
环境要求
- Conda:用于环境管理
- CUDA:支持GPU加速
运行步骤
- 激活Conda环境并进入项目根目录
- 配置环境变量(包括Hugging Face离线模式、CUDA路径等)
- 执行实验脚本: bash python ./src/run_experiment.py --config_path "../task_data/config/run_local_test.yaml"
数据集目标
提供全面平台评估终身学习能力,包括记忆保留、技能迁移和自主目标导向行为,同时探索上下文工程在AGI发展中的作用。



