遇见数据集

osunlp/ACuRL

收藏
Hugging Face2026-06-07 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含由ACuRL(自主课程强化学习框架)生成的课程任务,用于使计算机使用代理能够持续适应目标环境,无需人类数据。数据集分为两个部分:qwen3vl和uitars,分别对应两个基础代理:Qwen3-VL-8B-Instruct和UI-TARS-1.5-7B。每个部分包含4,608个自然语言任务,每个任务针对特定环境和课程迭代生成。数据源涵盖多个环境,如LibreOffice Impress、Calc、Writer、Thunderbird、Celestia和KAlgebra,每个数据源包含768个任务,组织为3个课程迭代(迭代1、2、3),每个迭代256个任务。数据集列包括data source(数据源,表示环境)、iteration(迭代,表示课程迭代编号)和task(任务,表示生成的自然语言任务)。

This dataset contains curriculum tasks generated by ACuRL, an Autonomous Curriculum Reinforcement Learning framework for continually adapting computer-use agents to target environments with zero human data. The dataset includes two splits, qwen3vl and uitars, corresponding to two base agents: Qwen3-VL-8B-Instruct and UI-TARS-1.5-7B. Each split contains 4,608 natural-language tasks generated for specific environments and curriculum iterations. Data sources include environments such as LibreOffice Impress, Calc, Writer, Thunderbird, Celestia, and KAlgebra, with each data source containing 768 tasks organized into 3 curriculum iterations (iteration 1, 2, 3), each with 256 tasks. Dataset columns are data source (indicating the environment), iteration (indicating the curriculum iteration number), and task (indicating the generated natural-language task).

提供机构:
osunlp
搜集汇总
数据集介绍
osunlp/ACuRL 数据集图片
构建方式
ACuRL数据集由自主课程强化学习框架ACuRL生成,旨在为零人工数据条件下持续适应目标环境的计算机使用智能体提供训练素材。数据集包含两个子集,分别对应Qwen3-VL-8B-Instruct与UI-TARS-1.5-7B两种基础智能体,所有课程任务均基于GPT-5模型生成。每个子集涵盖六个环境(LibreOffice Impress、LibreOffice Calc、LibreOffice Writer、Thunderbird、Celestia、KAlgebra),每个环境包含三个课程迭代轮次,每轮生成256个任务,共计4608个自然语言任务。
特点
该数据集的核心特点在于其结构化的课程设计,通过分环境、分迭代的方式组织任务,模拟了从简单到复杂的渐进式学习路径。每个任务均为针对特定图形用户界面的自然语言指令,覆盖办公软件、通讯工具及科学模拟等多种应用场景。数据集的规模适中,总数在1K至10K之间,兼顾了覆盖范围与计算效率。此外,数据集由前沿大语言模型GPT-5生成,确保了任务的质量与多样性,为强化学习环境下的智能体适应能力研究提供了标准化的基准。
使用方法
用户可通过HuggingFace的datasets库直接加载Parquet格式数据集,指定子集名称(如qwen3vl或uitars)即可获取对应数据。每个样本包含数据来源环境、课程迭代轮次及任务描述三个字段。亦可通过Pandas的read_parquet方法读取文件,并利用groupby操作按环境和迭代轮次进行统计分析。该数据集特别适用于训练和评估基于强化学习的GUI智能体,支持跨环境的零样本迁移与持续学习能力研究,其开放接口便于集成至现有工作流。
背景与挑战
背景概述
在人工智能领域,智能体在复杂图形用户界面(GUI)环境中执行任务的能力成为研究热点,尤其是计算机使用代理需在多样化的软件生态中持续适应与学习。ACuRL数据集由俄亥俄州立大学NLP研究组的Tianci Xue、Zeyi Liao、Tianneng Shi等人于2026年创建,核心研究问题在于如何实现计算机使用代理在零人类数据条件下持续适应目标环境。该数据集通过自主课程强化学习框架生成,覆盖LibreOffice Impress、Calc、Writer、Thunderbird、Celestia及KAlgebra六类环境,按三个课程迭代阶段组织任务,为后续相关工作提供了标准化的课程学习基准,显著推动了GUI智能体在环境泛化与自主适应领域的发展。
当前挑战
ACuRL数据集所解决的领域问题核心挑战在于计算机使用代理在零人类标注数据下的环境适应问题。传统强化学习方法依赖大量人工反馈或预定义奖励函数,难以泛化至LibreOffice、邮件客户端或天文模拟软件等异构且动态的GUI环境。同时,构建过程中面临两大挑战:一是如何设计自主课程生成机制,使代理能从简单操作逐步过渡至复杂多步任务,而无需人工介入任务分解;二是需确保生成的4,608个任务在六个数据源间保持难度递进与内容多样性,避免任务重复或跳跃,这对课程迭代算法的鲁棒性与泛化能力提出了严苛要求。
常用场景
经典使用场景
ACuRL数据集专为持续学习与强化学习背景下的计算机使用代理(computer-use agents)设计,其经典使用场景在于为代理提供一种自适应的课程学习框架,使其能够在缺乏人类标注数据的情况下,逐步适应目标环境中的复杂图形用户界面(GUI)操作任务。该数据集涵盖LibreOffice套件(如Impress、Calc、Writer)、Thunderbird邮件客户端、Celestia天文模拟软件以及KAlgebra数学工具等多类桌面环境,每个环境均包含三轮课程迭代生成的多样化自然语言任务,共计4608条。研究者可基于此数据集,训练代理从简单任务向复杂任务渐进迁移,从而评估和提升模型在真实软件交互中的泛化能力与学习效率。
实际应用
在实际应用中,ACuRL数据集为自动化办公、软件测试辅助以及智能辅助系统的开发提供了坚实的数据基础。例如,企业可基于该数据集训练能够自动操作电子表格、演示文稿或邮件客户端的代理,实现日常办公流程的自动化执行与故障恢复。在天文教育和科学计算领域,代理可学习操作Celestia或KAlgebra等专业软件,辅助教学演示或科研数据可视化。由于任务生成过程无需人工干预,该数据集尤其适合需要快速适配新软件版本或定制化工作流的场景,显著降低了人力维护成本,并支持代理在更新后的环境中实现自我进化与持续优化。
衍生相关工作
ACuRL数据集的提出催生了一系列具有前瞻性的研究工作,尤其在自主课程学习与环境适应领域形成了清晰的脉络。其中,该框架所依赖的课程迭代机制启发研究者探索更高效的任务难度评估指标与动态调度策略,进而衍生出基于元学习或多任务学习的代理初始化方法。此外,针对GUI代理在真实软件中的漂移现象,后续工作借鉴ACuRL的零数据适应理念,开发了基于感知反馈的自监督校正模块。在模型层面,基于Qwen3-VL和UI-TARS的多模态骨干网络被进一步优化,以适配课程任务中的视觉与语义双通道信息,推动了视觉-语言模型在持续学习场景下的理论突破与应用延伸。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务