遇见数据集
官方服务:

资源简介:

ACuRL Curriculum Tasks数据集包含由ACuRL(自主课程强化学习框架)生成的课程任务,旨在使计算机使用智能体在零人类数据的情况下持续适应目标环境。该数据集专为文本生成和强化学习任务设计,特别适用于计算机使用智能体、课程学习和GUI智能体的研究与开发。数据集包含两个分片:qwen3vl和uitars,分别对应两个基础智能体(Qwen3-VL-8B-Instruct和UI-TARS-1.5-7B)。每个分片包含总计4,608个自然语言任务,这些任务由GPT-5生成,涵盖六个环境:libreoffice_impress、libreoffice_calc、libreoffice_writer、thunderbird、Celestia和KAlgebra。每个环境的数据进一步组织为三个课程迭代(iteration 1、2、3),每个迭代包含256个任务,因此每个数据源总计768个任务。数据集以表格形式存储,包含三个字段:data source(表示任务所属的环境)、iteration(表示课程迭代编号)和task(表示生成的特定自然语言任务描述)。数据规模属于1K到10K之间,适用于训练和评估计算机使用智能体在不同软件环境中的适应性。

The ACuRL Curriculum Tasks dataset comprises curriculum tasks generated by the ACuRL (Autonomous Curriculum Reinforcement Learning) framework, which aims to enable computers to use intelligent agents to continuously adapt to target environments with zero human data. This dataset is specifically designed for text generation and reinforcement learning tasks, and is particularly suitable for research and development of computer-using agents, curriculum learning, and GUI agents. The dataset contains two splits: qwen3vl and uitars, corresponding to two base agents, Qwen3-VL-8B-Instruct and UI-TARS-1.5-7B, respectively. Each split contains a total of 4,608 natural language tasks generated by GPT-5, covering six environments: libreoffice_impress, libreoffice_calc, libreoffice_writer, thunderbird, Celestia, and KAlgebra. The data for each environment is further structured into three curriculum iterations (Iteration 1, 2, and 3), with 256 tasks per iteration, resulting in a total of 768 tasks per data source. The dataset is stored in tabular format, including three fields: "data source" (denoting the environment to which the task belongs), "iteration" (denoting the curriculum iteration number), and "task" (denoting the generated specific natural language task description). The dataset has a scale ranging from 1K to 10K, and is suitable for training and evaluating the adaptability of computer-using agents across various software environments.

提供机构:
OSU NLP Group
创建时间:
2026-06-07
原始信息汇总

数据集概述:ACuRL Curriculum Tasks

  • 数据集名称:ACuRL Curriculum Tasks
  • 所属组织:osunlp
  • 语言:英语(en)
  • 许可证:其他(other)
  • 任务类别:文本生成(text-generation)、强化学习(reinforcement-learning)
  • 标签:computer-use-agents、curriculum-learning、reinforcement-learning、gui-agents、acurl
  • 数据集大小:1K < n < 10K

数据集描述

该数据集包含了由 ACuRLAutonomous Curriculum Reinforcement Learning)框架生成的课程任务。ACuRL 是一个自主课程强化学习框架,旨在持续将计算机使用代理适应到目标环境中,无需任何人工数据。

数据集划分

数据集包含两个划分(splits),分别对应两个基础代理:

划分名称 对应代理
qwen3vl Qwen3-VL-8B-Instruct
uitars UI-TARS-1.5-7B

两个划分中的课程任务均由 GPT-5 生成。每个划分包含 4,608 个任务。对于每个划分,每个数据源包含 768 个任务,组织为 3 个课程迭代,每个迭代 256 个任务。

数据列

列名 描述
data source 环境名称:libreoffice_impresslibreoffice_calclibreoffice_writerthunderbirdCelestiaKAlgebra
iteration 课程迭代次数,取值为 123
task 生成的任务描述(自然语言)

数据加载示例

  • 使用 datasets 库加载

python from datasets import load_dataset

ds = load_dataset( "parquet", data_files={ "qwen3vl": "qwen3vl/impress_calc_writer_thunderbird_celestia_kalgebra_iter1_3_tasks.parquet", "uitars": "uitars/impress_calc_writer_thunderbird_celestia_kalgebra_iter1_3_tasks.parquet", }, ) print(ds["qwen3vl"][0])

  • 直接读取 Parquet 文件

python import pandas as pd

df = pd.read_parquet("qwen3vl/impress_calc_writer_thunderbird_celestia_kalgebra_iter1_3_tasks.parquet") print(df.groupby(["data source", "iteration"]).size())

相关资源

  • 论文:https://arxiv.org/abs/2602.10356
  • GitHub 仓库:https://github.com/OSU-NLP-Group/ACuRL
  • 模型集合:https://huggingface.co/collections/osunlp/acurl

引用

如果该数据集或相关资源对您的研究有帮助,请引用 ACuRL(引用格式见 README 中的 BibTeX 条目)。

搜集汇总
数据集介绍
ACuRL 数据集图片
构建方式
ACuRL数据集的构建源于一套名为ACuRL的自主课程强化学习框架,旨在实现计算机使用代理在零人类数据条件下对目标环境的持续适应。该数据集包含两个划分,分别基于Qwen3-VL-8B-Instruct和UI-TARS-1.5-7B两种基础代理,并由GPT-5生成课程任务。所有任务覆盖六个环境源,包括LibreOffice Impress、Calc、Writer、Thunderbird、Celestia及KAlgebra,每个数据源包含768个任务,分为三轮课程迭代,每轮迭代产出256个任务,最终每个划分总计4608个自然语言描述的任务。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,例如使用load_dataset函数指定parquet格式文件并选择qwen3vl或uitars划分。也可借助Pandas直接读取Parquet文件,并通过分组操作按数据源和迭代轮次统计任务分布。数据集适用于训练和评估计算机使用代理在持续学习场景下的表现,尤其适合研究课程学习策略对环境适应性的影响,研究者可将其作为基准任务集来测试模型的多环境泛化能力。
背景与挑战
背景概述
ACuRL数据集由俄亥俄州立大学自然语言处理研究团队与多位合作者于2026年提出,旨在解决计算机使用代理(computer-use agents)在目标环境中持续适应与自主探索的核心问题。该数据集依托ACuRL框架——一种无需人工标注数据的自主课程强化学习方法——通过GPT-5生成跨越六个桌面环境(如LibreOffice套件、Thunderbird、Celestia)的课程任务,涵盖三个迭代轮次,共计9,216条自然语言指令。ACuRL聚焦于代理在动态操作界面中的零样本适应能力,填补了具身智能体在课程学习与持续强化学习交叉领域的数据空白,为学术社区提供了评估代理环境泛化性的标准化基准,其影响力延伸至人机交互、自动化办公及教育游戏等应用方向。
当前挑战
ACuRL所应对的核心挑战源于计算机使用代理领域的两大难题:其一,现有模型在未见过的新型或变体GUI环境中普遍表现退化,亟需一种无需人类干预的机制来自动构造难度渐进的任务序列,以驱动代理的持续学习与行为纠正;其二,课程学习方法在代理探索过程中可能遭遇任务分布偏移与探索奖励稀疏的问题,导致学习效率低下。在数据构建层面,ACuRL面临的环境异构性使得任务生成需兼顾跨应用逻辑的一致性(如从文字处理器到电子表格的指令风格差异)与多迭代轮次间的难度递增可控性,同时依赖封闭源大模型(GPT-5)生成任务增加了可复现性与开放科学方面的挑战。
常用场景
经典使用场景
在智能体与图形用户界面交互的研究领域中,ACuRL数据集被广泛用于训练和评估计算机操作智能体的持续适应能力。该数据集由自主课程强化学习框架生成,包含来自LibreOffice系列、Thunderbird、Celestia及KAlgebra等多个真实桌面环境的自然语言任务。经典使用方式是将这些任务作为智能体训练的课程学习数据,使其从简单操作逐步过渡到复杂多步任务,最终掌握目标环境的操作规律。研究者通常利用该数据集的多轮迭代结构,验证智能体在零人工标注条件下实现环境泛化的能力,尤其是在界面布局、交互逻辑发生变化的场景中展现出持续学习的潜力。
解决学术问题
ACuRL数据集着力解决计算机操作智能体在真实环境中面临的核心学术挑战,即如何在缺乏人工标注的情况下实现持续适应与泛化。传统的智能体训练依赖大量预先定义的人类示范,难以应对环境更新或界面变动导致的分布偏移。该数据集通过课程强化学习框架生成的渐进式任务,为研究智能体的环境适应性、任务迁移性以及零样本泛化能力提供了标准化的评估基准。其重要意义在于提出了一个可复现的研究范式,将课程学习与强化学习有机结合,推动了对持续学习机制的理解,并为后续研究者在动态桌面环境中探索智能体自主进化奠定了坚实基础。
实际应用
在实际应用层面,ACuRL数据集为开发能够自主操作软件的智能助手提供了关键训练资源。基于该数据集训练的模型可部署于办公自动化场景,自动完成电子表格数据整理、演示文档编辑、邮件客户端管理等日常任务。在科学计算领域,面向Celestia天文模拟软件的训练任务能够支持智能体对复杂科学工具进行自主操控。此外,该数据集还可应用于软件测试自动化,通过智能体模拟用户行为来检测图形界面异常或功能故障。这些应用显著降低了人力介入的成本,提升了软件操作流程的智能化水平,为构建通用型计算机使用助手奠定了数据基础。
数据集最近研究
最新研究方向
ACuRL数据集聚焦于自主课程强化学习框架,旨在让计算机使用智能体在零人工数据条件下持续适应目标环境。其最新研究前沿在于通过GPT-5生成的多轮课程任务(横跨LibreOffice、Thunderbird、Celestia等六个环境),驱动智能体在图形界面操作中实现渐进式能力泛化。这一方向直接响应了大模型时代GUI自动化代理面临的动态环境适配瓶颈——传统的静态数据集难以覆盖真实部署中的操作多样性。关联热点事件包括各科技巨头竞相开发通用型电脑操作助手,而ACuRL提出的自治式连续学习范式,通过量化评估智能体跨迭代的任务完成质量,为突破少样本环境适应难题提供了可扩展的基准,对推动人机协作界面智能化的实用落地具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务