遇见数据集

asil-training-data

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

ASIL 训练数据集(ASIL Training Data)是为论文《ASIL: 用结构化状态和语义操作替代截图与点击》(被 EMNLP 2026 Findings 接收)所发布的训练数据。该数据集主要用于训练 GUI 智能体,涵盖监督微调(SFT)和强化学习(RL)阶段。数据集包含四个子集: - sft_v0:基于 ASIL 动作轨迹回放的 SFT 数据,包含 1,556 条训练样本和 138 条验证样本。 - guided_v2:基于引导式智能体 v2 的 SFT 数据,包含 2,330 条训练样本和 594 条验证样本。 - merged_v0_v2:sft_v0 与 guided_v2 经过精确去重后的合并数据集,用于选定的 9B 模型 SFT 训练,包含 2,886 条训练样本和 732 条验证样本。 - rl_learnable_v4_320_80:用于 RL 课程学习的评估器支撑数据,包含 320 条训练样本和 80 条验证样本。 所有子集均提供 JSONL 和 Parquet 两种格式。数据语言为英语,许可证为 CC BY 4.0。该数据集适用于文本生成任务,特别面向 GUI 智能体的 SFT 和 RL 训练场景。

ASIL Training Data is the training data released for the paper ASIL: Screenshots and Clicks Replaced with Structured State and Semantic Operations (accepted by EMNLP 2026 Findings). This dataset is mainly used for training GUI agents, covering supervised fine-tuning (SFT) and reinforcement learning (RL) stages. The dataset contains four subsets: sft_v0 (SFT data based on ASIL action trajectory replay, containing 1,556 training samples and 138 validation samples), guided_v2 (SFT data based on guided agent v2, containing 2,330 training samples and 594 validation samples), merged_v0_v2 (the merged dataset of sft_v0 and guided_v2 after exact deduplication, used for SFT training of selected 9B models, containing 2,886 training samples and 732 validation samples), and rl_learnable_v4_320_80 (evaluator support data for RL curriculum learning, containing 320 training samples and 80 validation samples). All subsets are provided in JSONL and Parquet formats. The data language is English, and the license is CC BY 4.0. This dataset is suitable for text generation tasks, especially for SFT and RL training scenarios of GUI agents.

创建时间:
2026-08-26
原始信息汇总

ASIL 训练数据集概述

基本信息

数据集内容

该数据集包含 ASIL(以结构化状态和语义操作替代截图点击)模型的训练数据,共分为四个目录,每个目录提供 JSONL 和 Parquet 两种格式(RL 目录额外包含 JSON 索引):

目录 用途 训练集行数 验证集行数 格式
sft_v0/ 重放的 ASIL 动作轨迹 SFT 数据 556 138 JSONL, Parquet
guided_v2/ 智能体引导的 v2 SFT 数据 2,330 594 JSONL, Parquet
merged_v0_v2/ 精确去重后的合并数据(用于选定的 9B SFT 运行) 2,886 732 JSONL, Parquet
rl_learnable_v4_320_80/ 发布的可学习 RL 课程(基于评估器) 320 80 JSONL, JSON 索引

补充说明

  • guided_v2/guided_v2_all.jsonl 包含全部 2,924 行 guided-v2 数据。
  • 合并分割由 sft_v0 和 guided-v2 经过精确去重后组合而成。
  • RL 行和索引为发布运行所使用的最终 320/80 可学习课程。

数据加载示例

python from datasets import load_dataset

dataset = load_dataset( "sharryXR/asil-training-data", data_files={ "train": "merged_v0_v2/train.parquet", "validation": "merged_v0_v2/valid.parquet", }, )

文件说明

  • dataset_manifest.json 提供各分区的行数、大小、公开来源及 SHA-256 值。
  • SHA256SUMS 覆盖所有发布的数据和元数据文件。

相关资源

  • 代码:https://github.com/sharryXR/ASIL
  • 基准数据集:https://huggingface.co/datasets/sharryXR/asil-benchmark
  • 模型集合:https://huggingface.co/collections/sharryXR/asil-models-6a1e9faf39fe6ce4eb4626e1

许可证说明

发布的训练数据和文档采用 CC BY 4.0 许可证;模型检查点仍受其基础模型许可证约束。

搜集汇总
数据集介绍
asil-training-data 数据集图片
构建方式
该数据集是ASIL研究项目的核心训练资源,旨在通过结构化状态与语义操作取代传统的截图与点击交互模式。其构建过程精细且多维,包含四个主要子集:sft_v0为基于ASIL操作轨迹的重放数据,共计556条训练样本;guided_v2为代理引导式监督微调数据,规模达2,330条;merged_v0_v2则是对前两者进行精确去重后的合并版本,总计2,886条,用于最终9B模型的监督微调;rl_learnable_v4_320_80则提供了320条基于评估器反馈的强化学习课程数据。整个构建流程严格遵循数据质量保障,所有文件均提供SHA-256校验值,并附有包含行数、大小与来源的清单文件,确保可追溯性与可复现性。
特点
该数据集的最大特色在于其多阶段、多模态的训练设计,覆盖了从监督微调到强化学习的完整训练管线。sft_v0与guided_v2分别从不同角度捕捉ASIL代理的行为模式,前者侧重于原始操作轨迹的重放,后者则引入更智能的引导策略。合并版本通过精确去重,消除了冗余样本,提升了数据效率。强化学习子集则特别注重可学习课程的构建,其320/80的划分充分考虑了训练与验证的平衡。此外,所有数据均以JSONL和Parquet双格式提供,兼顾了人类可读性与机器处理的高效性,体现了数据集在灵活性与标准化之间的巧妙平衡。
使用方法
数据集的使用极为便捷,支持直接通过HuggingFace的datasets库加载。用户可灵活指定数据文件路径,例如使用merged_v0_v2目录下的train.parquet与valid.parquet快速构建训练集与验证集。同时,数据集的模块化结构允许研究者根据任务需求选择不同的子集,或组合使用以设计更复杂的训练流程。所有数据均依据CC BY 4.0许可发布,仅需遵守相应的引用要求即可自由使用。为促进更深度的探索,配套提供了源码仓库、评估基准和模型集合,形成了一套完整的研究生态,极大便利了学术研究与工业应用。
背景与挑战
背景概述
随着软件智能体与图形用户界面(GUI)交互研究的深化,传统依赖截图与坐标点击的范式在可扩展性与泛化性上遭遇瓶颈。为突破这一局限,ASIL(Action-Structured Interaction Language)框架应运而生,由sharryXR团队于EMNLP 2026提出,其核心在于以结构化状态表示替代像素级输入,以语义化动作替代低级鼠标操作,从而提升智能体对界面理解与任务执行的鲁棒性。为支撑该框架的训练与评估,团队发布了ASIL训练数据集,涵盖监督微调(SFT)与强化学习(RL)两阶段数据,包含重放动作轨迹、智能体引导轨迹及去重后的合并集,并配备严格的哈希校验以确保数据完整性。该数据集不仅为ASIL模型提供了高质量的训练语料,也为GUI智能体研究开辟了新的数据范式,对提升智能体在复杂界面环境中的适应能力具有重要推动作用。
当前挑战
该数据集所面临的挑战多维且深刻。在领域层面,传统截图-点击方法难以捕捉动态界面状态与用户意图间的隐式关联,导致智能体在未知界面上的泛化能力薄弱,而ASIL通过结构化状态与语义动作的映射,要求模型在更高抽象层次上推理,这对训练数据的语义丰富度与场景覆盖率提出了严苛要求。在数据构建层面,SFT数据的获取需依赖复杂的轨迹收集与清洗流程,从日志中重构动作序列并过滤噪声;强化学习数据的生成则需设计可学习的课程策略,平衡探索与利用,同时确保评估器反馈的准确性。此外,多来源数据的去重合并(如sft_v0与guided_v2)需处理冗余与冲突,保证数据一致性,而数据规模(总计约2000余条)在维持多样性与减少偏差间寻求平衡,对训练效率和模型性能构成双重考验。
常用场景
经典使用场景
ASIL训练数据集作为图形用户界面智能体领域的开创性资源,其经典使用场景聚焦于训练能够理解结构化状态与语义动作的软件代理。该数据集摒弃了传统的像素级截图与坐标点击范式,转而为模型提供高度抽象的环境表征与高层次操作指令,使研究者能够以监督微调(SFT)和强化学习(RL)两种主流范式构建具备自主决策能力的GUI智能体。其精心划分的SFT与RL梯队,不仅支持从行为克隆到课程化强化学习的渐进式训练流程,更成为验证新型智能体架构、对比不同学习策略效能的基准性语料。
解决学术问题
该数据集直面传统GUI智能体在泛化性、样本效率与长期规划能力上的痼疾。通过引入结构化状态与语义动作的表述体系,它有效缓解了模型对界面视觉细节的过拟合,提升了跨应用、跨平台迁移的鲁棒性。同时,这一范式显著压缩了动作空间的复杂度,使得模型能够凭借更少的交互步骤完成复杂任务,为学术研究提供了探索高效智能体学习机制的理想实验场。其发布不仅推动了语义级环境建模的理论发展,更为可解释、可迁移的智能体决策研究奠定了坚实的数据基石。
衍生相关工作
该数据集的问世催生了一系列影响深远的相关工作。一方面,它激励了针对结构化状态表示学习的深入研究,衍生出更高效的环境编码器与状态抽象方法。另一方面,其语义动作空间的设计启发了后续工作探索层次化、模块化动作原语库的构建,以增强智能体的可扩展性。此外,该数据集所驱动的强化学习课程体系,也促进了逆强化学习、离线RL等算法在GUI领域的新应用。这些衍生工作共同绘制了GUI智能体从感知走向认知的演进图谱,持续推动着该领域的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务