遇见数据集

cua-lite/UI-Genie-Agent-16k

收藏
Hugging Face2026-04-20 更新2026-04-26 收录
官方服务:

资源简介:

--- license: other tags: - cua-lite - gui - sft task_categories: - image-text-to-text configs: - config_name: default data_files: - split: train path: - "*/*/train*parquet" - "*/*/train/*.parquet" - "*/*/train/*/*.parquet" - split: validation path: - "*/*/validation*parquet" - "*/*/validation/*.parquet" - "*/*/validation/*/*.parquet" - config_name: mobile-trajectory data_files: - split: train path: - "mobile/trajectory/train*parquet" - "mobile/trajectory/train/*.parquet" - "mobile/trajectory/train/*/*.parquet" - split: validation path: - "mobile/trajectory/validation*parquet" - "mobile/trajectory/validation/*.parquet" - "mobile/trajectory/validation/*/*.parquet" --- # cua-lite/UI-Genie-Agent-16k cua-lite preprocessed version of UI-Genie-Agent-16k (HanXiao1999/UI-Genie-Agent-16k). Android trajectory data combining AMEX-sourced episodes (amex variant) and newly collected UI-Genie episodes (ui_genie variant). ## Origin - [https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k](https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k) ## Load via `datasets` ```python from datasets import load_dataset # entire dataset ds = load_dataset("cua-lite/UI-Genie-Agent-16k") # just one (platform, task_type) cohort ds = load_dataset("cua-lite/UI-Genie-Agent-16k", "mobile-trajectory") ``` You can also filter by `metadata.platform` / `metadata.task_type` / `metadata.others.*` after loading; every row carries a rich `metadata` struct (see schema below). ## Schema Each row has these columns: | column | type | notes | |---|---|---| | `image_ids` | list[string] | content-addressed ids (`<sha256>.<ext>`), enables cross-parquet / cross-dataset dedup | | `images` | list[Image] | bytes embedded at HF push time; matches `image_ids` index-for-index | | `messages` | list[struct] | OpenAI-style turns with `role` + structured `content` | | `metadata` | struct | `{platform, task_type, split, others{...}}` | Coordinate values in `messages` are normalized to `[0, 1000]` integers. ## Layout ``` <platform>/<task_type>/<split>.parquet # single-variant cohort <platform>/<task_type>/<split>/<variant>.parquet # multi-variant cohort <platform>/<task_type>/<split>/shard-NNNNN-of-NNNNN.parquet # + sharded single-variant <platform>/<task_type>/<split>/<variant>/shard-NNNNN-of-NNNNN.parquet # + sharded multi-variant ``` - `platform` ∈ {desktop, mobile, web} - `task_type` directory uses a hyphen where the metadata value uses a colon: `grounding-action/` → `grounding:action` - `split` ∈ {train, validation} — `validation` is an in-distribution held-out slice (never used in training); `test` is reserved for out-of-distribution benchmark datasets ## Stats | platform | task_type | variant | train | validation | |---|---|---|---:|---:| | mobile | trajectory | amex | 2,934 | 43 | | mobile | trajectory | ui_genie | 1,761 | 25 | ## Image storage Images are content-addressed by SHA-256 and deduplicated within this repo. The `images` column on HuggingFace embeds raw bytes so the Hub viewer renders thumbnails and `datasets.load_dataset` works out of the box. For local workflows (SFT export, cross-dataset dedup, split rebalancing), run [`reverse.py`](https://github.com/cua-lite/cua-lite/tree/main/scripts/hf_upload) on a cloned repo: it extracts each unique `image_id` once to a shared `image_store/<hash[:2]>/<hash>.<ext>` and rewrites the parquets to drop the `images` column, so rows reference images by hash id only. The shared store is reusable across datasets — the same image in two repos lands in one file. - Total unique images: **46,431** - Store size: **37.16 GB** ## Notes _(none)_ ## License & citation See original dataset (HanXiao1999/UI-Genie-Agent-16k) See https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k

许可证:其他 标签: - cua-lite - 图形用户界面(Graphical User Interface, GUI) - 监督微调(Supervised Fine-Tuning, SFT) 任务类别: - 图像-文本转文本 配置项: - 配置名称:default 数据文件: - 训练集(split: train):路径为`*/*/train*parquet`、`*/*/train/*.parquet`、`*/*/train/*/*.parquet` - 验证集(split: validation):路径为`*/*/validation*parquet`、`*/*/validation/*.parquet`、`*/*/validation/*/*.parquet` - 配置名称:mobile-trajectory 数据文件: - 训练集(split: train):路径为`mobile/trajectory/train*parquet`、`mobile/trajectory/train/*.parquet`、`mobile/trajectory/train/*/*.parquet` - 验证集(split: validation):路径为`mobile/trajectory/validation*parquet`、`mobile/trajectory/validation/*.parquet`、`mobile/trajectory/validation/*/*.parquet` # cua-lite/UI-Genie-Agent-16k 本数据集为UI-Genie-Agent-16k(HanXiao1999/UI-Genie-Agent-16k)的cua-lite预处理版本。其包含结合了美国运通(American Express, AMEX)来源交互片段(amex变种)与新采集的UI-Genie交互片段(ui_genie变种)的安卓轨迹数据。 ## 来源 - [https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k](https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k) ## 加载方式 使用`datasets`库加载: python from datasets import load_dataset # 加载完整数据集 ds = load_dataset("cua-lite/UI-Genie-Agent-16k") # 仅加载指定(平台、任务类型)队列 ds = load_dataset("cua-lite/UI-Genie-Agent-16k", "mobile-trajectory") 你也可在加载完成后,基于`metadata.platform` / `metadata.task_type` / `metadata.others.*`进行筛选;每一行数据均包含丰富的`metadata`结构体(详见下文数据结构说明)。 ## 数据结构 每一行数据包含以下列: | 列名 | 数据类型 | 说明 | |---|---|---| | `image_ids` | 字符串列表 | 内容寻址标识符(`<sha256>.<ext>`),支持跨Parquet文件、跨数据集去重 | | `images` | 图像列表 | 在Hugging Face Hub上传时嵌入的原始字节数据,与`image_ids`按索引一一对应 | | `messages` | 结构体列表 | 遵循OpenAI格式的对话轮次,包含`role`与结构化的`content`字段 | | `metadata` | 结构体 | 格式为`{platform, task_type, split, others{...}}` | `messages`中的坐标值已归一化为`[0, 1000]`范围内的整数。 ## 文件布局 <platform>/<task_type>/<split>.parquet # 单变种队列 <platform>/<task_type>/<split>/<variant>.parquet # 多变种队列 <platform>/<task_type>/<split>/shard-NNNNN-of-NNNNN.parquet # 分片单变种队列 <platform>/<task_type>/<split>/<variant>/shard-NNNNN-of-NNNNN.parquet # 分片多变种队列 - `platform` 可选取值集合:{desktop, mobile, web}(桌面端、移动端、网页端) - 任务类型目录使用连字符替代元数据值中的冒号:例如`grounding-action/`对应元数据中的`grounding:action` - 数据拆分(split)可选取值集合:{train, validation} —— `validation`为分布内保留测试子集(不用于训练);`test`留作分布外基准数据集使用 ## 数据统计 | 平台 | 任务类型 | 变种 | 训练集样本数 | 验证集样本数 | |---|---|---|---:|---:| | mobile(移动端) | trajectory(轨迹) | amex | 2,934 | 43 | | mobile(移动端) | trajectory(轨迹) | ui_genie | 1,761 | 25 | ## 图像存储 图像采用SHA-256哈希进行内容寻址,并在本仓库内实现去重。Hugging Face Hub上的`images`列嵌入了原始字节数据,因此Hub查看器可渲染缩略图,且`datasets.load_dataset`可直接正常使用。 针对本地工作流(如监督微调(SFT)导出、跨数据集去重、数据集拆分重平衡),可在克隆仓库后运行[`reverse.py`](https://github.com/cua-lite/cua-lite/tree/main/scripts/hf_upload)脚本:该脚本会将每个唯一的`image_id`提取至共享的`image_store/<hash[:2]>/<hash>.<ext>`路径,并重写Parquet文件以移除`images`列,使数据行仅通过哈希ID引用图像。该共享存储可跨数据集复用——两个仓库中的相同图像只会存储为一个文件。 - 唯一图像总数:**46,431** - 存储总大小:**37.16 GB** ## 备注 (无) ## 许可证与引用 请参阅原始数据集(HanXiao1999/UI-Genie-Agent-16k) 请访问:https://huggingface.co/datasets/HanXiao1999/UI-Genie-Agent-16k

提供机构:
cua-lite
二维码
社区交流群
二维码
科研交流群
商业服务