遇见数据集

CaptchaArena

收藏
arXiv2026-09-26 更新2026-10-01 收录
官方服务:

资源简介:

CaptchaArena是一个大规模、细粒度的人机交互验证码训练数据集,由哥伦比亚大学、浙江大学、罗切斯特大学及伊利诺伊大学厄巴纳-香槟分校联合构建。该数据集包含50,000个交互式验证码谜题,覆盖20种验证码类型和5种交互模式(单击、多击、箭头循环、实时、文本输入),并提供50,000条屏幕截图-动作轨迹,其中46,000条附带逐步推理注释。所有谜题均通过执行验证并经过人工质量检查,针对不规则目标额外提供像素级掩码注释。数据集旨在训练能够自主解决交互式验证码的计算机使用智能体,填补了现有资源在类型覆盖、交互保真度和轨迹监督之间的空白。

CaptchaArena is a large-scale, fine-grained human-computer interactive CAPTCHA training dataset co-developed by Columbia University, Zhejiang University, University of Rochester, and the University of Illinois at Urbana-Champaign. This dataset contains 50,000 interactive CAPTCHA puzzles, covering 20 types of CAPTCHAs and 5 interaction modes: single-click, multi-click, arrow cycling, real-time, and text input. It provides 50,000 pairs of screenshot-action trajectories, 46,000 of which are accompanied by step-by-step reasoning annotations. All puzzles have been validated through execution and passed manual quality inspection, with additional pixel-level mask annotations provided for irregular targets. The dataset aims to train computer-utilizing AI Agents that can independently solve interactive CAPTCHAs, filling the gap in existing resources across type coverage, interaction fidelity, and trajectory supervision.

创建时间:
2026-09-26
原始信息汇总

CaptchaArena 数据集概述

基本信息

  • 名称:CaptchaArena
  • 定位:用于训练计算机使用代理(Computer-Use Agents)处理交互式 CAPTCHA 的大规模、细粒度数据集
  • 论文:CaptchaArena: A Large-Scale, Fine-Grained Dataset for Training Computer-Use Agents on Interactive CAPTCHAs(arXiv:2609.31957)
  • 作者机构:哥伦比亚大学、浙江大学、罗切斯特大学、伊利诺伊大学厄巴纳-香槟分校
  • 项目负责人:Zhenhao Zhang
  • 通讯作者:Linchao Zhu

数据集构成

数据划分

  • Train
  • Val
  • Test

数据类型

  • 20 种 CAPTCHA 谜题类型
  • 在固定 1280x1080 视口下渲染为实时网页
  • 每个谜题目录包含两个文件:
    • ground_truth.json:原始形式的答案(索引、坐标、文本),以及评分时使用的 tolerance。不规则目标携带指向二进制掩码的 mask_path(相对于谜题目录):
      • Geometry_Click 和 Pick_Area 位于 answer.valid_area 下
      • Misleading_Click 位于顶层
      • 白色(>127)标记目标;对 Misleading_Click 而言,标记的是需要避开的字符
    • ground_truth_cu.json:同一答案以代理动作(answer_cu)形式写出

数据集托管位置

  • 数据集:ZHEN-04/CaptchaArena(Hugging Face Hub)· 包含 Train / Val / Test 的图像与真值
  • 轨迹数据:ZHEN-04/CaptchaArena-Trajectories(Hugging Face Hub)· 覆盖 Train / Val 的已解思维链 rollout,用于微调

目录命名规则

带尺寸后缀的目录名(如 Train/Bingo_2100、Test/Bingo_200)即为 API 预期的 puzzle_type,而非 Bingo。

使用与访问

访问方式

  • 数据集与轨迹数据均为受限访问(gated),采用 CC BY-NC 4.0 许可,仅限非商业学术研究
  • 需在数据集页面申请访问权限,然后执行 hf auth login

下载命令

bash hf download ZHEN-04/CaptchaArena --repo-type dataset --local-dir data

配套资源

  • 代码仓库:X0X0X00/CaptchaArena
  • 模型权重:ZHEN-04/CaptchaAgent(Qwen3.5-9B 经过 SFT 与 GRPO 后的检查点)
  • 论文:arXiv:2609.31957

仓库组成

  • app.py:Flask 服务器,负责提供谜题页面并评分答案
  • agent_frameworks/computeruse_cli.py:截图代理(支持 anthropic / openai / google / mock)
  • templates/、static/:基准测试页面
  • gallery/app.py:数据集浏览器,含缩略图与实时谜题页面
  • web/:用于查看代理运行与轨迹的 React 查看器
  • data/:下载数据集的存放位置
  • requirements.txt
  • Dockerfile

技术环境要求

  • Python 3.10+
  • 需安装 requirements.txt 依赖并执行 playwright install chromium
  • 支持通过捆绑的 Dockerfile 运行(镜像包含代码与 Chromium,期望数据集挂载至 /app/data)
  • 前端查看器需 Node.js

版本发布状态

已完成:

  • 基准与代理(服务器、20 种谜题类型、截图代理、数据集浏览器、轨迹查看器)
  • 数据集(Train / Val / Test 谜题及两个真值文件)
  • 训练轨迹(覆盖 Train / Val,每个谜题一条)
  • 论文
  • 人类基线(Test 划分上的分类型准确率与求解时间,见论文 App. G,Table 9)
  • CaptchaAgent 权重

未完成:

  • 训练代码(监督微调及多轮 GRPO 设置)
  • 谜题生成器(渲染各类型的脚本)

更新记录

  • 2026-09-29:模型发布(CaptchaAgent 权重)
  • 2026-09-25:论文发布于 arXiv
  • 2026-08-11:轨迹发布(Train / Val 的推理标注轨迹)
  • 2026-08-08:代码发布(基准服务器、截图代理、数据集浏览器、轨迹查看器)
  • 2026-08-07:数据集发布(Train / Val / Test 谜题)

许可

  • 本仓库代码:MIT
  • 数据集:CC BY-NC 4.0,受限访问,仅限非商业学术研究

致谢说明

app.py、页面模板与前端脚本源自 OpenCaptchaWorld(MIT 许可下再分发);计算机使用代理、浏览器与轨迹查看器为本项目编写;谜题生成器(尚未发布)及 Hub 上所有谜题数据亦为本项目编写。

引用格式

bibtex @article{zhang2026captchaarena, title = {CaptchaArena: A Large-Scale, Fine-Grained Dataset for Training Computer-Use Agents on Interactive CAPTCHAs}, author = {Zhang, Zhenhao and Fan, Zhaoyu and Ying, Haohan and Hu, Jingwen and Fan, Hancen and Zhou, Junhao and Chen, Zitian and Zhu, Linchao}, journal = {arXiv preprint arXiv:2609.31957}, year = {2026} }

搜集汇总
数据集介绍
CaptchaArena 数据集图片
构建方式
在计算机使用代理与交互式验证码的交叉领域,高质量训练数据的匮乏长期制约着细粒度交互策略的习得。CaptchaArena的构建遵循“生成—校验—回放”的闭环范式:多数图像由ChatGPT Images 2.0生成,Geometry Click与Path Finder则经Blender程序化渲染以获取精确几何真值,另有三类任务复用开放许可图标与公开reCAPTCHA-V2图像集。每题配备可执行浏览器动作序列,并在真实页面中回放,仅当站点自身验证器接受最终状态时方予保留;回放过程同步产出截图-动作轨迹,经GPT-5.4-mini标注推理、Gemini-2.5-Flash双重评判过滤,最终形成46K条带推理标注的轨迹,不规则目标另附像素级掩码。
特点
该数据集在类型覆盖、交互保真与监督粒度三个维度上实现了协同突破。其囊括20种验证码类型与单击、多击、箭头轮换、实时操作、文本输入5种交互模式,共50K道谜题,每类均衡贡献2,100道训练题及200道验证与测试题。与仅提供答案与点击坐标的静态数据集不同,CaptchaArena以可执行浏览器任务为单元,每条轨迹均保留动作前的完整截图、动作本身及推理依据,且所有解均经执行验证。针对不规则目标,数据集提供像素掩码监督,使点击依目标轮廓而非包围盒判定;答案位置经配额设计趋于均匀,抑制固定猜测的系统性优势。
使用方法
CaptchaArena面向低层计算机使用代理的训练与评测,其使用遵循统一工具接口:代理在固定1280×1080视口下观察截图,并通过screenshot、click、type_text、drag与timed hold五种调用与页面交互,每回合输出一个动作,环境返回下一帧截图,直至提交或达到15步上限。训练时可利用逐回合展开的推理标注样本进行监督微调,继而以环境验证器直接提供的奖励信号开展强化学习;评测时每谜题采样多次,采用无偏Pass@k估计器计算指标,测试集不参与标注。该接口同时支持分布内评估与外部基准迁移测试,为验证泛化能力提供了标准化协议。
背景与挑战
背景概述
交互式验证码长期被视为计算机使用智能体的关键瓶颈,其求解过程浓缩了感知、决策、行动与状态验证的完整闭环。然而,现有资源在类型覆盖、交互保真与轨迹监督之间难以兼顾:ReCAP与CaptchaMind仅涵盖七至八类挑战,MirrorCAPTCHA虽评估十八类却仅提供答案与点击坐标监督,Open CaptchaWorld依赖浏览器元素级动作而无法处理细粒度交互。为弥合上述裂隙,哥伦比亚大学、浙江大学、罗切斯特大学与伊利诺伊大学厄巴纳-香槟分校的研究者于2026年联合构建了CaptchaArena。该数据集首次在大规模尺度上整合二十种验证码类型与五种交互模式,每条解法均经真实浏览器执行验证,并附带四万六千条推理标注轨迹与不规则目标的像素掩码监督,为训练通用验证码求解智能体确立了新的数据范式。
当前挑战
CaptchaArena所应对的领域问题在于,交互式验证码求解要求智能体在真实浏览器中完成从截图感知到像素级动作的闭环控制,而单次失败即阻断整个工作流,现有基准或回避测量、或以结构化预测替代逐步执行,难以反映真实交互中的程序性失败。其构建过程亦面临多重挑战:生成模型返回的图像常与提示语义不符,需双人独立质检并重新生成;不规则目标的评估若沿用边界框将过度接受目标外区域,故须引入像素掩码以精确界定接受域;推理标注依赖教师模型生成并须经异构评判模型双重过滤,以杜绝后见之明与含糊表述;多步轨迹需逐动作重放验证,确保每条解均可被环境验证器接受。这些挑战共同构成了数据集在保真度与可扩展性之间的核心张力。
常用场景
经典使用场景
在计算机使用智能体的研究脉络中,交互式验证码的求解被视为衡量感知—决策—行动闭环能力的重要试金石。CaptchaArena 的经典使用场景,正是为这一闭环提供大规模、细粒度的监督信号:其涵盖 20 种验证码类型、5 种交互模式,包含单点点击、多目标选取、箭头轮换、实时拖拽与文本输入等操作范式,并以 5 万道经浏览器执行验证的谜题,附以 5 万条截图—动作轨迹与 4.6 万条逐步推理标注,支撑智能体从屏幕像素出发完成定位、推理并提交答案的完整过程。
实际应用
在实际应用层面,CaptchaArena 为计算机使用智能体的训练与评测提供了贴近真实网页环境的交互沙盒。智能体在固定视口下仅凭截图与底层鼠标键盘动作求解验证码,这一设定直接对应自动化流程中因验证码阻断而停滞的现实痛点。基于该数据集训练的 CaptchaAgent 在全部 20 种类型上取得 70.5 Pass@1,经强化学习后提升至 71.7,并在 Open CaptchaWorld 与 Halligan 两个外部基准上展现出正向迁移,表明该数据资源可用于提升智能体在真实交互场景中的鲁棒性与任务连续性。
衍生相关工作
围绕 CaptchaArena 衍生的经典工作主要体现在训练范式与评测体系的推进上。CaptchaAgent 作为单一策略模型,先在筛选后的推理标注轨迹上进行监督微调,继而以环境验证器直接作为奖励信号开展 GRPO 强化学习,无需学习奖励模型或人工标注步级回报;这一设计验证了大规模、细粒度计算机使用监督在验证码场景中的有效性,并与 ReCAP、CaptchaMind、MirrorCAPTCHA、MCA-Bench 等先前工作形成对照,推动验证码求解从静态识别走向闭环交互与可执行评测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务