遇见数据集

CaptchaArena

收藏
github2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

CaptchaArena提供了20类现代CAPTCHA作为实时网页,在固定的1280x1080视口下运行。包含50,000个谜题,分布在训练集、验证集和测试集中,每个谜题都附带一个机器可执行的解决方案。

CaptchaArena offers 20 categories of modern CAPTCHAs as live web pages that operate under a fixed 1280×1080 viewport. The dataset contains 50,000 puzzles divided into training, validation, and test sets, with each puzzle accompanied by a machine-executable solution.

创建时间:
2026-08-04
原始信息汇总

CaptchaArena 数据集概述

CaptchaArena 是一个用于评估计算机使用智能体在交互式验证码上表现的基准测试数据集,包含20种现代验证码类型,以固定1280x1080视口的实时网页形式呈现。

核心特性

  • 交互式验证码:验证码并非静态标签问题,而是需要多步操作(点击、拖拽、按住、打字等)的真实交互任务。
  • 纯视觉观测:智能体只能获取截图,动作空间为5个工具(screenshotclickdragtype_texthold),无DOM、无元数据。
  • 页面自行评分:正确性由与人类提交相同的 /api/check_answer 端点判定,无独立离线评分器。

数据集规模与划分

  • 总量:50,000道验证码题
  • 划分Train(训练集)、Val(验证集)、Test(测试集)
  • 更新日志
    • 2026-08-07:数据集发布
    • 2026-08-08:代码发布
    • 2026-08-11:轨迹发布(含思维链的计算机使用rollouts)

20种验证码类型

类型 交互方式 平均动作数
Geometry_Click 点击 1.0
Hold_Button 按住 1.0
Misleading_Click 点击 1.0
Pick_Area 点击 1.0
Place_Dot 点击+提交 2.0
Select_Animal 点击+提交 2.0
Object_Match 箭头循环 2.8
Coordinates 箭头循环 2.8
Bingo 交换方块 3.0
Dice_Count 输入数字 3.0
Slide_Puzzle 拖拽 3.0
Image_Matching 箭头循环 3.1
Connect_icon 箭头循环 3.5
Dart_Count 箭头循环 3.7
Path_Finder 箭头循环 3.7
Image_Recognition 网格多选 4.4
Unusual_Detection 网格多选 4.5
Rotation_Match 箭头循环 4.5
Click_Order 有序点击 5.1
Patch_Select 网格多选 8.5

参考解决方案的动作数从1到22不等,其中Patch_Select最长(中位数8,90分位12)。

数据格式

每个题目目录包含两个文件:

  • ground_truth.json:原始形式的答案(索引、坐标、文本)及评分容差
  • ground_truth_cu.json:以智能体动作形式表达的答案(如 {"action": "click", "arguments": {"x": 619, "y": 132}}),可直接执行

空间答案以图像自然像素存储,原点位于左上角,前端会自动进行缩放校正。

数据获取

工具支持

  • 智能体框架:支持 Anthropic、OpenAI、Google、Mock(无模型回放验证)四种provider,OpenAI兼容任意遵循chat-completions协议的端点(如vLLM、SGLang本地服务)
  • 数据集浏览:提供gallery工具(端口48040),可浏览缩略图并直接在实时页面上体验验证码
  • 验证机制:内置mock provider可回放参考答案以验证数据完整性

发布状态

  • ✅ 已发布:基准测试与智能体代码、数据集(含两种答案格式)、训练轨迹
  • 🔜 待发布:模型权重、训练代码、验证码生成器、人类基线、论文及基线数值

代码许可

仓库代码采用MIT许可证;数据集采用CC BY-NC 4.0(门控访问),仅限非商业学术研究。

搜集汇总
数据集介绍
CaptchaArena 数据集图片
构建方式
CaptchaArena基准测试的构建方式颇具匠心,它摒弃了传统静态图像的局限,转而采用由Flask服务器动态渲染的实时网页来呈现20种现代验证码,每种均锁定在1280x1080的固定视口,以确保像素坐标的一致性与可比较性。数据集囊括了50,000个谜题,分布在训练、验证与测试三个分割中,每个谜题均附带两种格式的机器可执行解——原始形式的ground_truth.json与转化为代理操作序列的ground_truth_cu.json,后者可通过浏览器驱动进行回放验证,从而确保数据切分的完整性与准确性。
使用方法
使用CaptchaArena时,研究者需先通过Hugging Face Hub申请数据集访问权限,并进行本地环境配置,包括安装依赖与Chromium浏览器。随后启动Flask服务器以提供谜题页面,并借助自带的computeruse_cli代理框架,通过指定provider(如OpenAI、Anthropic或本地vLLM服务)运行测试,代理的每一步行动及其截图均会记录在输出文件中。特别地,mock provider允许无需模型参与即可回放ground truth动作序列,快速验证数据完整性或代码修改。此外,数据集画廊提供了直观的浏览界面,使研究者能够以代理相同的条件手动体验每个谜题,辅助理解任务性质与评估模型行为。
背景与挑战
背景概述
随着大型语言模型与多模态智能体的迅猛发展,计算机使用智能体(computer-use agents)在自动化网页操作中展现出巨大潜力,但交互式验证码(CAPTCHA)作为人机区分的关键屏障,对这类智能体构成了严峻挑战。现有基准多将验证码问题简化为静态图像分类或文本识别,忽略了其动态、多步骤的交互本质。为此,研究者于2026年8月发布了CaptchaArena基准,由ZHEN-04团队构建,旨在评估智能体在真实渲染的网页环境中完成验证码交互任务的能力。该基准涵盖20种现代验证码类型,提供50,000个标注实例,并配备可执行的参考动作序列,为计算机视觉、人机交互与智能体研究提供了标准化评测平台,推动了验证码交互理解与自动化决策领域的发展。
当前挑战
CaptchaArena面临多重挑战。从领域问题看,其核心难点在于验证码不仅要求感知理解,还需精准的鼠标键盘操作与多步规划,例如对象旋转、滑块拖动、区域选择等,静态图像答案无法体现真正难度;同时,页面动态渲染使像素坐标在不同运行间存在不确定性,要求智能体具备稳健的视觉定位与空间记忆能力。在数据集构建层面,挑战尤为突出:需确保20种验证码交互机制各不相同且难度梯度合理,参考动作序列需精确反映页面真实逻辑,避免歧义;此外,还需排除环境延迟、按钮遮挡等干扰因素,并保证地面真相在浏览器中的可重现性,任何一步偏差都会导致基准评估失真,构建过程需反复迭代验证与质量监控。
常用场景
经典使用场景
CaptchaArena作为一个专为交互式验证码设计的基准测试平台,其核心应用场景在于评估和比较各类计算机使用代理(computer-use agents)在真实网页环境中的多步交互能力。该数据集将20种现代验证码封装为固定1280x1080视口的实时网页,代理仅能通过截图感知环境并以鼠标移动、点击及键盘输入作为行动空间,这一设计精准复现了人类与验证码交互的完整动态过程。研究者可借助其标准化的评分端点和可执行的真值动作序列,对模型进行严格的量化评估,从而深入剖析视觉感知、空间推理与决策排序等多维度能力。
解决学术问题
该数据集直面传统验证码研究中静态图像标注范式与真实交互鸿沟这一根本性学术难题。通过将验证码构建为动态渲染的网页而非预烘焙图片,CaptchaArena迫使模型必须在实时页面布局中完成物体追踪、滑动匹配、有序点击等复杂操作,从而解决以往基准测试中过度简化交互逻辑、无法区分感知与规划缺陷的问题。其提供的50,000条带可执行真值样例,使得研究人员能够精确测量从单步识别到长达22步序列决策的完整能力谱系,为视觉语言模型在图形界面自动化领域建立了一个具备高度生态效度且可复现的评估范式,显著推动了多模态智能体研究的方法论进步。
实际应用
在实际应用层面,CaptchaArena为自动化网页操作、智能体辅助浏览及无障碍技术等领域提供了关键的基础设施支持。其模拟的真实浏览器环境与规范化的行动接口,可直接服务于训练和验证那些旨在自动完成表单填写、内容导航及图形验证的智能代理系统,从而提升机器人流程自动化(RPA)在动态网页中的鲁棒性。此外,该数据集所聚焦的交互式推理能力,对于开发面向视障用户的辅助导航工具、自动化安全测试工具以及新一代通用型数字助手都具有直接的推动作用,其构建的标准化评估协议有望成为工业界部署智能体前的重要质量验证环节。
数据集最近研究
最新研究方向
CaptchaArena基准的发布标志着交互式验证码评测从静态图像分类向动态环境交互的范式跃迁。该数据集将20类现代验证码封装为实时网页,要求智能体仅凭截图通过鼠标与键盘操作完成任务,其评分由页面原生校验逻辑执行,彻底规避了离线评分器与真实环境间的评估偏差。前沿研究聚焦于多步推理与规划能力的量化,参考解的动作序列跨度从1至22步,其中Patch_Select类中位数达8步,凸显了感知、定位与顺序决策的复合挑战。配套发布的思维链轨迹数据为计算机使用智能体的微调提供了高价值监督信号,而模拟器驱动的全自动验证机制则保证了数据完整性。该基准与多模态大模型在图形界面自动化领域的应用热潮紧密相关,为衡量智能体在真实人机交互场景中的鲁棒性与泛化能力树立了新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务