ClawMark
收藏资源简介:
ClawMark是一个多模态、多阶段、多环境的日常工作基准测试,用于协作代理。包含100个任务,覆盖13个专业领域(临床、人力资源、法律、项目管理、房地产、研究助理、记者、保险、投资分析、行政助理、内容运营、电子商务、EDA)。每个任务模拟1-3个实际工作日的真实工作,测试模型在工具、多模态证据和时间线上的连续决策能力。
ClawMark is a multimodal, multi-stage, multi-environmental daily work benchmark for collaborative AI Agents. It includes 100 tasks covering 13 professional domains: Clinical, Human Resources (HR), Legal, Project Management, Real Estate, Research Assistant, Journalist, Insurance, Investment Analysis, Administrative Assistant, Content Operations, E-commerce, and Exploratory Data Analysis (EDA). Each task simulates real-world work spanning 1 to 3 actual workdays, and evaluates the model's ability to make sequential decisions across tools, multimodal evidence and timelines.
ClawMark 数据集概述
数据集基本信息
- 数据集名称:ClawMark: A Living-World Benchmark for Multi-Day, Multimodal Coworker Agents
- 数据集地址:https://github.com/evolvent-ai/ClawMark
- 许可证:CC BY-NC 4.0
核心特性
- 多模态、多阶段、多环境的日常工作基准测试,用于评估协作智能体。
- 包含100个任务,涵盖13个专业领域:临床助理、人力资源、法律、项目管理、房地产、研究助理、记者、保险、投资分析师、行政助理、内容运营、电子商务、探索性数据分析。
- 每个任务模拟1-3个工作日的真实工作,测试模型在工具、多模态证据和时间线之间做出连续决策的能力。
任务设计特点
- 时间线驱动的多阶段任务:每个任务由1-3个阶段构成,每个阶段对应一个工作日。智能体接收当天的指令,在真实工具后端上执行工作,然后框架才推进到下一天。
- 跨环境工具协调:任务混合了文件系统、电子邮件(GreenMail)、Notion(模拟)、Google Sheets(模拟)和日历(Radicale CalDAV)后端,迫使模型跨多个系统交叉引用和协调信息。
- 多模态原始证据:
assets/input/包含截图、照片、PDF、CSV、音频和视频。模型必须直接从原始证据中提取关键信息,没有预先消化的文本摘要。 - 隐式状态变化:环境数据在阶段之间发生突变(新邮件到达、数据库行更新、文件追加、日历事件变更)。模型必须主动刷新外部状态,而不仅仅是对最新指令做出反应。
- 严格的基于规则的评分:每个任务都附带10-25个确定性的Python检查器函数。零LLM作为评判者。结果100%可复现。
评估结果
- 评估指标:
avg@3(每个任务独立运行3次,3个score值取平均,然后在100个任务上再次取平均)、turns / task(每个任务的助手消息数)、input tokens / task(每个任务的输入令牌总数)、output tokens / task(每个任务的输出令牌总数)。 - 模型表现:在100个任务 × 6个模型 × 3次运行的
avg@3排行榜上,openai/gpt-5.4以0.5504分领先。 - 分领域表现:提供了13个专业领域中各模型的
avg@3详细分数。
数据集结构与使用
- 任务布局:任务目录遵循严格的两级结构:
tasks/{domain}/task{N}/。运行时仅加载task.py文件。 - 快速开始:包括环境设置、Docker镜像构建、运行单个任务/整个领域/完整100个任务套件的步骤。
- 结果检查:每次运行将其输出写入
results/<task_id>/,包含result.json、messages.jsonl和workspace/目录。 - 添加新任务:通过创建
tasks/{domain}/task{N}/task.py文件并定义METADATA、PROMPT、阶段函数和检查器函数来添加。
项目结构
ClawMark/ ├── src/clawmark/ # 框架核心 ├── docker/ # Dockerfile + docker-compose.yaml ├── configs/ # 配置文件 ├── skills/ # 注入到智能体容器的工具文档 ├── tasks/ # 100个基准测试任务 └── tests/ # 后端冒烟测试脚本




