遇见数据集

cogym-collabskill-trajectories

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

CollabSkill Trajectories 是一个用于研究人类工人与 AI 代理在真实职业任务上协作的数据集。该数据集基于 CollabSkill 框架,通过将参与者根据其职业背景匹配到具体任务,并与五种 AI 代理之一配对,收集了完整的交互日志、参与者与会话元数据、任务评分标准、自动评分结果以及人类和代理的贝叶斯 CollabSkill 评级。任务要求生成实际工作产品,如电子表格、文档、演示文稿、PDF 等,来源于 GDPVal、APEX 和 APEX-Agents 数据集,覆盖 10 个 O*NET 职业领域。数据集包含约数百个交互会话(其中 386 个为研究会话,另有 61 个会话因日志缺失或无效而包含特殊标记),每个会话的交互日志以 JSONL 格式存储,包含会话 ID、轮次、代理名称、模型、角色、事件类型、文本内容、工具名称和输入等字段。领导者数据包括参与者信息(匿名用户 ID、任务分配、工作经验等)、会话记录、任务描述(含提示、参考材料元数据、预期交付物、职业元数据和评分标准)、自动评分记录以及贝叶斯技能估计(保守值为 mu - 3 * sigma)。数据可通过会话 ID、用户 ID、任务 ID 等进行关联。该数据集主要用于研究人机协作、交互分析、代理评估和 AI 素养,但应注意参与者样本仅限 Upwork 上的美国工人,任务集中于开放式的、产生工件的工作,结果可能不具普遍性。数据集采用 CC BY 4.0 许可。

CollabSkill Trajectories is a dataset dedicated to researching collaboration between human workers and AI agents on real-world occupational tasks. Built upon the CollabSkill framework, this dataset collects comprehensive interaction logs, participant and session metadata, task scoring rubrics, automated scoring results, and Bayesian CollabSkill ratings for both humans and agents, by matching participants to specific tasks based on their occupational backgrounds and pairing them with one of five AI agents. Tasks require the generation of practical work products such as spreadsheets, documents, presentations, PDFs, and other deliverables, sourced from the GDPVal, APEX, and APEX-Agents datasets, covering 10 O*NET occupational domains. The dataset contains roughly several hundred interaction sessions, 386 of which are official research sessions, with an additional 61 sessions flagged due to missing or invalid logs. Interaction logs for each session are stored in JSONL format, including fields such as session ID, turn, agent name, model, role, event type, text content, tool name, and input. The core dataset includes participant information (anonymous user ID, task assignment, work experience, etc.), session records, task descriptions (covering prompts, reference material metadata, expected deliverables, occupational metadata, and scoring rubrics), automated scoring records, and Bayesian skill estimates (conservative value: μ - 3σ). Data can be associated using identifiers such as session ID, user ID, and task ID. This dataset is primarily used for research on human-AI collaboration, interaction analysis, agent evaluation, and AI literacy. It should be noted that the participant sample is limited to U.S. workers on Upwork, and tasks focus on open-ended, artifact-generating work, so the study results may not be generalizable across all scenarios. The dataset is licensed under CC BY 4.0.

创建时间:
2026-08-02
原始信息汇总

数据集概述

CollabSkill Trajectories 是一个用于研究人类工作者与AI代理在真实职业任务中协作的数据集,包含交互日志、参与者与会话元数据、任务评分标准、自动评分结果以及人类和代理的贝叶斯 CollabSkill 评分。

基本信息

数据集内容

参与者根据其职业背景被匹配到相应任务,并与五种AI代理之一配对。任务要求产出真实的职业工作成果,如电子表格、文档、演示文稿、PDF等,涵盖10个O*NET职业领域,任务来源于 GDPVal、APEX 和 APEX-Agents。

数据结构

release/ ├── README.md ├── interaction_logs/ │ └── <session_id>/ │ └── extracted_log.jsonl └── leaderboard_data/ ├── participants.json ├── ratings.json ├── scores.json ├── sessions.json └── tasks.json

交互日志

每个以 session_id 命名的文件夹内包含一个标准的 extracted_log.jsonl 文件,每行为一个JSON对象,包含以下字段:

  • session_id (string):会话UUID
  • turn_id (integer):会话内记录顺序或轮次标识
  • agent (string):会话使用的代理名称
  • model (string):会话使用的模型标识
  • role (string):记录来源,如 userassistanttoolsystem
  • type (string):事件类型,如 messagetool_calltool_resultstatus
  • content (string):文本内容或提取的事件描述
  • tool_name (string):适用的工具名称
  • tool_input (string):提取的工具输入
  • is_conversational (boolean):是否为面向用户的对话记录

注意: 61个会话没有可提取的交互日志(因原始日志缺失、不完整或无效),这些文件使用独立的一行哨兵格式:{"no_extracted_log_reason":"Wrong log file submission."}

排行榜数据

  • participants.json: 参与者记录,包括假名 user_id、任务分配与进度、职业经验年限、LLM使用人口统计信息,以及可选的前/后研究调查回复。
  • sessions.json: 会话记录,与 interaction_logs/ 中的目录名完全对应。
  • tasks.json: 任务记录,包括提示词、参考资料元数据、预期成果、职业元数据和评分标准。
  • scores.json: 自动评分记录。三个保留会话包含 autograde_score_id 及嵌入的总体分数,但其详细评分记录在原始 scores.json 中已缺失。
  • ratings.json: 代理和人类参与者的贝叶斯技能估计。人类 entity_id 对应参与者的 user_id;代理条目使用代理标识符。保守的 CollabSkill 值为 mu - 3 * sigma

数据关联方式

  • 交互日志目录与 sessions.json 通过 session_id 关联。
  • 会话与参与者通过 user_id 关联。
  • 会话与任务元数据通过 task_id 关联。
  • 人类评分与参与者通过 ratings.humans[].entity_id == participants[].user_id 关联。
  • 代理评分与会话代理通过对应的代理标识符关联。

由于一名参与者未完成完整评分回合,93名研究参与者对应92条人类评分记录。

数据加载示例

数据集使用嵌套JSON和JSONL文件而非单一表格划分。官方示例代码演示了如何选择386个研究会话并处理两种交互日志格式(标准记录和哨兵记录)。

局限性与预期用途

  • 参与者样本为通过Upwork招募的美国工作者,不能代表所有工作者或职业。
  • 任务覆盖10个O*NET领域,侧重开放式、产出制的工作,结果可能不适用于其他场景。
  • 交互日志来自异构的代理界面,已被规范化为统一的提取模式。
  • 数据集仅用于人类-代理协作、交互分析、代理评估和AI素养研究,不应用于对个体参与者做出重大决策。

引用信息

bibtex @inproceedings{shao2026collabskill, title = {CollabSkill: Evaluating Human-Agent Collaboration on Real-World Tasks}, author = {Shao, Yijia and Wang, Zora Zhiruo and Ahuja, Neel and Wang, Yicheng and Liu, Bowen and Yang, Diyi}, booktitle = {Third Conference on Language Modeling}, year = {2026}, url = {https://arxiv.org/abs/2606.09833} }

搜集汇总
数据集介绍
cogym-collabskill-trajectories 数据集图片
构建方式
在真实职业场景中评估人机协作能力,需要能够刻画人类工作者与智能体交互过程的实证数据。该数据集依托CollabSkill框架,将具备特定职业背景的人类参与者与五类AI智能体进行配对,围绕源自GDPVal、APEX及APEX-Agents的开放式工作任务展开协作。任务要求产出电子表格、文档、演示文稿与PDF等真实工作交付物,覆盖10个O*NET职业类别。全部交互过程被记录为标准化的JSONL日志,并配套参与者元数据、任务评分量表、自动化评分结果及贝叶斯CollabSkill能力评级,最终形成386个研究会话与92条人类评分记录的结构化发布版本。
特点
该数据集的核心特征在于其多维度的真实性与评估深度。交互日志经过统一schema归一化,涵盖用户、助手、工具与系统等多方角色,支持对协作动态的细粒度还原。任务设计强调开放式产出而非封闭问答,贴近职业实践中的复杂交付需求。贝叶斯评分机制为人类与智能体分别提供保守能力估计,其中CollabSkill值取mu减三倍sigma,兼顾统计稳健性。数据按会话、参与者、任务与评分逐层关联,形成可追溯的证据链条。少量缺失日志以哨兵格式显式标注,保障数据来源的透明性与可审计性。
使用方法
使用该数据集时,研究者可通过session_id将交互日志目录与sessions.json关联,再经由user_id与task_id分别接入参与者与任务元数据;人类评分通过ratings.humans中的entity_id与participants的user_id对接,智能体评分则借助对应标识符与会话中的agent字段连接。加载过程中需区分标准extracted_log.jsonl与仅含no_extracted_log_reason的单行哨兵文件,前者逐行解析JSON对象,后者可直接跳过。该数据适用于人机协作机制分析、智能体能力评估与AI素养研究,但受限于样本来源与任务类型,不宜用于对个体参与者作出高利害决策。
背景与挑战
背景概述
随着人工智能智能体逐步渗透至职业工作场景,如何量化人机协作的真实效能成为亟待厘清的核心议题。CollabSkill数据集由斯坦福大学SALT实验室的研究团队于2026年构建,相关成果发表于第三届语言建模会议。该数据集面向现实职业任务,采集了具备不同职业背景的人类工作者与五类AI智能体配对协作的交互轨迹,涵盖交互日志、任务评分细则、自动化评分结果及贝叶斯技能评级,覆盖10个O*NET职业门类。其核心研究问题在于评估人机协作在开放式工作任务中的协同表现,为智能体评估与人机协作研究提供了实证基础。
当前挑战
该数据集所应对的领域问题在于,传统智能体评测多局限于封闭式基准,难以刻画真实职业场景中开放式、产物驱动型任务的协作复杂性,因而无法充分反映人机协同的实际效能。在构建层面,交互日志源自异构智能体接口,需归一化为统一抽取模式,且存在61个会话因日志缺失、不完整或无效而无法提取有效轨迹。参与者样本来自美国Upwork平台,仅覆盖10个O*NET职业门类,代表性受限。此外,任务强调开放式产物生成,所得结论向其他工作情境的泛化能力尚待验证,数据亦不适用于对个体参与者作出重要决策。
常用场景
经典使用场景
在人工智能体与人类协同完成职业任务的交叉研究领域,该数据集最经典的使用场景在于对真实人机协作轨迹进行细粒度分析。研究者借助交互日志中逐轮的对话、工具调用与结果反馈记录,刻画人类工作者与五类AI智能体在电子表格编制、文档撰写和演示文稿制作等任务中的协作模式,并利用贝叶斯CollabSkill评分对人与智能体的技能水平进行稳健估计,进而在一体化排行榜框架下比较不同智能体的协同效能。
衍生相关工作
围绕该数据集,已衍生出若干经典研究方向与后续工作。CollabSkill框架本身提出了贝叶斯技能评级方法,将国际象棋领域成熟的评分思想迁移至人机协作评测;其任务资源整合自GDPVal、APEX与APEX-Agents等基准,促进了多基准融合研究;此外,该数据集还催生了针对交互日志标准化抽取、人机协作排行榜构建以及协作过程的会话分析等相关工作,为人机协同研究社区提供了可复用的基础设施。
数据集最近研究
最新研究方向
在人机协作日益嵌入职业场景的当下,cogym-collabskill-trajectories凭借真实工作者与五类AI代理在十类O*NET职业部门任务中的交互日志、评分及贝叶斯技能评级,正在推动以真实交付物为导向的协作能力评估研究。该数据集关联GDPVal、APEX等基准,支持对协作轨迹的细粒度分析、代理技能分层和人类AI素养的联合建模,为构建可复现的人机协作排行榜与交互式代理评估范式提供了关键基础设施,亦回应了当前对高生态效度协作证据的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务