遇见数据集

Emirhanmu/agent-workflow-dataset

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了在Unity游戏开发过程中捕获的真实世界AI智能体交互轨迹,使用基于Claude Code的结构化多智能体工作流。数据集记录了一个单人Unity开发者使用5智能体系统(包括规划师、架构师、游戏玩法程序员、评审员和测试工程师)进行游戏项目开发的工作流。数据自动从Claude Code(VS Code扩展)会话日志中捕获,每条记录代表一次智能体调用,包括发送给智能体的完整提示、包含所有工具调用的完整智能体响应、从工作流信号中提取的隐含人类批准标签、基于评分标准的Claude和GPT评估器的质量分数,以及置信度和标记注释。人类标签通过工作流进展推断(无需手动标记):如果下一个智能体在流水线中更靠后,则标记为“接受”;如果再次调用同一智能体,则标记为“修订”;如果工作流回退到更早的智能体,则标记为“拒绝”;如果会话结束或转移到新功能,则标记为“自动批准”。每条记录由两个独立评估器(Claude和GPT)使用角色特定评分标准进行评分,置信度级别分为高、中、低。标记记录(AI高分但人类拒绝)是高价值分歧案例。数据集版本0.1(2026年5月)包含19条总记录,覆盖5个智能体角色和4个功能,约80%为高置信度,2条标记记录,质量控制成本约0.11美元。目标是在2026年8月前达到500+条记录,覆盖多个功能。许可证为CC-BY 4.0,要求署名,允许商业使用。

This dataset contains agent workflow records from a solo Unity developer working on a game project with a 5-agent system: Planner, Architect, Gameplay Coder, Reviewer, and Test Engineer. Records are captured automatically from Claude Code (VS Code extension) session logs. Each record represents one agent invocation and includes: full prompt sent to the agent, complete agent response with all tool calls, implicit human approval label (extracted from workflow signals), quality scores from Claude and GPT evaluators (rubric-based), and confidence and flag annotations. Human labels are inferred from workflow progression — no manual labeling required: if the next agent is later in the pipeline, label is accepted; if the same agent is called again, label is revised; if workflow is rewound to an earlier agent, label is rejected; if session ended or moved to new feature, label is auto-approved. Each record is scored by two independent evaluators using role-specific rubrics. Confidence levels: high, medium, low. Flagged records (AI high score but human rejected) are high-value disagreement cases. Version 0.1 (May 2026) stats: total records 19, agent roles covered 5, features covered 4, high confidence ~80%, flagged records 2, QC cost ~$0.11. Target: 500+ records across multiple features by August 2026. License: CC-BY 4.0 — attribution required, commercial use allowed.

提供机构:
Emirhanmu
搜集汇总
数据集介绍
Emirhanmu/agent-workflow-dataset 数据集图片
构建方式
该数据集源自一位独立Unity开发者在实际游戏项目中的多智能体协作流程,系统由策划者、架构师、游戏逻辑编码员、审查员与测试工程师五类角色构成。数据通过Claude Code(VS Code扩展)会话日志自动捕获,每条记录包含完整的智能体提示与响应内容。人类标签无需人工标注,而是通过工作流方向信号隐式推断:若下一智能体处于流程下游则标记为“接受”,同一智能体重复调用视为“修订”,回退至上游代理则认定为“拒绝”,会话结束或转向新功能视为“自动批准”。
特点
数据集每一条记录均经由Claude与GPT两套独立评分体系基于角色专属评分标准进行质检,并生成置信度标签。当AI评分与人类隐含标签相悖时,该类样本被标记为高价值分歧案例。当前版本涵盖19条记录、5种智能体角色与4项游戏功能,约80%的记录具有高置信度,其中2条被标记为AI与人类判断分歧。数据集以CC-BY 4.0许可发布,支持商业使用。
使用方法
用户可直接从HuggingFace平台加载该数据集,每条记录包含完整的提示、响应、隐含人类标签、双评估者质量评分及置信度标注。数据集适用于多智能体协作流程建模、智能体行为质量评估、人机协作分歧检测等研究场景。研究团队计划持续扩充数据,目标于2026年8月前涵盖超过500条跨越多个游戏功能的记录,为更广泛的工作流分析与模型训练提供支持。
背景与挑战
背景概述
随着大语言模型驱动的智能体系统在自动化软件开发中展现出巨大潜力,多智能体协作流程的透明性与可复现性成为研究焦点。2026年,研究者Emirhan Müftüoğlu推出了agent-workflow-dataset,该数据集捕获了在Unity游戏开发过程中,由五类智能体(规划者、架构师、玩法编码员、审查者、测试工程师)构成的系统经历结构化工作流时产生的真实交互轨迹。数据集通过Claude Code扩展的会话日志自动记录,并创新性地利用工作流进程信号(如智能体调用顺序变化)隐式推断人类审批标签,避免了人工标注的繁复。核心研究问题在于探索自动化工作流中人类与AI协作的评估机制,该数据集提供的质量评分(来自Claude与GPT双评估器)及置信度标注,为相关领域提供了宝贵的基准资源。
当前挑战
该数据集所解决的领域挑战在于多智能体协作系统的评价体系构建:传统单一模型评估难以捕捉复杂工作流中人类判断的细微差异,尤其在处理隐式审批信号时(如会话结束或跳转至新功能被视为“自动批准”)可能引入噪声。构建过程中面临多重困难:首先,仅凭工作流信号推断人类意图的准确性受限,被标记为“高AI评分但人类拒绝”的冲突案例仅有两例,样本量不足以训练鲁棒的争议检测器;其次,初期版本仅含19条记录,覆盖四个功能特征,数据稀疏性使得代理角色间交互模式的统计推断脆弱;此外,质量评分依赖闭源模型(Claude-sonnet-4-5与gpt-4o-mini),其评估一致性有待更大规模验证,而标注成本虽低(0.11美元),但扩展至500条目标记录时需维持同样经济效益颇具挑战。
常用场景
经典使用场景
在人工智能代理工作流研究领域,agent-workflow-dataset 数据集捕捉了真实世界中多智能体协作的交互轨迹,专为分析和优化结构化多智能体系统而设计。该数据集记录了Unity游戏开发过程中由五类智能体(规划者、架构师、游戏逻辑编码员、审查员、测试工程师)组成的协同工作流,每个智能体调用的完整提示、响应及工具调用序列均被详细保留。研究者可利用这些数据训练或评估智能体工作流的执行效率、任务分配策略及上下文连贯性,尤其适用于构建能够理解复杂开发流程并自主调度的智能体模型。该数据集以其高保真的真实交互记录,为多智能体系统的工作流建模与仿真提供了可重复验证的基础基准。
衍生相关工作
该数据集的诞生已催生出一系列具有奠基意义的衍生工作。一方面,基于其隐式标签提取方法,研究人员开发了无需人工标注的工作流质量评估框架,将工作流进步信号转化为监督学习信号,推动了弱监督学习在智能体交互领域的应用。另一方面,数据集中记录的AI与人类评分分歧案例(flagged records)被用作关键研究切入点,促成了面向智能体输出可靠性的对抗验证机制设计——这些高价值冲突样本成为解析人机认知差异的核心素材。此外,基于该数据集的角色定制化评分准则(rubric)已被推广至工业级智能体系统,成为众包评估与自动化质量门控的通用模板,标志着多智能体工作流数据集从实验工具向行业标准的关键跃迁。
数据集最近研究
最新研究方向
该数据集聚焦于真实世界多智能体协作工作流的细粒度记录与自动化质量评估,为AI agents在复杂软件开发任务中的交互模式、决策机制及人机协同效能研究提供了宝贵的基础数据。前沿方向包括基于隐式人类反馈的行为理解(如工作流推进信号映射为批准、修订或拒绝标签)、跨代理角色(规划者、架构师、编码员等)的协同优化,以及利用双重AI评估器(Claude与GPT)进行鲁棒性质量评分与分歧案例挖掘。这一资源对推动自主智能体系统在工程实践中的可信落地、工作流自动化反思与迭代学习具有重要影响,尤其在游戏开发等需要多环节紧密配合的领域,为理解agent间的依赖关系与冲突解决机制树立了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务