遇见数据集

DRFLOW

收藏
arXiv2026-06-17 更新2026-06-18 收录
数据链接:
官方服务:

资源简介:

DRFLOW是由ServiceNow AI研究院与不列颠哥伦比亚大学联合构建的个性化工作流预测深度研究基准数据集,旨在评估智能体从异构数据源中推理并生成可执行操作序列的能力。该数据集涵盖100个跨领域任务,包含1,246个参考工作流步骤,并植根于超过3,900份来源文档,数据规模庞大且结构复杂。数据集通过端到端的合成管道生成,结合人工验证确保质量,模拟了企业环境中分散于文档、邮件和聊天记录等多源证据的真实场景。其核心应用在于推动智能体在政策合规、客户问题解决等场景中,从混杂信息中自动推断结构化、个性化的操作流程,填补了现有深度研究基准在可执行工作流预测领域的空白。

DRFLOW is a benchmark dataset for in-depth research on personalized workflow prediction, co-developed by ServiceNow AI Research and the University of British Columbia. It aims to evaluate the ability of AI Agents to reason over heterogeneous data sources and generate executable action sequences. This dataset covers 100 cross-domain tasks, contains 1,246 reference workflow steps, and is sourced from over 3,900 source documents, boasting a large scale and complex structure. Generated via an end-to-end synthetic pipeline and paired with manual validation to ensure data quality, it simulates real-world enterprise scenarios where evidence is scattered across multiple sources such as documents, emails, and chat logs. Its core applications lie in advancing AI Agents to automatically infer structured, personalized operational workflows from mixed information in scenarios like policy compliance and customer issue resolution, filling the gap in existing deep research benchmarks for executable workflow prediction.

创建时间:
2026-06-17
搜集汇总
数据集介绍
DRFLOW 数据集图片
构建方式
DRFLOW的构建采用了一套分阶段的数据合成流水线。首先,通过任务种子生成阶段,从特定领域联合合成深度研究问题、公司元数据及用户画像。随后,基于公司侧上下文生成通用的结构化工作流,并衍生出相应的支持性洞察与干扰性信息,最终将这些内容物化为PDF、DOCX等异构企业文档。用户侧证据的生成遵循类似流程,但侧重于利用个人文件、邮件及聊天记录中的个性化事实来解析通用工作流中的条件分支。此外,为增加挑战性,流水线还构建了混合场景,将两个相似但不同的案例证据注入同一任务池中,以测试智能体的跨案例区分能力。所有生成内容均经过人工验证以确保其质量与真实性。
特点
该数据集的核心特点在于其对个性化工作流预测这一前沿领域的专注。DRFLOW包含100个跨越五个领域(B2B、B2C、教育、医疗、法律)的任务,拥有1,246个参考工作流步骤,并根植于超过3,900个异构数据源。其独特之处在于,每个任务要求智能体必须同时处理两类证据:定义通用流程的公司侧信息,以及决定流程分支的个人侧数据。数据集引入了七种诊断性评估指标,不仅衡量步骤的召回率与精确度,更深入到事实依据、结构顺序、条件解析及个性化程度等维度,为评估工作流预测的质量提供了全面的视角。
使用方法
使用DRFLOW数据集时,研究人员需让模型以智能体形式运行,并为其提供包含公司文档、邮件、聊天记录等在内的模拟企业环境。智能体需首先从众多信息源中检索并整合证据,预测出通用的工作流步骤。随后,利用用户侧的个人化证据,智能体必须解析通用工作流中的条件分支,最终输出一个仅适用于当前用户场景的个性化工作流。评估过程通过比对预测产生的个性化工作流与数据集中预设的标准答案,利用上述七项指标自动计算出模型性能,以此衡量模型在复杂、真实的企业级深度研究任务上的能力水平。
背景与挑战
背景概述
近年来,基于语言模型的深度研究系统在复杂信息检索任务中展现出巨大潜力,但现有基准多聚焦于生成报告或摘要等自由形式输出,未能覆盖企业环境中至关重要的个性化工作流预测需求。针对这一缺口,由英属哥伦比亚大学与ServiceNow AI研究团队于2026年联合提出的DRFLOW基准,开创性地将评估重心转向从异构数据源中预测结构化的个性化工作流。该基准包含横跨B2B、医疗、法律等五个领域的100个任务,涵盖1246个参考步骤与逾3900个信息来源,并引入七项诊断性指标以全面衡量事实依据、步骤恢复、条件解析与个性化程度,为深度研究系统的能力评估开辟了全新的维度。
当前挑战
DRFLOW所解决的核心领域挑战在于,现有深度研究基准未能评估智能体从分散的企业文档、邮件和聊天记录中推断出兼具条件分支与用户特化的可执行工作流的能力,而这类任务在政策合规、资格判定等现实场景中极为普遍。在数据构建层面,其面临的挑战尤为严峻:需要设计端到端的合成管道,在生成包含多跳条件与干扰信息的逼真公司及个人工件的同时,确保各任务内部证据的一致性、语境的合理性,并通过人工验证把控质量;此外,还需构造混合变体来测试智能体在高度相似的干扰案例中进行精准区分的能力,这进一步加剧了评估的复杂度。
常用场景
经典使用场景
在深度研究系统日益成为复杂信息寻求任务核心工具的背景下,DRFLOW数据集开创性地将评估焦点从传统的自由文本报告生成转向结构化的个性化工作流预测。该数据集的核心使用场景是评估语言模型驱动的智能体能否从异构的企业数据源(如文档、邮件、聊天记录)中检索分散的证据,并据此预测出一系列可执行的、个性化的操作步骤序列,从而完成用户的特定任务,例如“在预算固定的情况下如何申请新员工名额”。
衍生相关工作
DRFLOW的推出催生了一系列旨在提升智能体工作流预测能力的重要后续研究。其中最具代表性的工作包括研究者提出的DRFA(一种面向工作流的参考智能体),它通过研究规划、自适应动作规划以及条件动作规划等模块,显著提升了工作流预测的精度和个性化水平。此外,DRFLOW也为后续关于企业级智能体在混合数据环境中进行多步推理的研究提供了可复现的评估标准,激励了更多针对结构化输出、条件解析和个性化证据聚合的模型与算法创新。
数据集最近研究
最新研究方向
当前研究前沿正聚焦于将深度研究系统从报告生成向可操作的个性化工作流预测转型。DRFLOW基准应运而生,针对性地评估智能体在异构企业数据源中挖掘证据、预测分步操作序列的能力。该基准首次将结构化工作流预测引入深度研究评估体系,涵盖五类领域的百项任务及七项诊断指标,涵盖事实性、步骤恢复、顺序结构、条件解析与个性化。伴随DRFLOW-Agent的提出,实验揭示即便最前沿的模型在此任务上仍存在显著提升空间,这标志着个性化且结构化的工作流预测成为深度研究领域棘手的挑战前沿,推动了该领域评估范式从自由文本生成向行动导向推理的范式跃迁。
相关研究论文
  • 1
    DRFLOW: A Deep Research Benchmark for Personalized Workflow PredictionServiceNow AI研究院; 不列颠哥伦比亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务