遇见数据集

GDPevo

收藏
github2026-06-22 更新2026-06-24 收录
官方服务:

资源简介:

GDPevo是一个用于评估代理在真实业务任务上自我进化的公共基准数据集,包含客户关系管理(CRM)、企业资源规划(ERP)和金融领域的12个任务组,共120个任务;每个组有一个共享业务环境、5个训练任务和5个保留测试任务。

GDPevo is a public benchmark dataset for evaluating agents' self-evolution on real-world business tasks. It comprises 12 task groups spanning Customer Relationship Management (CRM), Enterprise Resource Planning (ERP) and financial domains, with a total of 120 tasks. Each group features a shared business environment, 5 training tasks and 5 held-out test tasks.

创建时间:
2026-06-05
原始信息汇总

数据集概述:GDPevo

GDPevo 是一个用于评估智能体在真实商业工作场景中自我进化能力的公开基准测试。该数据集通过设计包含训练和测试任务的业务环境,衡量智能体的性能提升与成本变化。

核心内容

  • 包含任务:120 个任务,涵盖客户关系管理 (CRM)、企业资源规划 (ERP) 和财务三大领域。
  • 任务分组:12 个任务组,每个组包含:
    • 1 个共享业务环境。
    • 5 个训练任务。
    • 5 个保留测试任务。

评估结果示例

评估指标为 acc@3(精确率,取 3 次尝试中的最佳结果),报告为 12 个任务组的平均值,成本以美元计。

执行框架 模型 思考层级 base acc@3 fewshot acc@3 reflect acc@3 精度提升 成本变化
Codex GPT-5.5 极高 48.35% 65.99% 67.13% +18.21 个百分点 -25.75%
Claude Code Opus 4.8 极高 49.11% 70.90% 67.94% +20.31 个百分点 -8.69%
Panofy Opus 4.6 50.17% 68.24% 67.98% +17.94 个百分点 +11.82%

完整实验数据参见 experiments/EXPERIMENT_BOARD.md,各任务细项报告位于对应实验目录下。

数据构建流程

数据集通过三阶段工作流构建,各阶段均提供代理就绪的工作区:

  • 阶段 1:场景发现:根据目标业务场景,从原始数据集中收集相关数据项。
  • 阶段 2:任务组综合:基于一个场景构建完整的任务组,包括任务描述、环境和参考答案。
  • 阶段 3:质量过滤:通过脚本检查和独立评审代理投票,对任务组进行质量审核。
  • 额外评估阶段:对发布的任务组进行正式的 acc@3、Token 与成本评估。

仓库结构

路径 用途
data/ 发布的基准数据,包含任务组、共享环境、训练/测试任务、参考答案和基于规则的评估器。
data_construction/ 场景发现、任务组综合和质量过滤的构建工作区。
evaluation/ 已发布任务组的可复用评分评估工作区。
experiments/ 已发布的评估结果、报告 YAML 文件以及汇总实验板。
site/ 基准发布的公共网站和博客。

使用方式

  • 基准数据:先阅读 data/DATA_BOARD.md 摘要,再查看 data/task_groups/ 下的具体任务组。
  • 评估结果:先阅读 experiments/EXPERIMENT_BOARD.md,再打开三个实验目录下的任务细项报告。
  • 构建工作区:使用 data_construction/ 下的三阶段工作流;阶段 1-3 专为 Codex 工作流设计,其他代理框架可复用结构,但可能需要轻度适配。
  • 评分评估工作区:使用 evaluation/eval_workspace/
搜集汇总
数据集介绍
GDPevo 数据集图片
构建方式
GDPevo数据集的构建遵循一套严谨的三阶段流程,旨在模拟真实商业场景中的智能体自我进化能力。首先,通过场景发现阶段,从原始数据集中筛选符合客户关系管理、企业资源规划及金融等特定业务场景的数据项。其次,任务组合成阶段依据发现的场景,构建包含一个共享商业环境、5个训练任务及5个保留测试任务的完整任务组。最后,质量过滤阶段利用脚本检查与独立评审代理投票机制,对每个任务组进行严格的质量审核,确保数据集的高标准与可靠性。
特点
GDPevo数据集覆盖了客户关系管理、企业资源规划及金融等关键商业领域,共计120个任务,分布于12个任务组中。其核心特色在于每个任务组均拥有统一的商业环境,并明确划分训练与测试任务,为评估智能体自我进化能力提供了标准化的基线。此外,数据集记录了多种智能体框架(如Codex、Claude Code、Panofy)在基础、少样本及反思模式下的准确率和成本变化,展现了多维度性能指标。
使用方法
用户可通过GitHub仓库直接访问数据集,首先查阅数据摘要文档以了解任务组概览,随后深入指定目录查看具体任务细节。评估结果存放于实验目录中,用户可浏览整体实验面板或逐任务分析报告。对于希望复现或扩展研究的用户,数据集提供了可重用的构建工作空间和评分评估工作空间,支持Codex等智能体框架的自动化流程。使用时需将相应输入数据放置在工作空间内,并发送提示词以触发工作流,最终获取评估报告。
背景与挑战
背景概述
GDPevo是由PrismShadow团队于2026年发布的公共基准测试数据集,旨在系统性评估智能体在真实商业任务中的自我进化能力。该研究聚焦于客户关系管理、企业资源规划及金融三大核心业务领域,构建了涵盖12个任务组、共计120项任务的评测体系。每个任务组均包含共享业务环境、5项训练任务及5项保留测试任务,为探究智能体在动态商业场景下的能力跃迁提供了标准化实验平台。作为首个面向真实业务场景的自我进化评测基准,GDPevo填补了现有智能体评估体系缺乏演进性指标的空白,对验证任务规划与反思机制的有效性具有里程碑意义。
当前挑战
该数据集面临的核心挑战在于如何精确量化智能体在有限样本下的持续学习能力,即通过少量训练任务实现测试任务性能的非平凡提升。构建过程中,团队需应对三大难题:其一,真实业务环境的高度复杂性要求任务设计必须捕捉跨系统交互的细微语义;其二,12个任务组需在保持领域多样性与评估公平性间取得平衡;其三,与Codex、Claude Code等主流工具链的集成需解决异构接口兼容性问题。此外,成本控制与评测标准的鲁棒性亦是关键挑战,实验结果显示不同框架下性能提升幅度差异显著,凸显了评估体系需进一步规范化。
常用场景
经典使用场景
GDPevo作为面向真实商业场景的智能体自演化能力评估基准,其经典使用场景聚焦于客户关系管理、企业资源计划与财务三大领域的自动化任务执行。该基准精心设计了12个任务组,每个组包含共享业务环境、5个训练任务与5个保留测试任务,共计120项任务。研究者可利用此平台系统性评估智能体在少样本学习、自我反思等自演化范式下的性能跃迁,通过acc@3精度、推理层级与运行成本等核心指标,量化智能体从基础模式向进化模式的蜕变过程。这一场景为开发者提供了标准化测试床,用以验证模型在真实业务闭环中的适应性提升。
衍生相关工作
GDPevo的发布催生了一系列围绕智能体自演化的衍生研究。其三层构建管线(场景发现、任务组合合成、质量筛选)为其他领域创建同类基准提供了方法论模板,后续工作可借鉴此架构构建医疗、法律等垂直领域的自演化评估集。基于该基准的实验结果表明,自我反思策略显著提升了智能体在真实业务中的准确率,这激发了关于反思机制深度与计算开销平衡的探讨,衍生出轻量级进化框架的研究。此外,任务组间跨领域迁移能力的分析催生了业务场景共性特征提取工具的开发,推动课题组探索跨行业智能体自演化的底层模式与核心瓶颈。
数据集最近研究
最新研究方向
在人工智能代理能力评估的前沿探索中,GDPevo数据集聚焦于真实商业场景下智能体的自我进化能力评测。随着企业数字化转型的深化,客户关系管理(CRM)、企业资源规划(ERP)及财务分析等核心业务领域对AI代理的自主适应与持续学习能力提出了严苛要求。GDPevo突破了传统静态评测的局限,通过构建共享业务环境与保留测试任务的创新范式,精准衡量代理在未见任务上的泛化表现。实验数据表明,结合推理增强机制的代理系统在准确性上实现了最高20个百分点的显著提升,同时伴随成本优化。该基准的建立不仅为代理自我进化研究提供了标准化测试平台,更推动了AI从任务执行到能力演化这一关键范式的转变,为构建真正适应动态商业环境的智能系统奠定了评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务