遇见数据集

ArtificialAnalysis/AA-Briefcase-Lite

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

AA-Briefcase-Lite是AA-Briefcase的公共示例场景,由Artificial Analysis开发,用于前沿AI代理在现实、长期知识工作方面的评估。该数据集扩展了前沿模型基准测试的范围,超越了编码和短形式推理,涵盖了知识工作者日常产生的专业交付成果。数据集包含一个商业尽职调查场景,模拟美国中型市场私募股权公司Halberd Capital Partners对新西兰鸡蛋生产商Aurora Eggs Ltd的收购前尽职调查。场景基于新西兰鸡蛋市场的真实数据,包含真实和合成文档,以及需要代理识别和协调的跨来源矛盾。数据集包括一周的任务,涵盖四个可独立完成的交付成果:市场结构概述(LaTeX/PDF)、市场规模和预测模型(Excel)、目标评估(PowerPoint)以及初步发现简报视频(MP4/SRT)。源文件池包含67个来源(147个文件),分为共享文件和每周文件。数据集文件包括checks.jsonl(63个检查项)和tasks.jsonl(4个任务)。评估方法基于Stirrup框架,在离线沙箱中进行,使用前沿模型作为评委进行分级。数据集还包含用于生成和分级的提示模板,以及六个前沿模型的示例提交。

AA-Briefcase-Lite is the public example scenario for AA-Briefcase, Artificial Analysis frontier agentic evaluation of realistic, long-horizon knowledge work. It extends frontier model benchmarking beyond coding and short-form reasoning to the professional deliverables knowledge workers produce day to day. The dataset features a commercial due-diligence engagement where the evaluated model assists a Vice President at Halberd Capital Partners, a fictional US mid-market private-equity firm, in conducting outside-in commercial due diligence on Aurora Eggs Ltd, a privately-held New Zealand egg producer. The scenario is grounded in real data from the New Zealand egg market and uses real and synthetic documents, including deliberate cross-source contradictions. It contains one week of tasks with four independently completable deliverables: market overview (LaTeX/PDF), market sizing and forecast model (Excel), target assessment (PowerPoint), and preliminary findings briefing video (MP4/SRT). The source pool holds 67 sources (147 files) in shared and week-specific groups. Dataset files include checks.jsonl (63 checks) and tasks.jsonl (4 tasks). The methodology is built on the Stirrup framework, using an offline sandbox environment and graded by a panel of frontier models. The dataset also includes prompts for generation and binary rubric grading, as well as example submissions from six frontier models.

提供机构:
ArtificialAnalysis
搜集汇总
数据集介绍
ArtificialAnalysis/AA-Briefcase-Lite 数据集图片
构建方式
AA-Briefcase-Lite 数据集由 Artificial Analysis 构建,是完整 AA-Briefcase 基准测试的公开示例场景。其构建以模拟私募股权商业尽职调查流程为核心,包含一个为期一周的评估任务,涵盖四项独立可完成的子任务,分别涉及市场概览、市场模型构建、目标评估和简报视频生成。数据集的源文件池包含67份来源(共147个文件),分为共享上下文和每周新增材料两类,涵盖电子邮件、Slack 线程、数据集、会议记录和报告等真实与合成文档,并刻意植入跨来源矛盾以测试模型的识别与调和能力。每个子任务都配有详细的评分规范和证据链,支持严格的二元评分与成对比较评分。
使用方法
使用者可访问 HuggingFace 数据集页面下载 checks.jsonl 和 tasks.jsonl 文件,以及完整的源文件池与提交示例。评测运行基于 Stirrup 开源框架,在完全离线的 E2B 沙箱环境中进行,沙箱预装了广泛的科学计算与文档处理工具栈,包括 Python、LibreOffice、TeX Live 和 FFmpeg 等。每个任务提供最多500轮交互,当上下文窗口填满时,系统会自动总结早期历史以支持长程任务。用户需通过调用专门的提交工具提交交付物,系统随后根据内置的评分规范对输出进行自动评估,输出结果可通过公开排行榜查看,便于比较不同模型的在专业知识工作场景中的表现。
背景与挑战
背景概述
在人工智能领域,前沿模型评测长期集中于代码生成与短程推理任务,然而,知识工作者日常所需的多步骤、跨模态专业交付物生成能力,始终缺乏系统性的评估基准。为填补这一空白,Artificial Analysis 于2026年推出 AA-Briefcase 基准,旨在衡量智能体在真实商业场景中完成长时间跨度、高复杂度知识工作的能力。该数据集 Lite 版本由 Artificial Analysis 核心团队构建,选取私募股权尽职调查这一典型高价值专业场景,要求智能体扮演投资副总裁角色,基于真实市场数据的虚构公司案例,完成市场概述、财务建模、演示文稿及简报视频四类跨格式交付物。AA-Briefcase 系列已在其官网发布排行榜,引发了学术界与产业界对智能体应用能力的广泛关注,成为衡量前沿模型实际生产力的重要标尺。
当前挑战
该数据集的核心挑战在于解决领域问题的复杂性:智能体需应对真实世界商业分析中的数据异构性(67个来源、147个文件涵盖邮件、数据表等多格式)、刻意设置的跨源矛盾信息需要识别与调和,以及长达500步交互周期的长程任务执行能力。在构建过程中,团队面临多重困难:一是设计具有生态效度的虚构公司案例,需确保市场数据与现实新西兰蛋类市场高度一致的同时避免实体关联;二是构建可重复的离线评估沙箱(Stirrup),在无网络环境下预装庞大科学计算与文档处理栈;三是设计严格的二元与成对评分体系,包括三类检查(准确性、关键洞察、分析与呈现质量)及基于前沿模型评委的评判流程,以消除主观偏差。
常用场景
经典使用场景
AA-Briefcase-Lite作为前沿智能体评估基准的公开示例,专为衡量大语言模型在长周期、真实知识工作场景中的表现而设计。该数据集模拟了一家美国私募股权公司对新西兰蛋企的尽职调查流程,要求智能体在67份真实与合成混杂的源文件中完成市场分析、财务建模、演示文稿制作及视频汇报四项独立交付物。其经典使用场景在于评估模型处理多模态文档(包括LaTeX、XLSX、PPTX、视频字幕)、识别跨源矛盾信息、执行长链推理与工具调用,以及生成结构化专业报告的综合能力,填补了传统基准仅聚焦编码与短程推理的空白。
解决学术问题
该数据集系统性地攻克了现有智能体评估体系中的三个核心瓶颈:其一,通过构建包含故意矛盾信息的源文件库,解决了模型在信息不一致场景下的批判性推理与证据链重建能力的量化难题;其二,引入含严格二元通过/失败与成对比较的多维度评分矩阵,解决了主观性专业任务(如演示文稿质量、视频创作)无法客观评估的困境;其三,设计长达500轮交互的离线沙盒环境,克服了长尾任务中上下文窗口溢出导致性能衰减的评估盲区。AA-Briefcase-Lite的发布标志着学术界首次拥有标准化的非编程类知识工作评估框架,为跨模型在财务分析、管理咨询等领域的智力劳动替代效应提供了可复现的测量工具。
实际应用
在实际产业应用中,AA-Briefcase-Lite所定义的评估范式正被金融科技与咨询领域的自动化系统开发者采纳。私募股权公司利用其任务结构训练内部智能体完成初步尽职调查中的市场扫描与风险提示,通过对比模型在'准确性检查'与'关键洞察'两类指标上的表现,优化投资委员会决策前的信息筛选效率。会计师事务所将其中的财务建模任务(市场预测与鸡蛋禁令过渡模型)作为审计自动化的预演案例,验证模型处理行业特定Excel公式与假设演绎的能力。教育科技平台则借鉴其任务设计,构建商科学生的实战训练环境,学习者需在限定时间内从多源文档中提炼商业洞见,并通过PPTX与视频汇报的形式接受多维度评分。
数据集最近研究
最新研究方向
AA-Briefcase-Lite 代表了前沿代理评测从编程与短程推理向长周期、多模态知识工作的范式转型。该数据集围绕私募股权尽职调查这一真实商业场景构建,要求智能体在完全离线的沙盒环境中,集成LaTeX排版、XLSX建模、PPTX演示与MP4简报视频生成等跨模态工具链,完成从信息矛盾识别到交付物产出的全流程作业。其评测体系采用二元通过/失败与两两对比的Elo聚合机制,并引入跨源矛盾检测的C类检验,精准衡量代理在复杂文档矩阵中的溯源与辩证能力。这一设计直接回应了当前LLM在金融、咨询等专业领域从‘对话问答’迈向‘可交付成果生产’的迫切需求,为衡量代理在真实长尾工作流中的执行韧性提供了可复现的标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务