遇见数据集

chi-bench

收藏
github2026-06-05 更新2026-06-08 收录
官方服务:

资源简介:

χ-Bench是一个用于评估AI代理在美国医疗工作流程中的基准数据集,涵盖三个长期领域:提供者先授权、支付者利用管理和人群护理管理。每个任务在20个医疗应用的高保真模拟器中提供临床案例,包含1,279份管理护理操作手册技能,要求代理通过工具调用和工件创作来驱动案例。

χ-Bench is a benchmark dataset for evaluating AI Agents in U.S. healthcare workflows, covering three long-standing domains: Provider Prior Authorization, Payer Utilization Management, and Population Care Management. Each task presents clinical cases within 20 high-fidelity simulators for healthcare applications, incorporates 1,279 skills sourced from managed care operational manuals, and requires agents to drive the cases through tool invocation and artifact creation.

创建时间:
2026-05-08
原始信息汇总

数据集概览

名称

  • χ-Bench (CHI-Bench):全称为 Clinical Healthcare In-Situ Environment,是一个用于评估AI代理在长周期、政策密集的医疗工作流程中表现的基准。

核心目标

  • 衡量AI代理在美国医疗工作流中的端到端执行能力,覆盖三个长期任务领域:医疗服务提供者的事先授权、支付方的利用管理以及人群护理管理

任务规模与构成

  • 总计75个任务,分为三个领域,每个领域25个任务:
    • 事先授权 – 医疗服务提供者:验证覆盖范围、收集证据、提交预授权申请包、处理回应(RFI、同行评审、上诉)。
    • 事先授权 – 利用管理(支付方):受理请求、检查计划政策、通过护士和医师评审升级、做出裁决。
    • 护理管理:审查病历、联系患者、进行评估、撰写护理计划。
  • 另有23个提供者↔支付方端到端任务(不在Harbor hub上,需从本仓库运行),构成双代理模式。
  • 提供3个马拉松任务(在一个会话中连续完成所有25个任务)。

环境与模拟器

  • 基于20个医疗应用的高保真模拟器,通过 MCP(Model Context Protocol) 暴露。
  • 提供包含1,279份Markdown文档Managed-Care Operations Handbook作为技能知识库。

已知性能

  • 最佳代理(Claude Code + Claude Opus 4.6):28.0% 整体 pass@1
  • 严格评估(pass^3)下,无代理超过20%
  • 马拉松模式:整体3.8%
  • 提供者–支付方端到端对决中,最佳PA代理0%成功率

代理支持

  • 支持的代理类型包括:claude-codecodexgemini-cliopenclawhermesopenai-agentsdeepagents
  • 支持多种模型后端(Anthropic、OpenAI、Gemini、OpenRouter等)。

评估指标

  • 核心指标:pass@1(一次尝试通过率)。
  • 详细评分文件:scorecard.json 提供二元奖励(strict,全部检查通过得1.0)和部分奖励(通过检查数/总检查数)。
  • 检查分组阶段:md_reviewoutcomecross_stageintakenurse_reviewp2pappealprovider_*cm_*e2e_consistency

提交与排行榜

  • 提交流程:验证→运行→检查状态→准备提交包→提交到Leaderboard仓库
  • 支持部分提交(指定领域),接受但标记为部分提交。
  • 排行榜仅发布 pass@1 结果。

安装与运行(概述)

  • 依赖:Python 3.12+、Docker、uv。
  • 需从Hugging Face下载任务数据集(门控)和操作手册(门控,需申请访问权限)。
  • 构建Docker镜像后可通过CLI运行单个任务或完整实验矩阵。
  • 支持 Modal 进行远程沙盒并行化运行。

架构

  • 单一Python包(chi_bench)包含:FastAPI服务器、三个MCP服务器(提供者、支付方、护理管理)、基于LLM的工作空间评审器。
  • 每次试验在全新Docker容器中运行,捆绑服务器、评审器、代理框架和任务夹具。
  • 操作手册在试验开始时挂载到代理的技能目录中。

数据许可

  • 代码:Apache-2.0。
  • 数据许可详见Hugging Face数据集卡片。

引用

  • 相关论文已发布在arXiv,引用格式见原页面BibTeX条目。
搜集汇总
数据集介绍
chi-bench 数据集图片
构建方式
χ-Bench的构建依托于对真实世界美国医疗工作流程的深度建模,精心设计了涵盖提供者预先授权、支付方利用管理与人口健康管理三大长时域场景的75项任务。每个任务均在一个高保真模拟器中展开,该模拟器集成了20个通过MCP协议暴露的医疗应用程序接口,并配有一部包含1,279份文档的《管理式医疗操作手册》作为智能体的知识技能库。研究团队将临床案例交付给智能体,要求其通过工具调用与工件撰写驱动整个病例处理流程,从而复现端到端的医疗决策链条。
特点
该数据集的核心特质在于其对真实医疗工作流复杂性的高度还原与严苛评估标准。智能体需在长时域、策略密集型的环境中执行验证覆盖、收集证据、提交预先授权包、回应信息请求、开展同行评审与上诉等系列操作。尤为突出的是,数据集引入了双重奖励机制,以严格的二元奖励作为排行榜基准,同时提供分步通过率作为细粒度诊断依据。实验结果显示,最优智能体仅能取得28.0%的整体通过率,充分揭示了现有AI在应对此类复杂医疗场景时的显著局限性。
使用方法
使用χ-Bench需先配置Python 3.12以上环境及Docker,通过uv工具完成项目安装与依赖同步。用户须在环境变量文件中填入必要的API密钥,并从Hugging Face下载门控数据集与操作手册。运行实验支持本地Docker或通过Modal平台实现远程并行加速,用户可通过命令行指定代理类型与模型进行单任务测试。提交至排行榜需经历配置验证、运行试验、状态检查与数据包准备四个步骤,最终将生成的标准数据包提交至排行榜仓库即可完成发布。
背景与挑战
背景概述
χ-Bench(临床医疗原生环境基准,简称chi-bench)诞生于大型语言模型代理在复杂、长程工作流中的能力评估需求日益凸显的背景之下。该数据集由Actava团队于2026年牵头创建,联合多位来自约翰霍普金斯大学、伊利诺伊大学厄巴纳-香槟分校等机构的临床与人工智能领域研究者共同开发。其核心研究问题聚焦于:AI代理能否自主完成美国医疗体系内三项跨领域的逐级长程工作流——提供方事先授权、支付方利用管理及人群护理管理。通过构建一个包含20个医疗应用模拟器、1279份管理式医疗操作手册技能库的逼真测试环境,并在75项任务上进行了系统评估,该基准迅速成为衡量医疗代理系统自主决策能力的重要标尺,对推动长时域、策略密集型工作流自动化研究产生了深远影响。
当前挑战
该基准面临的首要挑战在于,所解决的领域问题极具复杂性:医疗工作流不仅要求代理理解大量专业策略文档,还需在多个系统间协调执行长达十数步的决策与交涉,例如处理事先授权中的拒赔、同行评审及上诉等环节。当前最优代理在严格通过率上仅达20%,端到端医-保博弈场景中更是降至0%,揭示了现有系统在理解语境、遵循时序约束与跨系统协作方面的严重不足。构建过程中亦遭遇显著困难,包括对20余个医疗API接口的精准模拟、确保评测器对每一个操作步骤进行客观公允的独立评判,以及将1279页策略手册以可搜索的标记化层级结构整合进测试框架,这些均对数据集的真实感与可复现性构成了严峻考验。
常用场景
经典使用场景
在临床工作流智能体评估领域,χ-Bench(chi-bench)被经典地用于评测AI智能体在长程、策略密集的端到端美国医疗工作流中的表现。该基准涵盖三大核心场景:医疗服务提供方的预先授权管理、支付方的利用率管理以及人群健康管理。每个任务将智能体置于高保真模拟器中,模拟20个真实医疗应用程序的交互环境,并配以包含1,279份文档的管理式医疗操作手册作为知识库,要求智能体通过工具调用和工件撰写完成从病例接诊到最终决策的全链条处理。这一设计使得研究者能够量化评估前沿语言模型驱动的智能体在复杂医疗规程中的执行能力与纠错韧性。
解决学术问题
χ-Bench精准回应了当前AI研究中对长程、策略性任务评估的匮乏困境。现有基准多聚焦于短程问答或单步代码生成,忽视了真实世界医疗工作流中多阶段决策、跨系统协作及政策遵从性的严苛要求。该数据集通过构建75个标准化任务,系统性地揭示了主流智能体在端到端医疗流程中的显著短板:最佳模型(Claude Code + Claude Opus 4.6)的首次尝试通过率仅28.0%,而严格的多次独立通过率更低于20%。这种量化缺口推动了学术界对智能体规划连贯性、工具调用准确性及长距离推理能力的深度反思,催生了大量关于工作流分解、错误恢复机制及领域知识注入的研究新范式。
衍生相关工作
自χ-Bench发布以来,其工作流定义与评估方法论已衍生出一系列引人注目的研究进展。最直接的后续工作包括对其智能体策略失败模式的深度剖析,研究者通过分析得分卡(scorecard)中的检查项分解,系统归类了智能体在医疗流程各阶段(如临床审查、结果裁定、跨阶段一致性)的典型失误类型。此外,受其多智能体协作场景(provider-payer E2E arena)启发,涌现了若干专注于双智能体协作规划与信息中继优化的新算法。该数据集的管理式医疗操作手册也催生了领域知识检索增强生成技术的专项研究,探索如何将1,279份结构化政策文档高效融入智能体的实时决策中。更广泛的,χ-Bench的架构设计(MCP服务器、Docker化沙盒、LLM评判器)已成为构建复杂领域智能体基准的参考蓝图,推动了金融、法律等行业的类似评估框架开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务