遇见数据集

commercial-credit-v0.1

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

UWBench 商业信用 v0.1 是一个用于评估 AI 代理在商业信用承销(credit underwriting)任务中表现的开源基准测试数据集。该数据集包含 10 个完全合成的商业信用案例(case-00001 至 case-00010),每个案例提供原始文档、政策规则、结构化评分卡以及公共参考文件(如预期答案、引用索引、审阅者注释、裁决说明和决策效用)。数据集设计了三个独立的评估通道:raw_documents(代理直接处理原始文档、记录和政策,评估端到端操作性能)、normalized_data(提供规范化的提取记录和政策,隔离 OCR/解析环节的影响)、reasoning_only(提供真实数据、事实和适用规则,仅评估风险、政策、后续行动、备忘录和决策推理)。所有数据均为合成,不包含真实借款人信息。该基准专用于信用承销场景,不得用于投资银行交易执行。数据许可证为 Apache-2.0,语言为英语,规模为 10 个案例。注意:该基准数据不得用于训练模型。

UWBench Commercial Credit v0.1 is an open-source benchmark dataset for evaluating AI agents in commercial credit underwriting tasks. It contains 10 fully synthetic commercial credit cases (case-00001 to case-00010), each providing raw documents, policy rules, structured scorecards, and public reference files (e.g., expected answers, citation indices, reviewer notes, adjudication explanations, and decision utilities). The dataset designs three independent evaluation lanes: raw_documents (agents process raw documents, records, and policies directly to assess end-to-end operational performance), normalized_data (provides normalized extracted records and policies to isolate OCR/parsing effects), and reasoning_only (provides ground-truth data, facts, and applicable rules to evaluate risk, policy, follow-up actions, memoranda, and decision reasoning). All data is synthetic and contains no real borrower information. The benchmark is specifically for credit underwriting scenarios and should not be used for investment banking trade execution. The data license is Apache-2.0, language is English, and the size is 10 cases. Note: The benchmark data must not be used for training models.

创建时间:
2026-08-16
原始信息汇总

UWBench — commercial-credit-v0.1 数据集概述

基本信息

  • 数据集ID: uwbench/commercial-credit-v0.1
  • 许可证: Apache-2.0(适用于代码与数据)
  • 语言: 英语
  • 规模: 小于1K条样本
  • 任务类别: 其他(金融/基准测试/智能体评估)
  • 版本: 冻结的公开Alpha版本 v0.1.0-alpha.1
  • 资源论文: doi:10.5281/zenodo.22035851

数据集性质

  • 这是一个商业信贷承销(credit underwriting)基准测试,而非投资银行业务执行基准
  • 用于评估智能体在商业信贷案件文件、政策规则和结构化评分卡上的表现
  • 包含10个合成的公开案例case-00001case-00010
  • 不包含真实借款人文件,所有名称、财务数据及政策文本均为合成内容
  • 认证案例不在此数据集中,单独存储于私有仓库
  • 训练语料中严禁出现本基准数据(含防泄露UUID标识)

内容结构

  • 黄金/参考文件: 每个案例的 private/ 目录下包含 expected-*citation-indexreviewer-annotationsadjudication-notesdecision-utility 等公开参考文件
  • 合成文件: 全部10个案例包含合成的PDF/XLSX/DOCX文件,非银行原始文件或EDGAR提交材料
  • 归档文件: 提供 input.uwb(不可信智能体)和 reference.uwb(可信评分器)两种物理分离的ZIP归档

评估通道

通道 智能体接收内容 隔离的变量
raw_documents 原始文档/记录/政策(通过工具获取) 端到端运营表现
normalized_data 规范化提取记录+政策 不含OCR/解析的承销表现
reasoning_only 真实数据分布、事实及适用规则 风险、政策、跟进、备忘录、决策推理

注意: 不同通道的分数不得合并到同一排行榜,发布分数时必须标注通道。

参与者与工具

  • 首个参与者: SecureLend专业承销智能体(非UWBench所有者)
  • 基线: 第三方工具上的独立模型,使用相同公开案例与评分卡
  • 首批支持的工具: Claude Code、Codex、Gemini CLI、pi(pi cli)
  • 报告中需标注 模型 × 工具 × 通道 三个维度

测试结果

  • 无官方排行榜,仅有带日期标注的公开Alpha试点矩阵
  • 所有结果均标注模型、工具和通道,属于非盲工程测量,不是认证结果或受控模型排名

文件结构

dataset/ ├── README.md └── commercial-credit-v0.1/ ├── benchmark.yaml ├── case-index.public.json ├── manifest.json ├── archives/ └── cases/case-00001 … case-00010

引用方式

使用本数据集时,请引用冻结的UWBench发布版本:

bibtex @misc{pfuetze2026uwbench, title = {UWBench: A Vendor-Neutral Protocol and Case Set for Evaluating Credit-Underwriting Agents}, author = {Pfuetze, Tobias}, year = {2026}, publisher = {Zenodo}, version = {v0.1.0-alpha.1}, doi = {10.5281/zenodo.22035851}, url = {https://doi.org/10.5281/zenodo.22035851} }

搜集汇总
数据集介绍
commercial-credit-v0.1 数据集图片
构建方式
该数据集由UWBench项目构建,专注于商业信贷承销场景,包含10个合成公开案例(case-00001至case-00010),每个案例均配有原始文档(PDF/XLSX/DOCX)、政策规则及结构化评分卡。数据集采用三通道评估框架:raw_documents通道提供原始文件,normalized_data通道提供规范化提取记录,reasoning_only通道提供真实数据与适用规则,以隔离不同环节的评估维度。黄金参考文件(expected-*、citation-index等)存储在private/目录中,作为公开参考而非隐藏密钥,便于本地评分与协议开发。数据集通过ZIP归档(input.uwb与reference.uwb)实现运行时打包,并包含清单文件以记录文件哈希与角色,确保可验证性与可复现性。
特点
该数据集具有鲜明的领域专精性与设计完备性。所有案例均为合成数据,不涉及真实借款人,规避隐私风险,同时保持政策文本与财务数据的逼真性。三通道评估机制允许独立衡量端到端运营性能、不含解析的承销能力以及纯推理能力,为细粒度归因提供支持。数据集中包含预打包的输入与参考归档,支持离线评分与协议开发。此外,数据集明确禁止将不同通道结果混合排名,并强调模型×工具×通道的三维报告要求,为跨环境比较奠定了严谨基础。无官方排行榜,工程测量结果均标注日期与条件,确保透明性。
使用方法
用户需克隆UWBench代码仓库并运行本地CLI,实现HTTP/JSON代理协议以接入评估。数据集支持多工具(如Claude Code、Codex、Gemini CLI及pi)作为执行平台,评分时需指定模型、工具与通道。每个案例的输入归档(input.uwb)供代理读取,参考归档(reference.uwb)用于本地评分。用户可针对特定通道(如reasoning_only)进行测试,但不得将不同通道结果合并至同一排行榜。数据集包含完整的清单文件,可通过sha256校验确保文件完整性。严禁将数据集用于模型训练,仅可用于评估协议开发和基准测试。发布分数时必须注明对应的通道,以保证结果的可解释性和可比性。
背景与挑战
背景概述
商业信贷审批是金融风险管理的核心环节,其决策质量直接关系到金融机构的资产安全与信贷资源配置效率。随着人工智能技术的迅猛发展,利用大语言模型及智能体(Agent)辅助信贷审批已成为金融科技领域的前沿研究方向,然而缺乏统一的评估基准与标准化的测试体系,严重制约了该领域的技术迭代与应用落地。UWBench正是在此背景下应运而生,由Tobias Pfuetze主导研发,于2026年发布了面向商业信贷审批智能体的公开基准数据集——commercial-credit-v0.1。该数据集包含10个合成的商业信贷案例,涵盖原始文档、规范化数据及推理标注等多个维度,并创新性地设计了三条独立评估通道(raw_documents、normalized_data、reasoning_only),旨在全面衡量智能体在信贷审批全流程中的操作性能、信息提取能力及决策推理水平。作为全球首个专门针对商业信贷审批智能体的标准化基准,UWBench不仅填补了该领域评估工具的空白,更通过其开源的协议与程序,为金融机构、学术研究机构及技术开发商提供了一个中立、可复现的试验场,对推动智能信贷审批技术的规范化发展具有里程碑式的意义。
当前挑战
commercial-credit-v0.1数据集所应对的核心挑战源于商业信贷审批领域的高复杂性与高敏感性。首先,信贷审批涉及财务分析、风险评估、合规审查等多维度专业知识,且要求智能体具备处理非结构化文档(如PDF、XLSX)的能力,这远超通用问答任务的能力范畴;其次,真实信贷数据受限于隐私法规与商业机密,难以公开,导致研究者在数据获取上面临巨大障碍。在数据集构建过程中,研究团队需确保所有案例的合成性,避免任何真实借款人信息的泄露,同时又要保证案例在语义与结构上能有效反映真实信贷场景的复杂性。此外,为规避训练语料污染,数据集采用了独特的金标文件公开策略,并引入了CANARY UUID进行追踪,但如何在公开参考文件的同时防止智能体通过记忆获取答案,仍是需要持续优化的难题。更为棘手的是,要设计出能够区分不同智能体在信息提取、逻辑推理及决策判断三个维度上能力的评估体系,并确保各评估通道之间互不干扰,这要求精细的任务切分与严谨的评分标准。尽管UWBench已初步确立了评估框架,但缺乏官方排行榜及大规模实测数据,使得基准的效度与信度仍需通过更多参与者与跨机构验证来进一步巩固。
常用场景
经典使用场景
商业信贷承销是金融风险管理与人工智能交叉领域的前沿课题,而UWBench的commercial-credit-v0.1数据集为该课题提供了系统化的评估基准。此数据集的核心应用场景在于检验AI代理在复杂商业信贷案例中的综合承销能力,涵盖原始文档解析、数据规范化处理及纯推理判断三个严苛的测试维度。研究者可借助该数据集模拟真实的信贷审批流程,评估代理从资料审阅、风险识别到政策遵循乃至最终决策的全链路表现。其独特的三车道设计有效分离了感知、解析与决策性能,为细粒度诊断代理能力短板提供了科学依据,广泛应用于金融机构的智能风控模型迭代与多智能体协作策略优化等研究。
实际应用
在实际应用中,commercial-credit-v0.1数据集是金融机构甄选和部署信贷承销AI系统的关键试金石。银行与金融科技公司可利用该基准对意向采购或自研的智能体进行基准压力测试,从而客观、可复现地比较不同产品在多种任务场景下的承销质量与风险控制水平。它支持本地化评分与协议开发,极大降低了内部验证的准入门槛,使得风控团队能够在无隐私泄露风险下安全评估AI代理对复杂案例的处置能力。此外,该数据集所倡导的模型-工具-测试场景多维报告体系,为行业提供了透明化选型的参照范例,推动智能信贷由概念验证迈向实质性的合规部署。
衍生相关工作
此数据集的发布催生了一系列相关的科研与工程探索。以SecureLend为起点的参考参与者模式,确立了专用承销代理的设计范式,其开源的运行协议与基准代码被后续研究广泛采纳。在此基础上衍生出的工作聚焦于各评估车道的性能剖析,例如对比不同模型在原始文档车道中的OCR鲁棒性,或在纯推理车道中的政策套用准确率。同时,这一基准激发了关于金融文档智能体免训练评估协议的讨论,其独立归档结构与永久保密标识机制为后来类似的高敏感领域(如医疗保险核赔)基准构建提供了蓝本。更为重要的是,它促使学界开始系统研究评估车道隔离对排名的实质性影响,开启了多维度评价金融语言代理的新篇章。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务