commercial-credit-v0.1
收藏资源简介:
UWBench 商业信用 v0.1 是一个用于评估 AI 代理在商业信用承销(credit underwriting)任务中表现的开源基准测试数据集。该数据集包含 10 个完全合成的商业信用案例(case-00001 至 case-00010),每个案例提供原始文档、政策规则、结构化评分卡以及公共参考文件(如预期答案、引用索引、审阅者注释、裁决说明和决策效用)。数据集设计了三个独立的评估通道:raw_documents(代理直接处理原始文档、记录和政策,评估端到端操作性能)、normalized_data(提供规范化的提取记录和政策,隔离 OCR/解析环节的影响)、reasoning_only(提供真实数据、事实和适用规则,仅评估风险、政策、后续行动、备忘录和决策推理)。所有数据均为合成,不包含真实借款人信息。该基准专用于信用承销场景,不得用于投资银行交易执行。数据许可证为 Apache-2.0,语言为英语,规模为 10 个案例。注意:该基准数据不得用于训练模型。
UWBench Commercial Credit v0.1 is an open-source benchmark dataset for evaluating AI agents in commercial credit underwriting tasks. It contains 10 fully synthetic commercial credit cases (case-00001 to case-00010), each providing raw documents, policy rules, structured scorecards, and public reference files (e.g., expected answers, citation indices, reviewer notes, adjudication explanations, and decision utilities). The dataset designs three independent evaluation lanes: raw_documents (agents process raw documents, records, and policies directly to assess end-to-end operational performance), normalized_data (provides normalized extracted records and policies to isolate OCR/parsing effects), and reasoning_only (provides ground-truth data, facts, and applicable rules to evaluate risk, policy, follow-up actions, memoranda, and decision reasoning). All data is synthetic and contains no real borrower information. The benchmark is specifically for credit underwriting scenarios and should not be used for investment banking trade execution. The data license is Apache-2.0, language is English, and the size is 10 cases. Note: The benchmark data must not be used for training models.
UWBench — commercial-credit-v0.1 数据集概述
基本信息
- 数据集ID:
uwbench/commercial-credit-v0.1 - 许可证: Apache-2.0(适用于代码与数据)
- 语言: 英语
- 规模: 小于1K条样本
- 任务类别: 其他(金融/基准测试/智能体评估)
- 版本: 冻结的公开Alpha版本
v0.1.0-alpha.1 - 资源论文: doi:10.5281/zenodo.22035851
数据集性质
- 这是一个商业信贷承销(credit underwriting)基准测试,而非投资银行业务执行基准
- 用于评估智能体在商业信贷案件文件、政策规则和结构化评分卡上的表现
- 包含10个合成的公开案例(
case-00001至case-00010) - 不包含真实借款人文件,所有名称、财务数据及政策文本均为合成内容
- 认证案例不在此数据集中,单独存储于私有仓库
- 训练语料中严禁出现本基准数据(含防泄露UUID标识)
内容结构
- 黄金/参考文件: 每个案例的
private/目录下包含expected-*、citation-index、reviewer-annotations、adjudication-notes、decision-utility等公开参考文件 - 合成文件: 全部10个案例包含合成的PDF/XLSX/DOCX文件,非银行原始文件或EDGAR提交材料
- 归档文件: 提供
input.uwb(不可信智能体)和reference.uwb(可信评分器)两种物理分离的ZIP归档
评估通道
| 通道 | 智能体接收内容 | 隔离的变量 |
|---|---|---|
raw_documents |
原始文档/记录/政策(通过工具获取) | 端到端运营表现 |
normalized_data |
规范化提取记录+政策 | 不含OCR/解析的承销表现 |
reasoning_only |
真实数据分布、事实及适用规则 | 风险、政策、跟进、备忘录、决策推理 |
注意: 不同通道的分数不得合并到同一排行榜,发布分数时必须标注通道。
参与者与工具
- 首个参与者: SecureLend专业承销智能体(非UWBench所有者)
- 基线: 第三方工具上的独立模型,使用相同公开案例与评分卡
- 首批支持的工具: Claude Code、Codex、Gemini CLI、pi(pi cli)
- 报告中需标注 模型 × 工具 × 通道 三个维度
测试结果
- 无官方排行榜,仅有带日期标注的公开Alpha试点矩阵
- 所有结果均标注模型、工具和通道,属于非盲工程测量,不是认证结果或受控模型排名
文件结构
dataset/ ├── README.md └── commercial-credit-v0.1/ ├── benchmark.yaml ├── case-index.public.json ├── manifest.json ├── archives/ └── cases/case-00001 … case-00010
引用方式
使用本数据集时,请引用冻结的UWBench发布版本:
bibtex @misc{pfuetze2026uwbench, title = {UWBench: A Vendor-Neutral Protocol and Case Set for Evaluating Credit-Underwriting Agents}, author = {Pfuetze, Tobias}, year = {2026}, publisher = {Zenodo}, version = {v0.1.0-alpha.1}, doi = {10.5281/zenodo.22035851}, url = {https://doi.org/10.5281/zenodo.22035851} }




