chat-keuangan-bench
收藏资源简介:
一个开放的基准数据集,用于解析印尼非正式金融聊天记录(如WhatsApp风格的俚语、更正、收据、银行流水和多组织账本)为结构化卢比交易,包含两个评估套件:Parse-25(单次提取)和Rupiah-Pro(多轮智能体工具交互)。
An open benchmark dataset for converting informal Indonesian financial chat logs (including WhatsApp-style slang, corrections, receipts, bank statements, and multi-organization ledgers) into structured Indonesian Rupiah transactions, which comprises two evaluation suites: Parse-25 (single-turn extraction) and Rupiah-Pro (multi-turn AI Agent tool interaction).
数据集概述
chat-keuangan-bench 是一个面向印尼语非正式金融聊天场景的开放基准测试集,涵盖 WhatsApp 风格俚语、文本纠错、收据、银行流水及多组织账本等场景。
该基准包含两套评测套件:
Parse-25(单轮信息提取)
- 任务:从单条聊天消息中提取结构化收支 JSON 数据。
- 规模:25 个困难场景(附加基础/压力测试用于回归)。
- 评估指标:严格通过率 + 复合质量等级。
- 典型分数:顶级模型约 21–24/25。
- 运行命令:
bun run eval:hard-25 - 示例输入:
td sore beli pulsa 25rb sama jajan cilok 4 tusuk 5rb 4 4 nyatadi jajan es teh ceban sama gorengan goceng- 非交易语句需返回
bukan_transaksi: true
Rupiah-Pro(多轮智能体交互)
- 任务:多轮记账,支持工具调用(SQLite 账本、OCR、CSV/PDF 文件读取、组织切换、审计导出等)。
- 规模:28 个运行场景,公开评分使用其中 14 个高区分度场景。
- 评分公式(v1.0):
score = 100 × (det/40)² × (ifBench/100)- det:确定性断言(0–40 分),涵盖账本、组织、文件、工具等。
- ifBench:指令遵循规则 R1–R14(0–100 分),作为乘数因子。
- 典型分数:排行榜约 75–88 分。
- 运行命令:
bun run eval:agentic然后bun run score:rupiah-pro - 开放工具:SQLite 账本、收件箱 + OCR、CSV/PDF 读取器、导出工具;网络搜索仅用于信息查询,拒绝“搜索收据/单据”。
排行榜表现(Rupiah-Pro v1.0)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | google/gemini-3.1-flash-lite |
88.1 |
| 2 | xiaomi/mimo-v2.5-pro |
87.9 |
| 3 | z-ai/glm-4.5 |
86.1 |
| 4 | google/gemma-4-31b-it |
84.9 |
| 5 | z-ai/glm-4.7 |
84.6 |
| 6 | qwen/qwen3.6-35b-a3b |
84.6 |
| 7 | inclusionai/ling-2.6-1t |
82.3 |
| 8 | deepseek/deepseek-v4-flash |
76.0 |
| 9 | deepseek/deepseek-v4-pro |
75.0 |
跨度:13.1 分,基于 14 个高区分度场景。
排行榜表现(Parse-25 快照,2026 年 6 月)
| 排名 | 模型 | 严格通过 | 复合质量 | 每 25 次运行成本(IDR) |
|---|---|---|---|---|
| 1 | google/gemini-3.1-flash-lite |
24/25 | 99 | Rp 325 |
| 2 | google/gemini-3-flash-preview |
24/25 | 99 | Rp 570 |
| 3 | google/gemma-4-31b-it |
24/25 | 98 | Rp 114 |
| 4–7 | glm-4.5 / mimo / deepseek-v4-pro / glm-4.7 | 22/25 | 97–98 | Rp 101–291 |
推荐性价比模型:gemma-4-31b-it(同一 24/25 档次,成本约低 2.6 倍)。
数据内容特点
- 数据基于真实的印尼伊斯兰寄宿学校 / 电商金融聊天场景构建。
- 示例场景涵盖:个人财务、基金会/学校账目、俚语纠正、共同支付、OCR 收据、银行流水、受污染历史记录、审计导出等。
- 非交易语句需被模型正确识别为非交易。
快速开始
bash git clone https://github.com/volfadar/chat-keuangan-bench.git cd chat-keuangan-bench cp .env.example .env # 配置 OPENROUTER_API_KEY(可选 DEEPSEEK_API_KEY) bun install
运行 Parse-25
bun run eval:hard-25
运行 Rupiah-Pro
bun run eval:agentic -- --suite all --model google/gemma-4-31b-it bun run score:rupiah-pro
依赖:Bun 运行时、OpenRouter API Key。Agentic OCR/Web 场景可能需 FIRECRAWL_API_KEY。
许可证
MIT





