遇见数据集

chat-keuangan-bench

收藏
github2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

一个开放的基准数据集,用于解析印尼非正式金融聊天记录(如WhatsApp风格的俚语、更正、收据、银行流水和多组织账本)为结构化卢比交易,包含两个评估套件:Parse-25(单次提取)和Rupiah-Pro(多轮智能体工具交互)。

An open benchmark dataset for converting informal Indonesian financial chat logs (including WhatsApp-style slang, corrections, receipts, bank statements, and multi-organization ledgers) into structured Indonesian Rupiah transactions, which comprises two evaluation suites: Parse-25 (single-turn extraction) and Rupiah-Pro (multi-turn AI Agent tool interaction).

创建时间:
2026-06-27
原始信息汇总

数据集概述

chat-keuangan-bench 是一个面向印尼语非正式金融聊天场景的开放基准测试集,涵盖 WhatsApp 风格俚语、文本纠错、收据、银行流水及多组织账本等场景。

该基准包含两套评测套件:

Parse-25(单轮信息提取)

  • 任务:从单条聊天消息中提取结构化收支 JSON 数据。
  • 规模:25 个困难场景(附加基础/压力测试用于回归)。
  • 评估指标:严格通过率 + 复合质量等级。
  • 典型分数:顶级模型约 21–24/25。
  • 运行命令bun run eval:hard-25
  • 示例输入
    • td sore beli pulsa 25rb sama jajan cilok 4 tusuk 5rb 4 4 nya
    • tadi jajan es teh ceban sama gorengan goceng
    • 非交易语句需返回 bukan_transaksi: true

Rupiah-Pro(多轮智能体交互)

  • 任务:多轮记账,支持工具调用(SQLite 账本、OCR、CSV/PDF 文件读取、组织切换、审计导出等)。
  • 规模:28 个运行场景,公开评分使用其中 14 个高区分度场景。
  • 评分公式(v1.0)score = 100 × (det/40)² × (ifBench/100)
    • det:确定性断言(0–40 分),涵盖账本、组织、文件、工具等。
    • ifBench:指令遵循规则 R1–R14(0–100 分),作为乘数因子。
  • 典型分数:排行榜约 75–88 分。
  • 运行命令bun run eval:agentic 然后 bun run score:rupiah-pro
  • 开放工具:SQLite 账本、收件箱 + OCR、CSV/PDF 读取器、导出工具;网络搜索仅用于信息查询,拒绝“搜索收据/单据”。

排行榜表现(Rupiah-Pro v1.0)

排名 模型 分数
1 google/gemini-3.1-flash-lite 88.1
2 xiaomi/mimo-v2.5-pro 87.9
3 z-ai/glm-4.5 86.1
4 google/gemma-4-31b-it 84.9
5 z-ai/glm-4.7 84.6
6 qwen/qwen3.6-35b-a3b 84.6
7 inclusionai/ling-2.6-1t 82.3
8 deepseek/deepseek-v4-flash 76.0
9 deepseek/deepseek-v4-pro 75.0

跨度:13.1 分,基于 14 个高区分度场景。

排行榜表现(Parse-25 快照,2026 年 6 月)

排名 模型 严格通过 复合质量 每 25 次运行成本(IDR)
1 google/gemini-3.1-flash-lite 24/25 99 Rp 325
2 google/gemini-3-flash-preview 24/25 99 Rp 570
3 google/gemma-4-31b-it 24/25 98 Rp 114
4–7 glm-4.5 / mimo / deepseek-v4-pro / glm-4.7 22/25 97–98 Rp 101–291

推荐性价比模型:gemma-4-31b-it(同一 24/25 档次,成本约低 2.6 倍)。

数据内容特点

  • 数据基于真实的印尼伊斯兰寄宿学校 / 电商金融聊天场景构建。
  • 示例场景涵盖:个人财务、基金会/学校账目、俚语纠正、共同支付、OCR 收据、银行流水、受污染历史记录、审计导出等。
  • 非交易语句需被模型正确识别为非交易。

快速开始

bash git clone https://github.com/volfadar/chat-keuangan-bench.git cd chat-keuangan-bench cp .env.example .env # 配置 OPENROUTER_API_KEY(可选 DEEPSEEK_API_KEY) bun install

运行 Parse-25

bun run eval:hard-25

运行 Rupiah-Pro

bun run eval:agentic -- --suite all --model google/gemma-4-31b-it bun run score:rupiah-pro

依赖:Bun 运行时、OpenRouter API Key。Agentic OCR/Web 场景可能需 FIRECRAWL_API_KEY

许可证

MIT

搜集汇总
数据集介绍
chat-keuangan-bench 数据集图片
构建方式
chat-keuangan-bench是一个专为印尼语非正式金融对话场景设计的开源评测基准,涵盖WhatsApp风格俚语、收据、银行流水及多组织账簿等复杂语境。该数据集由两大子套件构成:Parse-25聚焦单轮消息的结构化解析,将用户输入的一句话转换为包含收入或支出的JSON格式;Rupiah-Pro则构建多轮智能体交互环境,集成SQLite分类账、OCR识别、CSV/PDF读取及组织切换等工具,模拟真实记账流程。每条评测用例均源自实际的聊天记录,经人工标注形成关键断言与指令遵循规则,确保任务难度贴近现实应用。
特点
该数据集的核心特色在于其双层次评估架构与高度区分的评分机制。Parse-25通过25个高难度场景考察模型对混杂俚语、拼写错误及非交易语句的甄别能力,采用严格通过率与复合质量等级双重指标。Rupiah-Pro则从确定性断言与指令遵循两个维度计算得分,其中14个高区分度场景被选入公开排行榜,有效避免天花板效应。此外,数据集提供了成本-质量关联分析图表,便于开发者权衡模型性能与API调用开销,尤其适合构建轻量级金融记账应用。
使用方法
使用该数据集需先通过Bun工具安装依赖并配置OpenRouter API密钥。评估Parse-25时,执行`bun run eval:hard-25`命令即可获得单轮解析的严格通过率与复合分数。运行Rupiah-Pro则分步进行:先运行`bun run eval:agentic`指定模型与并发数完成多轮交互,再运行`bun run score:rupiah-pro`生成排行榜与可视化图表。开发者还可通过`bun run studio`启动Mastra追踪界面,深入分析智能体决策过程。所有评估结果均以JSON格式保存,便于后续复现与对比分析。
背景与挑战
背景概述
在印度尼西亚,非正式金融聊天记录充斥着俚语、拼写错误和多种账目格式,使得自动化财务记账极具挑战。为填补这一领域评估空白,由独立研究者volfadar主导的chat-keuangan-bench基准测试于2025年应运而生,专注于评测大语言模型在印度尼西亚语非正式金融聊天场景下的理解与记账能力。该基准涵盖Parse-25(单轮交易提取)与Rupiah-Pro(多轮代理记账)两大套件,旨在检验模型能否从混杂的WhatsApp风格对话中精准解析收入与支出,并在多轮交互中正确操作分类账、OCR、CSV/PDF等工具。其发布为金融科技、伊斯兰学校及电商领域的自动化记账系统提供了首个开源标准化评测框架,推动了低资源语言下金融NLP的发展。
当前挑战
该数据集所解决的领域问题核心在于非结构化金融聊天记录的语义理解与结构化提取:模型需从包含俚语(如“ceban”、“goceng”)、口语化修正(如“15rb… maksudnya 50rb”)及非交易语句中准确识别交易实体,并输出符合规范的JSON格式。构建过程中面临的挑战包括:设计涵盖个人与基金会财务的多样场景、模拟真实用户的多轮对话与工具调用(如分类账写入、票据OCR、银行对账单解析),以及确保评测指标对模型能力具有区分度——例如通过剔除易得满分场景、引入指令遵循规则(R1–R14)作为得分乘数,并采用加权评分公式(100 × (det/40)² × (ifBench/100))来放大细微性能差异,从而避免排行榜分数虚高。
常用场景
经典使用场景
在印度尼西亚金融口语处理领域,日常财务交流充斥着WhatsApp风格的俚语、拼写错误与多组织混杂的账目信息,令传统的自然语言理解系统难以招架。chat-keuangan-bench基准正是为此而生,其Parse-25套件专注于单轮消息解析,要求模型从诸如“td malem berantakan: pulsa 25rb, cilok 4 tusuk 5rb 4 4 nya”之类的高度口语化、非正式文本中,精准提取出结构化的收支JSON数据。该场景直接模拟了真实印尼用户在即时通讯软件中的记账行为,是衡量模型对非规范金融文本理解能力的核心试金石。
实际应用
在实际应用中,chat-keuangan-bench驱动的技术栈已直接赋能印尼本土的伊斯兰寄宿学校与电商平台的金融聊天系统。Rupiah-Pro套件通过多轮代理架构,实现了跨凭证(如OCR扫描的收据、银行流水CSV、PDF文件)的自动化记账,并支持组织账目切换与审计导出功能。这极大地减轻了个人与中小型机构的手工记账负担,使得印尼语环境下从混乱的日常对话到标准财务分类账的自动转化成为可能,显著提升了现金流动管理的效率与准确性。
衍生相关工作
基于此基准,研究者已拓展出一系列衍生工作。在模型层面,涌现出针对低成本高性能模型的深度对比分析,如发现Gemma-4-31b-it以极低的推理成本达到了顶级解析效果。在方法论层面,该套件衍生了基于确定性断言与指令遵循分数相乘的复合评分范式(Rupiah-Pro评分公式),以及针对跨工具协同(SQLite账本、OCR、文件读写)的代理评测框架。此外,其公开的细粒度错误分析与成本-质量图表,也为构建更鲁棒、更经济的高效金融对话代理提供了宝贵的实证参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务