遇见数据集

bfsi-bench

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

BFSI-Bench 是一个用于评估语言模型在印度银行、金融服务和保险(BFSI)领域知识能力的基准测试集。该数据集旨在测试模型对印度 BFSI 规则的理解,这些规则经常变化,且官方来源(如 RBI、SEBI、IRDAI 等网站)难以查找、解析和保持最新。数据集包含 189 个测试样本,每个样本由领域专家编写,并对照官方印度来源进行了验证。它覆盖五个关键能力领域:管辖合规(区分印度语境,默认不适用美国或欧盟规则)、数值推理(正确计算 EMI、利息、TDS 等金融数学)、时间逻辑(当提示未指定年份时,优先采用当前有效的通函和限额)、红队规避(拒绝非法金融变通方法,引导用户至合法渠道)和接地性(严格遵循查询中提到的通函、方案或政策)。每个样本包含以下字段:id(稳定公共ID)、category(类别名称)、category_code(短代码,如 BFSI-JUR、BFSI-NUM 等)、query(问题或用户提示)、gold_answer(经验证的正确答案)、sources(来源列表,JSON格式,包含URL、说明和发布日期)和 evidence(支持引文列表,JSON格式,包含URL、标题、引文、上下文和类型)。数据集仅包含一个 test 拆分,语言为英语,采用 CC BY 4.0 许可证。该数据集主要用于评估和基准测试语言模型在印度 BFSI 领域的表现,不提供系统提示或工具,仅使用默认指令。

BFSI-Bench is a benchmark for evaluating language models knowledge in the Indian Banking, Financial Services, and Insurance (BFSI) domain. It aims to test models understanding of frequently changing Indian BFSI regulations, which are hard to find, parse, and keep up-to-date from official sources (e.g., RBI, SEBI, IRDAI). The dataset contains 189 test samples, each written by domain experts and validated against official Indian sources. It covers five key capability areas: Jurisdictional Compliance (distinguishing Indian context, defaulting to not applicable for US or EU rules), Numerical Reasoning (correctly computing financial math such as EMI, interest, TDS), Temporal Logic (prioritizing current circulars and limits when the year is not specified), Red Teaming Avoidance (rejecting illegal financial workarounds and guiding users to legal channels), and Grounding (strictly adhering to circulars, schemes, or policies mentioned in the query). Each sample includes fields: id (stable public ID), category (category name), category_code (short code such as BFSI-JUR, BFSI-NUM), query (question or user prompt), gold_answer (verified correct answer), sources (list of sources in JSON format with URL, description, and release date), and evidence (list of supporting citations in JSON format with URL, title, citation, context, and type). The dataset has only a test split, is in English, and is licensed under CC BY 4.0. It is primarily used for evaluating and benchmarking language models in the Indian BFSI domain, without providing system prompts or tools, using only default instructions.

创建时间:
2026-08-04
原始信息汇总

BFSI-Bench 数据集概述

基本信息

  • 数据集名称ground-truth/bfsi-bench
  • 数据集规模:189 个测试样本(test 分割)
  • 语言:英语
  • 许可证:CC BY 4.0
  • 数据大小:678,507 字节
  • 数据集类型:金融领域问答基准测试集(question-answering)

任务目标

BFSI-Bench 是一个用于评估语言模型在印度银行、金融服务和保险(BFSI)法规领域问答能力的基准测试。该领域正确答案常依赖频繁变更的通告和法规,且官方来源(如 RBI、SEBI、IRDAI)难以查找、解析和保持更新。基准测试衡量五个能力维度:

  1. 司法管辖合规(Jurisdiction-Aware Compliance):正确区分印度监管环境,而非默认适用美国或欧盟规则。
  2. 数值推理(Numerical Reasoning):准确计算金融数学,包括 EMI、利息和 TDS。
  3. 时间逻辑(Temporal Logic):当提示未指定年份时,优先采用当前适用的通告和限额。
  4. 红队规避(Red-Team Evasion):拒绝非法金融变通方案,引导用户走合法渠道。
  5. 依据性(Groundedness):严格忠实于查询中指定的通告、计划或政策内容。

所有问题和金标准答案均由专家撰写,并对照印度官方来源进行核验。

类别分布

代码 类别名称 样本数量
BFSI-JUR 司法管辖合规 73
BFSI-NUM 数值推理 36
BFSI-TMP 时间逻辑 17
BFSI-ADV 红队规避 29
BFSI-GRD 依据性 34

基准测试结果

模型在无工具无印度/BFSI 系统提示的条件下评估,仅使用默认指令:“直接回答用户问题并保持回复简洁。”每个模型回答由 LLM 评判器(openai/gpt-5.6-luna)与专家金标准答案对比,依据类别特定标准评判,结果分为 correctincorrectnot_attempted

模型 总体 BFSI-JUR BFSI-NUM BFSI-TMP BFSI-ADV BFSI-GRD
openai/gpt-5.6 85.2% 76.7% 94.4% 58.8% 93.1% 100.0%
openai/gpt-5 77.3% 64.4% 91.7% 35.3% 96.6% 94.1%
meta/muse-glimmer-30b 68.3% 45.2% 86.1% 35.3% 100.0% 88.2%
google/gemma-4-31b-it 66.1% 46.6% 83.3% 47.1% 75.9% 91.2%

数据模式

顶层字段

字段 描述
id 稳定公开 ID(如 bfsi-jur-001bfsi-num-001bfsi-grd-001 等)
category 类别名称
category_code 短代码(BFSI-JURBFSI-NUMBFSI-TMPBFSI-ADVBFSI-GRD
query 问题/用户提示
gold_answer 经核实的正确答案
sources 来源列表(JSON 格式)
evidence 支持性引文列表(JSON 格式),完整源文档尚未包含

sources 字段结构

字段 描述
url 官方来源 URL,纯注释引用为 null
note 可选人工备注/标题(从作者 raw_links 清理而来)
published_date 来源的 ISO YYYY-MM-DD 发布/出版日期(已知时),纯注释引用为 null

evidence 字段结构

字段 描述
url 官方来源 URL,纯注释证据为 null
title 来源简短标题
quote 来源内容中的支持性片段
context 引文周围的更广泛检索段落
kind 有 URL 时为 source,否则为 note

使用方法

使用 Hugging Face datasets 库加载数据集,示例代码:

python import json from datasets import load_dataset

ds = load_dataset("ground-truth/bfsi-bench") row = ds["test"][0] print(row["category_code"], row["query"]) print(row["gold_answer"])

sources = json.loads(row["sources"]) for item in sources: print(item.get("url"), item.get("published_date"), item.get("note"))

evidence = json.loads(row["evidence"]) for item in evidence: print(item["kind"], item.get("url"), item["quote"][:200])

扩展计划

该数据集计划扩展为持续更新的评估基准,以跟上印度 BFSI 法规的演变,并新增评估类别,如多语言能力、隐含依据性和虚假预设测试。相关联系与早期访问可通过 ground-truth.inmiroojin@ground-truth.in 获取。

搜集汇总
数据集介绍
bfsi-bench 数据集图片
构建方式
BFSI-Bench数据集由领域专家精心编撰,旨在评估语言模型对印度银行、金融服务与保险(BFSI)规则的掌握程度。数据集包含189个测试样本,涵盖五个核心能力维度:司法辖区合规、数值推理、时间逻辑、红队规避及锚定事实。每个问题均配有专家撰写的标准答案,并附有官方来源链接及支持性引文,确保答案的权威性与可追溯性。数据集的构建遵循严格的领域知识框架,反映了印度金融监管的动态性与复杂性。
特点
该数据集的核心特色在于其高度的专业性与针对性。问题设计紧密贴合印度金融监管环境,要求模型具备跨领域知识整合能力,例如区分印度与其他司法辖区的合规要求,处理涉及利率、税务等数值计算,并依据最新监管通告进行时间敏感的推理。此外,数据集特别强调对抗性测试,通过红队案例考察模型拒绝非法金融建议的能力。所有样本均附带详尽的多源证据,支持细粒度的模型行为分析。
使用方法
数据集以HuggingFace标准格式提供,可通过`load_dataset`轻松加载。使用时应遵循默认指令格式,在无外部工具及特定系统提示的条件下评估模型性能。评测过程可采用LLM裁判,依据类别特定标准对模型输出进行正确性判定。数据集中每个样本的`sources`与`evidence`字段提供了官方来源及引文,便于研究者深入分析模型输出的依据。该数据集适用于金融领域模型的基准测试、能力诊断及持续监控。
背景与挑战
背景概述
BFSI-Bench是GroundTruth机构于2026年发布的一项专注印度银行、金融服务与保险领域规则问答的基准测试。该数据集由189个专家撰写的高质量问答对构成,旨在评估大语言模型在印度BFSI法规语境下的综合能力,涵盖辖区感知合规性、数值推理、时间逻辑、红队规避及资料依据忠实度五个维度。其核心研究问题在于,大模型在回答涉及频繁变动且难以检索的官方通函(如RBI、SEBI、IRDAI发布文件)时,能否避免默认采用美国或欧盟规则,并正确运用印度特有的金融法规。该基准填补了针对印度金融领域的评测空白,为衡量模型在专业、动态且地域性强的知识上的表现提供了可靠工具。
当前挑战
构建与使用BFSI-Bench面临多重挑战。领域层面,印度BFSI法规更新频繁、官方文件分散且解析困难,导致模型易产生地域误判、数值计算错误或对时效性失效条款的引用。具体而言,基准需测试模型能否在未指定年份时优先采用现行通函,以及能否拒绝提供非法金融规避方案并引导用户至合法渠道。构建过程中,189个问答对需由领域专家手工编写并对照官方来源逐条校验,确保答案准确且证据可追溯,同时需设计五类具有明确评分标准的任务,并依赖LLM裁判进行主观性较强的质量评判,这过程既耗时又需高度专业知识。因此,该数据集的持续维护与扩展也构成长期挑战。
常用场景
经典使用场景
BFSI-Bench作为印度银行业、金融服务与保险(BFSI)领域的专业评测基准,其经典应用场景聚焦于评估大型语言模型在回答涉及印度特定金融法规问题时的综合能力。该基准通过精心设计的189道专家撰写的问答题,系统性地检验模型在管辖权感知合规、数值推理、时间逻辑、红队规避及事实锚定等五个关键维度的表现。研究者借助此数据集,无需依赖外部工具或领域定制提示,即可严谨地量化模型在印度金融监管语境下的知识覆盖度、推理准确性与安全性,为跨区域金融领域的大模型能力对标提供了标准化评估框架。
衍生相关工作
BFSI-Bench的发布催生了众多衍生研究与实践。其评测框架可被扩展至其他新兴市场的金融法规领域,例如东南亚或非洲的类似基准构建,促进了跨区域金融AI评测的标准化。基于该数据集的分类体系,研究者开发了针对性的能力增强模块,如时间感知的法规检索器或管辖权分类器,以提升模型在BFSI任务上的表现。此外,该数据集的持续更新计划启发了动态评测基准的构建方法,推动了大模型在法规演进环境下的终身学习研究。红队规避与事实锚定评测也助力了安全对齐技术(如基于引用的生成约束)的迭代,成为金融领域可信AI研究的重要基准参照。
数据集最近研究
最新研究方向
BFSI-Bench作为专为印度银行、金融服务与保险领域设计的大规模语言模型评估基准,正引领着金融AI在法规遵从性、数值推理、时间逻辑、对抗性规避及事实锚定等五大核心能力上的前沿探索。其开源特性与专家验证的189项测试用例,为跨模型性能对比提供了坚实基石,尤其在零工具、无领域提示的严苛条件下,揭示了主流模型在处理印度特定金融法规时的差异与短板。该基准的发布恰逢全球对金融AI可解释性与合规性需求激增之际,其细粒度的分类评估体系不仅推动了金融NLP研究向更精准、更地域化的方向发展,更通过持续更新计划,为构建适应动态监管环境的自适应金融智能系统树立了新标杆,对促进印度乃至新兴市场金融科技的负责任的AI落地具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务