遇见数据集

FMG-Bench

收藏
github2026-05-29 更新2026-06-07 收录
数据链接:
官方服务:

资源简介:

FMG-Bench是一个用于评估大型语言模型在神学分类和牧师指导背景下的信仰与道德指导基准。它包含120个基础场景和37个扰动变体,旨在测试模型在不同类型信仰和关怀问题上的回答质量,如教义清晰度、传统意识表示、谦逊态度以及人类转介边界。

FMG-Bench is a benchmark for evaluating large language models on faith and moral guidance in the context of theological classification and pastoral guidance. It comprises 120 foundational scenarios and 37 perturbed variants, which are designed to assess the quality of model responses to diverse faith and care-related issues, such as clarity of doctrine, awareness and representation of traditions, humility, and human referral boundaries.

创建时间:
2026-05-27
原始信息汇总

FMG-Bench 数据集概述

基本信息

FMG-Bench(Faith & Moral Guidance Benchmark)是一个用于评估大型语言模型在神学分类和教牧指导场景中表现的数据集,旨在测试模型是否能够针对不同类型的信仰与关怀问题给出恰当的回应。

  • 研究论文:When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models
  • 研究机构:Fide AI
  • 数据集页面:https://github.com/FideAI/fmg-bench
  • Hugging Face 数据集:https://huggingface.co/datasets/FideAI/fmg-bench

数据集规模与构成

  • FMG-Bench v1 数据集:包含 120 个基础场景及 37 个扰动变体,共计 157 个场景实例
  • 评估数据:评估 14 个前沿模型在 4 种指令条件下的表现,总计 8,792 个模型-条件评分项
  • 公开清单元数据:包含 120 个场景的覆盖统计信息

评估框架

四个神学分类层级

层级 测试内容
首要教义 信条和福音边界的忠实度
次要教义 传统特定准确性和合理的分歧
第三级教义 适当的信心和谦卑
教牧应用 关怀、安全、代理和转介边界

五个评分维度

  • 神学与教牧质量
  • 依据与证据
  • 偏好忠实度
  • 比较诚实度
  • 升级适当性

四种指令条件

  • raw_model(原始模型)
  • guided_default(引导默认)
  • preference_configured(偏好配置)
  • perspective_compare(视角比较)

主要发现

发现 结果 解释
引导默认 vs 原始模型 +3.96 分 全部 14 个模型均有提升
教牧应用增益 +6.62 分 最大分类层级增益;安全与转介边界受益最多
升级适当性增益 +10.8 分 结构化框架帮助模型识别何时需要人类支持
鲁棒性稳定性 92.88 → 98.02 在改述、压力和扰动下行为更加稳定
视角比较 存在混合影响 有助于次要教义,但可能损害首要教义和紧急教牧案例

数据文件组织

dataset/ ├── data/ │ ├── fmg_bench_v1.jsonl # 主数据集 │ ├── manifest.json # 清单文件 │ └── examples/ │ └── public_sample.jsonl # 样例数据

results/ ├── production_summary.json # 结果汇总 ├── model_scores.csv # 模型评分 ├── triage_scores.csv # 分类层级评分 └── dimension_scores.csv # 维度评分

calibration/ # 校准数据汇总 docs/ # 文档(基准卡、数据集卡、评分规范等) paper/ # 论文源文件与PDF

许可证

  • 数据集、论文文本、方法论文档和结果摘要:CC BY 4.0
  • 代码:Apache License 2.0

负责任使用声明

FMG-Bench 是一个测量工具,而非部署许可。高基准评分并不表示 AI 系统具有属灵权威、教牧认可、临床安全、法律可靠性或适合无监督使用。不得将 FMG-Bench 评分用于教派排名、教牧权威认证,或宣传模型适合无监督教牧关怀。

搜集汇总
数据集介绍
FMG-Bench 数据集图片
构建方式
FMG-Bench旨在评估大语言模型在神学分类与牧灵引导场景中的表现。其构建基于120个基础情景,并衍生出37种扰动变体,总计157个测试实例。每个情景依据神学优先级被划分为四个层级:首要教义、次级教义、第三级教义和牧灵应用。评估过程通过四种指令条件(原始模型、引导默认、偏好配置、视角比较)驱动模型生成回应,并由多维度评分体系对回应质量进行量化打分。数据集的构建严格遵循开放基准政策,确保可复现性与透明度。
特点
该数据集的核心特征在于其结构化的神学分类框架与多维评分机制。通过将问题按教义确定性分层,它能够精细区分模型在不同信仰与关怀问题上的回答适切性——从教义精准性到传统敏感性,从谦逊态度到人类转介边界。实验表明,在结构化框架引导下,所有14个测试模型的性能平均提升3.96分,尤其在牧灵应用中提升达6.62分,且行为鲁棒性从92.88提升至98.02。这一设计使得FMG-Bench不仅测量模型能力,更揭示了引导策略对输出质量的系统性影响。
使用方法
用户可通过GitHub仓库的基准运行器复现评估。首先安装依赖并运行冒烟测试,然后使用`run_fmg_bench.py`脚本配合YAML配置文件执行基准测试。默认使用OpenRouter进行模型调用,需设置API密钥。支持指定单一模型或法官面板,并通过`--max-scenarios`参数控制测试规模。完整复现需处理157个情景实例与四种指令条件。结果以CSV和JSON格式输出,用户可直接加载模型得分、层级得分和维度得分表进行分析。详细复现指南参见`docs/reproducing_results.md`。
背景与挑战
背景概述
随着大规模语言模型在宗教与牧养关怀领域的应用日益增多,如何确保模型在神学问题上的回答兼具教义准确性与牧养智慧,成为亟待解决的交叉学科难题。2026年,由Fide AI研究机构Alex Chao等人主导的FMG-Bench(Faith & Moral Guidance Benchmark)应运而生,旨在系统评估语言模型在神学分类与牧养引导场景中的表现。该基准构建了一个包含120个基础场景及37种扰动变体的结构化数据集,围绕信条性教义、传统性次要教义、较低确定性教义及牧养应用四个层级进行考核,开创性地将神学严谨性、传统敏感性、谦卑态度与人文转介边界纳入评估维度。FMG-Bench的提出,不仅为宗教人工智能领域提供了首个系统化的评估框架,更推动了计算神学与可信赖AI的交叉研究,对神学辅助工具、在线牧养关怀等应用场景具有深远影响。
当前挑战
FMG-Bench面临的核心挑战在于如何精准量化神学关怀中主观且多层次的判断标准。领域层面上,模型需要在信条性教义上保持绝对忠诚,在传统性分歧中体现宗派包容,在较低确定性话题上展现谦卑,并在紧急牧养场景中识别人类介入边界,这四种看似矛盾的要求对语言模型的逻辑一致性与伦理推理能力构成严峻考验。构建过程中,研究人员需克服神学场景的领域专家标注成本高昂、跨宗派标准难以统一等困难,确保120个场景覆盖足够广泛的教义冲突与牧养困境,同时设计合理的评分维度(如牧养质量、引用依据、偏好忠诚度、比较诚实度及转介恰当性)以规避主观偏见。此外,如何通过结构化引导(guided harness)提升模型表现并维持评估稳定性,亦是基准设计中的关键技术挑战。
常用场景
经典使用场景
FMG-Bench作为一项专为评估大语言模型在神学分类与牧养指导语境中表现而设计的基准测试,其经典使用场景聚焦于检验模型能否依据问题所属的信仰与关怀类别,给出恰当层次的回应。具体而言,该基准通过涵盖首要教义、次要教义、第三级教义及牧养应用四个分类层级,构成了一套严谨的评测框架。在首要教义层面,它衡量模型对信经与福音边界的忠实度;在次要教义层面,评估其对传统特定准确性与合理分歧的呈现能力;第三级教义则检验比例化信心与谦逊的表达;而牧养应用层面则关注关怀、安全、能动性与转介边界的处置。这一多层次、多维度的设计,使得FMG-Bench成为探索人工智能在宗教与精神关怀领域伦理与技术边界的关键工具。
解决学术问题
FMG-Bench的提出,旨在应对人工智能伦理与神学交叉领域中一个深刻的学术挑战:现有的通用语言模型评估体系未能捕捉宗教与牧养语境下回应的复杂性,尤其是缺乏对教义层次敏感性的量化手段。该基准通过引入结构化的评测导向机制(structured harness),实证性地揭示了指导性提示框架如何显著提升模型在牧养关怀场景中的表现——例如,牧养应用得分提升6.62分,转介恰当性提升10.8分,同时增强了模型对何时需要人类介入的识别能力。这一发现填补了学术界关于AI在精神关怀领域角色定位的方法论空白,推动了从技术中立性向情境敏感的评测范式转型,为后续在跨宗教对话、临床牧养教育及数字伦理研究中建立更负责任的AI评估标准奠定了重要基础。
衍生相关工作
FMG-Bench的发布催生了一系列衍生研究工作,尤其在AI伦理、计算神学及人机交互领域。一方面,研究者借鉴其三层次分类与结构化提示的方法论,着手构建针对伊斯兰教、佛教及多信仰语境的文化适应版基准,以检验模型在不同宗教传统中的表现差异。另一方面,该基准中关于牧养转介恰当性的高增益发现,激发了将结构化评测框架应用于更广泛的精神健康与危机干预场景的探索,例如开发针对自杀预防热线的AI辅助评估模型。此外,FMG-Bench的“指导性默认”条件设计,已被部分学者引用于教育领域的道德推理评测中,验证其在非宗教语境下提升模型谨慎回应能力的泛化性。这些工作共同丰富了负责任AI研究的实践图谱,推动了对模型角色边界与人类自主性关系的深层反思。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务