FMG-Bench
收藏资源简介:
FMG-Bench是一个用于评估大型语言模型在神学分类和牧师指导背景下的信仰与道德指导基准。它包含120个基础场景和37个扰动变体,旨在测试模型在不同类型信仰和关怀问题上的回答质量,如教义清晰度、传统意识表示、谦逊态度以及人类转介边界。
FMG-Bench is a benchmark for evaluating large language models on faith and moral guidance in the context of theological classification and pastoral guidance. It comprises 120 foundational scenarios and 37 perturbed variants, which are designed to assess the quality of model responses to diverse faith and care-related issues, such as clarity of doctrine, awareness and representation of traditions, humility, and human referral boundaries.
FMG-Bench 数据集概述
基本信息
FMG-Bench(Faith & Moral Guidance Benchmark)是一个用于评估大型语言模型在神学分类和教牧指导场景中表现的数据集,旨在测试模型是否能够针对不同类型的信仰与关怀问题给出恰当的回应。
- 研究论文:When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models
- 研究机构:Fide AI
- 数据集页面:https://github.com/FideAI/fmg-bench
- Hugging Face 数据集:https://huggingface.co/datasets/FideAI/fmg-bench
数据集规模与构成
- FMG-Bench v1 数据集:包含 120 个基础场景及 37 个扰动变体,共计 157 个场景实例
- 评估数据:评估 14 个前沿模型在 4 种指令条件下的表现,总计 8,792 个模型-条件评分项
- 公开清单元数据:包含 120 个场景的覆盖统计信息
评估框架
四个神学分类层级
| 层级 | 测试内容 |
|---|---|
| 首要教义 | 信条和福音边界的忠实度 |
| 次要教义 | 传统特定准确性和合理的分歧 |
| 第三级教义 | 适当的信心和谦卑 |
| 教牧应用 | 关怀、安全、代理和转介边界 |
五个评分维度
- 神学与教牧质量
- 依据与证据
- 偏好忠实度
- 比较诚实度
- 升级适当性
四种指令条件
raw_model(原始模型)guided_default(引导默认)preference_configured(偏好配置)perspective_compare(视角比较)
主要发现
| 发现 | 结果 | 解释 |
|---|---|---|
| 引导默认 vs 原始模型 | +3.96 分 | 全部 14 个模型均有提升 |
| 教牧应用增益 | +6.62 分 | 最大分类层级增益;安全与转介边界受益最多 |
| 升级适当性增益 | +10.8 分 | 结构化框架帮助模型识别何时需要人类支持 |
| 鲁棒性稳定性 | 92.88 → 98.02 | 在改述、压力和扰动下行为更加稳定 |
| 视角比较 | 存在混合影响 | 有助于次要教义,但可能损害首要教义和紧急教牧案例 |
数据文件组织
dataset/ ├── data/ │ ├── fmg_bench_v1.jsonl # 主数据集 │ ├── manifest.json # 清单文件 │ └── examples/ │ └── public_sample.jsonl # 样例数据
results/ ├── production_summary.json # 结果汇总 ├── model_scores.csv # 模型评分 ├── triage_scores.csv # 分类层级评分 └── dimension_scores.csv # 维度评分
calibration/ # 校准数据汇总 docs/ # 文档(基准卡、数据集卡、评分规范等) paper/ # 论文源文件与PDF
许可证
- 数据集、论文文本、方法论文档和结果摘要:CC BY 4.0
- 代码:Apache License 2.0
负责任使用声明
FMG-Bench 是一个测量工具,而非部署许可。高基准评分并不表示 AI 系统具有属灵权威、教牧认可、临床安全、法律可靠性或适合无监督使用。不得将 FMG-Bench 评分用于教派排名、教牧权威认证,或宣传模型适合无监督教牧关怀。





