context_eval
收藏资源简介:
该数据集由萨尔兰大学和杜伦大学联合团队构建,聚焦大语言模型在健康与金融领域的安全评估。数据集包含从Reddit采集的2,700条原生咨询帖(健康1,452条/金融1,248条),经GPT-4o提炼生成12个高风险主题的标准化提问,并配合专业顾问创建的差异化用户脆弱性档案(分高/中/低三级)。数据通过Prolific平台由持证金融/医疗从业者标注,采用七级安全评分体系(1-7分)对GPT-5、Claude Sonnet 4和Gemini 2.5 Pro的响应进行情境感知评估,旨在解决传统安全评估中用户上下文缺失导致的个性化风险监测难题,为AI伦理中的个体福利保护提供基准工具。
This dataset was constructed by a joint team from Saarland University and Durham University, focusing on the safety evaluation of large language models (LLMs) in the healthcare and finance domains. It contains 2,700 original consultation posts collected from Reddit, with 1,452 posts related to healthcare and 1,248 related to finance. These posts were refined by GPT-4o to generate standardized questions covering 12 high-risk themes, paired with differentiated user vulnerability profiles categorized into high, medium, and low levels, which were created by professional consultants. The data was annotated by certified finance and healthcare practitioners via the Prolific platform, and a seven-level safety scoring system (scoring 1 to 7) was used to conduct context-aware evaluations of the responses from GPT-5, Claude Sonnet 4, and Gemini 2.5 Pro. This dataset aims to solve the challenge of personalized risk monitoring caused by the absence of user context in traditional safety evaluations, providing a benchmark tool for individual welfare protection in AI ethics.
数据集概述
数据集基本信息
- 数据集名称: Challenges of Evaluating LLM Safety for User Welfare — Code & Dataset
- 关联论文: "Challenges of Evaluating LLM Safety for User Welfare" (IASEAI 2026,正在审稿中)
- 核心主题: 面向用户福祉的LLM安全性评估,关注LLM建议如何根据用户的个人背景和脆弱性对不同用户构成不同风险。
- 评估焦点: 与通用安全性评估(如网络安全、越狱鲁棒性、谄媚性等)不同,专注于个人财务和健康等领域中的上下文相关危害。
数据集内容与结构
数据集位于 context_eval/eval_dataset/ 目录下,包含以下核心文件:
2.1 问题数据集 (eval_dataset.csv)
- 来源: 受Reddit启发,通过Reddit抓取、寻求建议分类、主题分类和GPT辅助合成编译而成。
- 内容: 包含寻求建议的问题。
- 示例字段:
id: 标识符topic: 主题(如finance)theme: 主题分类(如Debt Management)question: 具体问题
2.2 评估提示 (evaluation_prompts.csv)
- 内容: 每个行代表一个完全组装的评估提示。
- 关键字段:
prompt_id: 提示IDrequest_id: 请求IDtopic,theme: 主题与分类vulnerability_profile_level: 脆弱性档案级别(low, medium, high)vulnerability_profile: 脆弱性档案ranking_type: 排名类型(baseline | relevance | likelihood)context_level: 上下文级别(0, 1, 3, 5)context_variant: 上下文变体(五种措辞)final_prompt: 最终提示
2.3 LLM响应 (llm_responses.csv)
- 内容: 包含为以下模型生成的所有输出:
- GPT-5
- Claude Sonnet 4
- Gemini 2.5 Pro
- 参数: 温度(Temperature)设置为 1.0 以增加多样性。
- 详细输出: 同时存在于
/output/llm_response_{request_id}.csv文件中。
2.4 安全分数 (scores/*.csv)
- 内容: 每个文件包含:
apparent_safety_score: 表面安全分数(上下文无关)contextualized_safety_score: 情境化安全分数(上下文相关)- 危害可能性、严重性、保障措施充分性(1–7分)
- 评估者推理(思维链)
- 应用的评分逻辑(附录G)
- 分数修补: 缺失或基线分数通过
patch_missing_safety_scores.py和patch_baseline_scores_per_request.py脚本修补。
2.5 调查数据与排名工具 (survey_results/)
此目录包含与上下文因素排名相关的所有数据集和工具。
- 用户可能性排名: 用户表示在寻求建议时会自愿披露的内容。
- 专家相关性排名: 领域专家建议为获得安全、负责任的建议应披露的内容。
- AI生成排名(未在最终实验中使用): 包含生成AI排名上下文的脚本
src/ai_ranking.py,但最终实验未使用。 - 博尔达计数聚合: 最终稳定排名使用博尔达计数法计算,存储于
relevance_*_borda.csv和relevance_survey_ranking_*.xlsx文件中。
评估管道概述
3.1 提示构建 (src/prompt_assembly.py)
- 将档案因素转换为第一人称子句。
- 使用专家相关性顺序或用户可能性顺序对其进行排名。
- 创建包含1、3或5个因素的提示。
- 为每个提示生成5种语言变体。
- 缓存输出以确保可复现性(子句缓存)。
3.2 LLM响应收集 (src/get_llm_responses.py)
- 将每个提示发送给多个LLM。
- 将输出存储在中央CSV文件及每个请求的独立文件中。
3.3 安全性评估 (src/score_pipeline.py)
实现 LLM-as-Judge 方法:
- 评估危害可能性、危害严重性、保障措施充分性。
- 根据明确规则计算最终安全分数。
- 生成结构化理由和数字评分。
引用格式
@inproceedings{contexteval2026, title={Challenges of Evaluating LLM Safety for User Welfare}, booktitle={IASEAI}, year={2026} }

- 1Challenges of Evaluating LLM Safety for User Welfare萨尔兰大学, 杜伦大学 · 2025年



