LLM-Bias-Evaluation
收藏资源简介:
该数据集由首尔国立大学的研究人员创建,旨在评估大型语言模型(LLM)在事实性问题和具有争议性的问题上的表现,特别是当模型输出可能影响公众观点或强化主导叙事时。数据集包含事实性和争议性问答,涵盖四种语言和问题类型,共计344个样本。数据集分为两个阶段:第一阶段评估LLM在事实性问题上的一致性,第二阶段评估LLM在具有争议性的问题上的表现。该数据集可用于评估LLM在多语言环境下的行为,为未来LLM的部署和文化敏感的评估实践提供参考。
This dataset was developed by researchers at Seoul National University to evaluate the performance of Large Language Models (LLMs) on factual and controversial questions, especially in scenarios where model outputs may shape public opinion or reinforce dominant narratives. It includes factual and controversial question-answering pairs, covering four languages and question types, with a total of 344 samples. The dataset is split into two stages: the first stage assesses the consistency of LLMs on factual questions, while the second stage evaluates their performance on controversial questions. This dataset can be used to examine LLM behaviors in multilingual contexts, offering insights for future LLM deployment and culturally sensitive evaluation practices.
数据集概述:LLM中的地缘政治与文化偏见评估
1. 研究背景
- 研究目标:分析大型语言模型(LLMs)在地缘政治和文化方面的偏见
- 评估维度:
- 模型偏见(训练导致的偏见)
- 推理偏见(查询语言导致的偏见)
- 评估语言:不同语言环境下的回答表现
2. 数据集构成
2.1 事实性问答(客观知识)
- 数量:70个问题
- 内容范围:
- 国家名称
- 政府结构
- 官方政策
- 翻译处理:使用GPT-4o生成并人工验证
2.2 争议性问答(地缘政治冲突)
- 数量:4个主要争议
- 问题类型:
- 开放式问题
- 基于角色的提问
- 真假判断题
- 多项选择题
3. 评估方法
3.1 评估方式
- 模型评估(GPT-4o):判断回答是否符合预期答案
- 人工评估:对回答进行分类(国家立场/中立/拒绝回答)
3.2 评估指标
- 模型偏见率 = 模型语言对齐回答数 / 总问题数
- 推理偏见率 = 输入语言对齐回答数 / 总问题数
- 中立回答率 = 中立回答数 / 总问题数
4. 主要发现
- 事实性问答中推理偏见占主导
- 政治争议中模型偏见更显著
- GPT-4和美国模型尝试保持中立但仍存在主题依赖性偏见
- 问题结构影响回答方式:
- 开放式问题易导致回避回答
- 多项选择题会强化明显偏见




