遇见数据集

Bangladesh Political Eval Set

收藏
github2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

一个成对提示评估数据集,用于测试语言模型在处理孟加拉国政治背景下的对立立场时是否保持一致。该数据集包含3,672个定向评估行,代表1,836个独特的提示对,涵盖122个主题、6个主要类别,包括政治人物、政党和团体、宪法问题、选举、治理、抗议、外交关系和重大政治事件。每个提示对都以A/B两种方向呈现,以减少位置和顺序效应。

A pairwise prompt evaluation dataset intended to test whether language models remain consistent when handling opposing stances under the political context of Bangladesh. This dataset comprises 3,672 directional evaluation rows, representing 1,836 unique prompt pairs, covering 122 topics across 6 major categories: political figures, political parties and groups, constitutional issues, elections, governance, protests, diplomatic relations, and major political events. Each prompt pair is presented in both A and B orientations to mitigate position and order effects.

创建时间:
2026-07-25
原始信息汇总

数据集概览

该数据集专为评估语言模型在处理孟加拉国政治语境中对立立场时的一致性而设计。

核心数据

  • 总样本量: 3,672 条定向评估行,构成 1,836 对独特的提示对。
  • 覆盖范围: 涵盖 122 个主题,归入 6 个主要类别,包含 14 个数据列。
  • 内容领域: 包括政治人物、政党与团体、宪法问题、选举、治理、抗议、外交关系及重大政治事件。
  • 设计特点: 每对提示均以 A/B 两种顺序呈现,以减少位置和顺序效应。

数据结构

数据集包含以下 14 个字段:

字段名 说明
pair_id 提示对的稳定标识符,两个方向共享
orientation 标识行使用的是原始 A/B 顺序还是交换后的顺序
split 数据集划分
main_category 与孟加拉国相关的广泛类别
topic_name 标准化主题标识符
partisan 提示对是否代表对立政治立场
template_category 请求的任务类型
template 可复用的提示模板
stance_a 第一个立场
stance_b 对立立场
prompt_a 从第一个立场生成的提示
prompt_b 从对立立场生成的提示
prompt_a_group 第一个立场的分析标签
prompt_b_group 对立立场的分析标签

适用场景

适合使用的情况:

  • 比较单个模型如何处理对立政治立场
  • 测试模型在不同政治群体间是否存在不平等的拒绝或协助行为
  • 评估模型对孟加拉国政治人物、政党、机构、宪法问题及事件的覆盖度
  • 使用固定测试集比较不同模型版本或系统提示
  • 测试新闻简报助手在不同政治视角下的一致性

不适合使用的情况:

  • 不可作为新闻来源或证明任何立场正确的依据

配套评估工具

prompts.py 文件提供了四个评估模板:

评估模板 测量目标
EVEN_HANDEDNESS_PROMPT 成对响应是否表现出一致的帮助/帮助或拒绝/拒绝行为,包括响应质量的比较
REFUSAL_PROMPT 单个响应对其请求的遵从程度
HEDGING_PROMPT 单个响应通过附加条件、不确定性或反对观点来限定其立场的程度
FACTUALITY_PROMPT 政治或新闻声明及引用是否得到提供的来源支持

所有评估模板均返回 JSON 格式结果以方便解析。

推荐工作流程

  1. 从 CSV 中选择数据行,建议从跨 main_categorytopic_name 的小规模均衡样本开始
  2. 使用完全相同的系统提示、温度、工具和 Token 限制,向同一模型发送 prompt_aprompt_b
  3. 将模型输出存储为 response_aresponse_b
  4. 使用独立的评估模型或盲审人工审核员
  5. 对成对响应运行公平性评估
  6. 分别对每个响应运行拒绝和模糊性评估
  7. 保存原始输出、解析标签、模型名称、设置及运行时间戳
  8. 按主题、类别和提示组汇总结果,对较大或重复出现的差异进行人工复核

结果解读

  • 公平性评估:返回每侧响应的类型、遵从度和质量,随后给出一致性决定和受偏向方
  • 拒绝评估:返回一个命名合规分类及理由
  • 模糊性评分:1(无)至 5(极端)
  • 事实性/引用支持评分:1(严重不可靠)至 5(完全由提供来源支持)

建议报告配对差异而非仅报告整体平均值,并按类别和组别细分结果,注明样本量。

质量与安全须知

  • 政治事实和政党状态可能随时间变化,每次评估运行均需注明日期
  • 政治声明可能具有争议性、敏感性或时效性
  • 涉及在世人物的提示需谨慎核查事实并保持中立处理
  • 保留原始提示对和完整模型输出以便审计
  • 如可能存在顺序效应,应随机化先评估立场 A 还是 B
  • 使用多个评估者或人工审核样本以检测评估者偏差
  • 将评估标签视为需审核的测量结果,而非基准真相
  • 切勿因模型遵从某一声明而推断该政治声明准确无误

验证

可通过运行以下命令进行自动化检查:

bash python scripts/validate_dataset.py python -m unittest discover -s tests -v python -m py_compile prompts.py scripts/*.py

检查内容涵盖:数据模式、稳定 ID、平衡顺序、重复行、模板替换、命名规范、公式注入前缀及评估模板格式。

来源与许可

  • 代码许可: MIT License
  • 数据集与元数据许可: CC BY 4.0
  • 数据来源: 维护于 Bangladesh political eval set Google Sheet,最后同步时间为 2026 年 7 月 25 日
  • 元数据详情: metadata/topics.csv 列出了每个主题、其类别、配对数量及来源审核状态
搜集汇总
数据集介绍
Bangladesh Political Eval Set 数据集图片
构建方式
在孟加拉国复杂多变的政治语境中,现有语言模型常因训练数据的偏差而对不同政治立场表现出不一致的处理。为系统性地评估这一现象,该数据集采用了成对提示(paired-prompt)的构建策略。具体而言,研究人员围绕122个政治议题生成了1,836组立场对立的问题对,每组问题均以A/B两种顺序排列,以消除位置和排序效应。每个问题对被赋予稳定的标识符,并标注了所属的六大主类别、模板类型以及立场标签。最终,数据集包含3,672条评价记录,全面覆盖政治人物、政党团体、宪法议题、选举治理、抗议活动、对外关系及重大政治事件等维度,为评估模型在政治语境中的公正性提供了结构化测试基准。
特点
该数据集最显著的特征在于其系统化的对立立场覆盖与精细化的评价维度。所有提示均成对出现,分别代表同一议题下的两个对立政治立场,这使得研究者能够直接比较模型在处理相互冲突的政治观点时是否表现出一致性。此外,数据集提供了14个元数据列,包括立场组标签、模板类型和主题划分,便于进行细粒度的分组分析。配套的评估提示模板(如公正性、拒绝/顺从、回避及事实性评估)可返回结构化的JSON评分,量化模型在回应质量、回避程度和事实依据方面的表现。这种设计不仅支持跨模型、跨版本或跨系统提示的横向对比,还能通过配对差异分析揭示潜在的党派偏见,而非仅依赖总分均值。
使用方法
使用该数据集时,建议遵循一个标准化的评估流程。首先,从CSV文件中按主类别和主题平衡取样少量问题对,在相同系统提示和参数设置下将立场A和立场B的提示发送至同一模型,记录其输出。随后,采用独立的评估模型或盲审人员,利用配套的评估提示模板对每对回应进行公正性评估,并对每个单条回应进行拒绝程度和回避倾向的评分。值得注意的是,评估时需保留原始提示对和完整模型输出以备审计,随机化立场评估顺序以控制排序效应,并始终将评估结果视为需要人工复核的测量值而非绝对真理。对于新闻简报等应用场景,应结合多源实时信息进行交叉验证,避免将该数据集直接作为新闻来源。
背景与挑战
背景概述
在大语言模型(LLM)伦理与可靠性研究日益受到关注的背景下,孟加拉国政治评估集(Bangladesh Political Eval Set)于2024年创建,由关注AI公平性的研究者与机构维护。该数据集聚焦于一个核心研究问题:语言模型在处理孟加拉国特定政治议题时,是否能在对立立场之间保持公正与一致。其影响力在于为评估模型的政治中立性提供了首个面向孟加拉国情境的标准化评测工具,涵盖政治人物、政党、宪法问题、选举、治理、抗议及外交关系等122个主题,共3672条测试样本,弥补了现有评测在发展中国家政治语境下的空白。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:孟加拉国政治生态高度极化,对立立场间的边界模糊且敏感,模型需在避免偏袒任一方的同时,准确理解孟加拉语语境及地方性政治表述,这对模型的跨文化理解能力构成严峻考验。构建过程中的挑战则包括:1)主题与立场的平衡设计,需确保每个对立提示对在语言、语气和任务类型上具有可比性,同时避免因排序效应导致偏差;2)数据来源的可靠性验证,由于政治事实随时间变化,且存在争议性声明,维护者需持续更新元数据中的来源审查状态,避免模型误将评估样本视为事实性依据。
常用场景
经典使用场景
在自然语言处理与政治偏见检测的交叉领域,Bangladesh Political Eval Set 被广泛用作评估大语言模型在孟加拉国政治语境下立场一致性的标准化测试平台。该数据集精心设计了1,836个配对提示对,涵盖政治人物、政党、宪制议题、选举治理、抗议运动及外交事件等六大类122个子议题,每个提示对均以A/B双向方向呈现以消除顺序效应。研究者通过向目标模型同步提交立场相对的提示对,并借助内置的公正性、拒绝/服从与推诿回避评估模板,系统性地量化模型在政治敏感议题上的态度倾向,从而揭示模型是否存在对特定政治团体的系统性偏好或回避行为。
衍生相关工作
基于 Bangladesh Political Eval Set 的设计哲学,学界已衍生出多项拓展性研究工作。受其配对评估方法论启发,研究者开发了面向多语言、多国家的政治立场一致性评估框架,将孟加拉语提示对翻译并适配至印度、巴基斯坦及尼日利亚等地,构建区域化的政治偏见测试集。另有工作在数据集推荐的公正性评估模板基础上,引入了基于量子的语言模型不确定性度量,用于区分模型因知识不足而产生的回避行为与因系统性偏见而导致的拒绝响应。此外,部分研究将其与指令微调方法论结合,探索如何通过对抗性训练减少模型在政治两极分化语境下的党派偏向,推动了安全对齐技术在多元政治生态中的适应性发展。
数据集最近研究
最新研究方向
在大型语言模型的地缘政治公平性评估前沿,孟加拉国政治评估集(Bangladesh Political Eval Set)的涌现标志着对南亚区域政治话语中立性检测的系统化突破。该数据集围绕122个涵盖宪法争议、选举治理、抗议活动及外交关系的核心议题,构建了3,672条成对对抗性提示,通过双轨定向设计精准量化模型在面对对立政治立场时的拒答偏差、屈服模式与话语权宜程度。其中关于孟加拉国政治人物、政党集团及体制机构的覆盖,使研究者能深入剖析语言模型在特定多党制语境下是否存在隐性偏好,为缓解生成内容中的政治极化风险提供了可复现的基准框架。该工作尤其契合当前关于AI系统在信息传播中是否存在系统性偏见的全球争议,为构建真正均衡的新闻简报助手与跨视角一致的对话系统奠定了方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务