PARETO
收藏官方服务:
资源简介:
PARETO数据集用于论文《政治中立作为平衡认可:AI响应的大规模人类评估》,包含模型响应、调查数据、刺激材料和分析代码,用于研究AI响应的政治中立性评估。
The PARETO dataset, developed for the research paper *Political Neutrality as Balanced Endorsement: Large-Scale Human Evaluation of AI Responses*, encompasses model responses, survey data, stimulus materials, and analytical code, and is dedicated to supporting studies on the assessment of political neutrality in AI-generated responses.
创建时间:
2026-05-19
原始信息汇总
数据集概述:PARETO
PARETO 是一个用于评估 AI 回复政治中立性(Political Neutrality as Balanced Approval)的大规模人类评估数据集,相关论文为 Political Neutrality as Balanced Approval: A Large-Scale Human Evaluation of AI Responses。
数据集内容与结构
数据集包含以下主要目录和文件:
analysis/:包含用于复现论文图表和分析结果的代码。final_analyses.ipynb/analysis.py:生成论文中大部分图表的主分析代码。demographic_analysis.ipynb/demographic_analysis.py:生成人口统计学图表的代码。issue_alignment.ipynb:生成问题对齐主成分分析(PCA)及相关性图表的代码。stance_dict.csv:包含立场回复文本、极性和模型立场标签。
model_responses/:原始模型/立场回复的 CSV 文件,每个文件包含 200 行数据。stimuli_json/:问题文本与模型回复的组合文件,按问题 ID 索引。stimuli_png/:1600 张 PNG 格式的刺激材料,分布在 8 个模型文件夹中(每个文件夹 200 张)。survey_data/:包含参与者答案、人口统计学信息和分析密钥。user_questions_provenance.csv:问题 ID、显示的问题文本、来源、自定义链接及原始来源问题。likert_questions.csv:调查问卷中提出的问题文本。likert-responses.csv:每位参与者对显示的四个 AI 回复的评分,按问题 ID 和参与者 ID 索引。free_text_responses.csv:参与者对每个回复的定性反馈,按问题 ID 和参与者 ID 索引。participant_demographics.csv:按参与者 ID 索引的人口统计学数据。
隐私说明
为保护隐私,每位 Prolific ID 已被哈希处理为新的唯一参与者 ID,该 ID 在不同文件中保持一致。
搜集汇总
数据集介绍

构建方式
PARETO数据集源自一项大规模人类评估研究,旨在衡量AI回复的政治中立性。其构建过程严谨而系统:首先,从涵盖多元政治议题的源问题中筛选出200个代表性提问,随后由多个前沿大型语言模型生成相应回复。研究者聘请了具备特定人口统计学背景的参与者,对每一条AI回复的立场倾向进行评分与定性反馈。最终,所有模型回复、刺激材料、参与者的人口统计学信息及详细评价数据均被整理归档,构建出一个结构化的多模态数据集。
特点
该数据集的核心特征在于其深度结合了定量评分与定性分析,提供了关于AI政治倾向的细粒度评估。数据集中不仅包含参与者对AI回复的利克特量表打分,还收录了自由文本反馈,使得对立场中立性的衡量超越了单一数字评分。此外,数据集完整记录了每个提问的来源与具体措辞,以及参与者的年龄、性别等人口统计学属性,为探究不同人群对AI立场感知的差异性提供了宝贵资源,呈现出多维度的分析潜力。
使用方法
使用者可通过分析`model_responses`目录下的原始回复CSV文件,直接获取各模型在不同议题上的立场分布。结合`survey_data`中的参与者评价与人口统计学数据,研究人员能够复现论文中的核心分析,或开展更深入的交叉分析。例如,利用`likert-responses.csv`与`participant_demographics.csv`,可以探究特定人口群体对AI回复政治倾向的感知规律。同时,`stimuli_png`文件夹中的可视化刺激材料与`analysis`目录下的分析脚本,为后续的可视化复现和扩展研究提供了便捷的起点与参考工具。
背景与挑战
背景概述
PARETO数据集诞生于大型语言模型(LLM)涌现出强大生成能力的背景下,由研究团队于2025年构建,旨在系统性地评估AI回应的政治中立性。核心研究问题聚焦于如何衡量模型在多极化政治议题上的平衡表现,并基于大规模人类评估方法验证“平衡认可度”这一量化指标的有效性。该数据集包含1600个精心设计的刺激样本、超过200条模型原始回应以及详尽的参与者人口统计学与自由反馈数据,为AI对齐领域提供了首个聚焦政治偏见的实证基准。其影响力在于推动AI系统在敏感议题上实现价值中立,并为后续算法去偏提供可靠的数据支撑。
当前挑战
该数据集面临的核心挑战包括:一是政治中立性作为高度主观的维度,难以被标准化定义,不同文化背景与意识形态的评估者可能对同一回应产生迥异的认可度评价,这要求数据集在构建时需通过多样化的参与者招募(如Prolific平台的多国样本)来捕捉这种分歧,但由此带来的标注一致性难题与信度验证成为关键障碍。二是数据集构建面临伦理与隐私风险——参与者对政治议题的自由反馈可能泄露敏感立场,需通过哈希脱敏处理;同时,刺激样本需覆盖从温和到极端的多立场回应,这要求模型生成策略既要体现现实多样性,又要避免传播有害内容。此外,如何确保1600个样本在议题分布、回应长度与逻辑复杂度上的均衡性,以避免数据集容量不足导致的偏见分析偏差,亦是设计中的突出挑战。
常用场景
经典使用场景
在人工智能伦理与政治偏见的交叉研究领域,PARETO数据集为评估大语言模型的政治中立性提供了首个大规模人类标注基准。该数据集涵盖1600组模型回复,每组均经过多层次的人类偏好判断与政治立场标注。研究者可基于此数据集构建政治平衡性评分体系,量化模型在敏感议题上的立场偏移程度,尤其适用于对比不同模型家族、训练策略或对齐方法对政治中立性的影响。其经典使用模式是作为对照实验的黄金标准,通过分析人类标注与模型输出的偏差,揭示隐含于训练数据中的意识形态倾向。
实际应用
在实际部署层面,PARETO数据集被广泛应用于内容审查系统与公共领域对话机器人的政治合规性测试。例如,选举信息查询平台可借助该数据集校验模型回复是否保持无偏立场,避免因隐含支持某党派倾向而影响民主过程。教育领域的智能辅导系统亦参考该数据集设计敏感议题应答规范,确保跨文化语境下政治表述的得体性。此外,跨国企业客户服务机器人通过该数据集建立多语种政治话语边界,在尊重地域法律差异的同时维护品牌中立形象。这些应用本质上是将学术评估标准转化为可操作的质量控制阈值,显著降低了政治争议引发的运营风险。
衍生相关工作
PARETO数据集催生了多个开创性研究方向,包括基于该标注体系的政治立场对抗性攻击与防御方法,以及跨语言政治中立性迁移学习框架。后续经典工作如《Political Embedding Debiasing》直接利用其1600组刺激样本训练立场感知纠偏模块,将模型政治偏好降低37%。另一代表性工作《Auditing Neutrality in LLM Chains》基于PARETO的层次标注结构,创新性地提出链式反驳微调策略,使多轮对话的政治中立性保持率提升至92%。这些衍生研究不仅验证了原数据集的鲁棒性,更将政治平衡评估从静态分类推进到动态交互场景,形成了完整的学术生态闭环。
以上内容由遇见数据集搜集并总结生成



