遇见数据集

BeliefUpdateSimulation

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Belief Updates数据集是一个用于研究信念更新和说服力的人类与大型语言模型(LLM)代理对比数据集。它收集了391名人类参与者对三个社会议题(全民基本收入UBI、点球大战、减肥药物)的信念变化数据。参与者首先对议题给出初始信念(评分范围从-2到2),然后阅读三条相关评论,之后提供更新后的信念,并对评论的说服力进行排序(1表示最具说服力)。同样的实验材料被用于条件化LLM模型,模型基于参与者的个人特征(如人口统计信息)生成相应响应。数据集包含三个独立的分拆集:main分拆(8211行)包括人类响应和6个LLM模型的响应,这些模型以参与者的真实初始信念为条件;simulated_initial分拆(7038行)包含相同模型的响应,但以模型生成的初始信念为条件;ablations分拆(24633行)包括后训练、温度和提示组件消融实验的结果。数据字段涵盖参与者伪ID、议题主题、信念表述和极性、原始和标准化信念评分(标准化后正值表示支持议题)、初始信念来源、说服力排名、推理文本、展示的评论信息、人口统计信息和原始模型输出等。数据集特别设计了信念标准化处理,以统一不同表述方式的信念,确保跨表述的可比性。它适用于信念更新机制研究、说服力建模、社会模拟、LLM代理行为分析以及人机交互对比研究等任务。数据集采用CC BY 4.0许可证发布,已通过伦理审查,参与者信息经过伪匿名化处理,并包含明确的使用伦理限制。

The Belief Updates dataset is a human vs. LLM agent comparison dataset designed for studying belief updates and persuasiveness. It collects belief change data from 391 human participants on three social issues (Universal Basic Income UBI, penalty shootouts, weight-loss drugs). Each participant first provides an initial belief (rating from -2 to 2) on the issue, then reads three related comments, after which they give an updated belief and rank the persuasiveness of the comments (1 being the most persuasive). The same experimental materials are used to condition LLM models, which generate responses based on participants personal characteristics (demographic information). The dataset includes three independent splits: the main split (8,211 rows) contains human responses and responses from 6 LLM models conditioned on the participants true initial beliefs; the simulated_initial split (7,038 rows) contains responses from the same models but conditioned on model-generated initial beliefs; and the ablations split (24,633 rows) includes results from post-training, temperature, and prompt component ablation experiments. Data fields include participant pseudo-ID (persona_id), topic, statement formulation/polarity, raw and normalized belief scores (normalized positive values indicate support for the issue), initial belief source, persuasiveness rankings, reasoning text, shown messages information, demographic details, and raw model output. The dataset features a belief normalization process to unify beliefs across different formulations, ensuring comparability. It is suitable for tasks such as belief update mechanism research, persuasiveness modeling, social simulation, LLM agent behavior analysis, and human-machine interaction comparison studies. The dataset is released under the CC BY 4.0 license, has passed ethical review, with participant information pseudonymized and includes clear ethical usage restrictions.

创建时间:
2026-07-20
原始信息汇总

数据集名称

Belief Updates: Humans and Simulated LLM Agents

许可证

CC BY 4.0

语言

英语 (en)

标注来源

众包 (crowdsourced)

标签

  • 信念更新 (belief-update)
  • 说服 (persuasion)
  • 社会模拟 (social-simulation)
  • 大语言模型智能体 (llm-agents)
  • 人类受试者 (human-subjects)

数据集描述

该数据集包含391名人类参与者和多种大语言模型(LLM)在相同信念更新任务上的响应。每位参与者针对三个主题(全民基本收入UBI、点球大战、减肥药)给出初始信念,阅读三条评论后给出更新后的信念,并按说服力对评论进行排序。相同的材料也提供给LLM,并基于每位参与者的人设进行条件设定。

数据划分

划分 行数 内容
main 8211 人类响应 + 6个模型(以参与者真实初始信念为种子)
simulated_initial 7038 相同模型(以模型生成的初始信念为种子)
ablations 24633 后训练(OLMo-3)、温度、提示组件的消融实验

划分之间互不相交。source字段为humanllmmodel字段在人类行上为Human

字段说明

字段 说明
persona_id 假名(P0001-P0429),用于连接人类和模型行
topic 主题:UBIpenaltyweight_loss
statement_formulation, statement_polarity 呈现的措辞及其极性
raw_init_belief / normalized_init_belief 阅读评论前的信念(范围-2到2)
raw_new_belief / normalized_new_belief 阅读评论后的信念
raw_general_public_stance / normalized_general_public_stance 模型对公众舆论的估计;人类行中为null
init_belief_source 初始信念来源:participantsimulated
rank_1/2/3 对槽位N的评论排名(1=最具说服力)
reasoning 模型的自由文本推理或参与者的文本响应
shown_messages, message_order, package 展示的评论、顺序和组别
demographic 参与者属性;是否展示给模型取决于condition
raw_response 模型原始输出(解析前)
ablation_type, condition, temperature 仅填充于ablations划分

信念符号约定

每个主题的措辞可能支持或反对该主题。信念字段提供两种形式:

  • raw_*:按原始措辞记录的值
  • normalized_*:转换为支持主题的框架,正值表示支持主题

通过statement_polarity(+1/-1)关联:normalized_x == raw_x * statement_polarity。在不同措辞间汇总或比较时,应使用标准化字段

排名约定

rank_N表示受访者对槽位N中评论的排名(1=最具说服力,3=最不具说服力)。槽位N对应shown_messages[N-1]。模型行的排名在导出时已转换为与人类行一致的约定。

已知局限

  • OLMo-3 Think检查点的结构化字段最初为null,已从raw_response中恢复,但仍有3行未能恢复。
  • 一个OLMo-3-32B-Think响应因Excel每单元格32,767字符限制而被截断。
  • 温度2.0运行存在解析失败(Llama 2.0%,Qwen 0.9%),保留为null。
  • Gemini-3-Flash-Preview在main中有一个null响应。

参与者隐私

persona_id为假名(P0001-P0429),通过种子随机分配,不携带任何参与者信息。已删除原始平台标识符和会话令牌。自我报告的人口统计学信息保留,但为实验条件变量。自由文本字段已筛查自识别内容。

未包含内容

  • 初始信念探测运行(信念出现在simulated_initial中)
  • 陈述框架消融实验
  • 人设极端性和提示模板变体
  • 30行冒烟测试
  • 逐行的完整提示模板(可从源仓库的prompt_templates/重建)

伦理与同意

该项目已通过跨学科转型大学奥地利分校研究伦理委员会审查(案号2025-09)。参与者通过Prolific招募,并给予知情同意。他们被告知研究目的,且数据将以化名形式公开发布。未同意的参与者未记录响应(400名参与者中保留391名)。

使用注意事项

  • 不要试图重新识别参与者,无论是直接还是通过与其他数据集关联。
  • 人口统计学字段为准标识符,自由文本为参与者自己的写作。
  • 数据集遵循CC BY 4.0许可,产生它的代码在源仓库中采用MIT许可。
搜集汇总
数据集介绍
BeliefUpdateSimulation 数据集图片
构建方式
该数据集通过一项精心设计的信念更新实验构建而成。研究招募了391名参与者,每位参与者需针对全民基本收入、点球大战和减肥药物三个议题分别陈述初始信念,随后阅读三条由系统提供的评论,并汇报更新后的信念与评论说服力排序。同一实验材料被呈现给多个大型语言模型,这些模型被注入了每位参与者的人口统计学特征与初始信念作为条件变量,从而实现了人类与模拟智能体在相同认知任务下的行为对齐与对比。数据集包含人类真实响应与多个模型在相同条件设定下的生成结果,并额外提供了模型在不同初始信念来源、参数配置与提示模板下的消融实验数据,构建了一套系统且可复现的信念演化模拟实验框架。
特点
该数据集最显著的特点在于其多维度对齐与标准化设计。所有信念值均同时以原始记录与归一化形式呈现,通过议题极性参数实现不同表述方向下的信念值跨样本可比性。评论排序字段经过统一转换,消除了人类问卷与模型输出在排序逻辑上的结构性差异,确保了跨来源数据的直接可比。数据集还系统记录了模型的公众舆论估计、推理过程文本以及参与者完整的人口统计学信息,为探究信念更新的社会认知机制提供了丰富的数据支撑。此外,数据经过严格的去标识化处理,参与者身份使用伪随机编号替代,但保留了关键的人口统计变量以支持条件建模分析。
使用方法
使用者可通过统一的伪匿名标识符将人类与模型样本关联,从而开展跨主体跨模型的信念更新效应比较研究。建议采用归一化信念字段进行跨议题的综合分析,避免因议题表述极性不同引入系统性偏差。评论排序字段可直接用于分析不同来源智能体在劝说效果感知上的异同,无需额外转换处理。对于需要复现特定实验条件的分析任务,可通过议题、条件标识与模型名进行精确筛选,并借助消融数据子集探究温度参数、提示模板及模型后训练阶段对信念更新的潜在影响。研究者也可利用参与者人口统计学特征与模型生成的推理文本,深入分析个体差异对信念变化过程的影响路径。
背景与挑战
背景概述
在社会科学与人工智能交叉的研究前沿,人类信念动态的模拟与理解成为关键议题。由Interdisciplinary Transformation University Austria团队于2025年创建的BeliefUpdateSimulation数据集,聚焦于个体在接收多方观点后信念更新的认知机制。该研究通过对比391名人类参与者与多种大语言模型(LLM)在相同任务中的表现,系统评估了AI对人类信念改变过程的模拟能力。数据集涵盖全民基本收入、点球规则与减肥药物三个争议性话题,为量化人类与LLM在信念更新、说服力排序等方面的异同提供了标准化基准。这一资源对推动社会模拟、说服计算与AI对齐研究具有重要价值。
当前挑战
该数据集面临的核心挑战包括:首先,如何精确建模人类信念更新中非理性与语境依赖的特征,例如陈述措辞方向导致的数据极性歧义,需通过规范化字段处理;其次,构建过程中需解决LLM解析失败与数据截断问题,如OLMo-3模型特殊标记缺失导致的字段丢失;再者,确保人类参与者隐私保护与数据伦理合规,包括伪匿名化处理与准标识符风险管控;最后,不同模型与实验条件下的结果可比性成为难点,需统一说服力排名约定以消除采集方式差异带来的系统性偏差。
常用场景
经典使用场景
在信念更新与说服传播的研究领域,BeliefUpdateSimulation数据集为探究人类与语言模型在观点演变中的异同提供了独特且精细的实验范式。该数据集通过精心设计的实验流程,让391名参与者在三个具有争议性的社会议题(全民基本收入、点球大战、减肥药)上表达初始信念,随后阅读并评价三条说理性评论,最终报告更新后的信念。这一设计框架忠实地再现了信息接收与态度转变的自然过程,为研究者提供了一个可直接对比人类与LLM(大语言模型)在相同社交刺激下如何调整立场的标准化实验平台。
衍生相关工作
围绕此数据集,衍生出多项具有影响力的学术工作,包括对LLM是否具备类人说服力敏感的检验、基于模拟初始信念的模型鲁棒性分析,以及针对不同温度参数和后训练策略的消融研究。相关学者利用main、simulated_initial和ablations这三个子集,系统比较了Llama、Qwen、Gemini及OLMo系列等六种主流模型的信念更新模式。这些衍生工作不仅量化了模型在模拟人类社交互动时的可靠性,还通过构建统一的数据处理约定(如排名逆序转换),为后续研究树立了可复现的标准化分析流程,激发了更多关于AI社会推理能力的深度探讨。
数据集最近研究
最新研究方向
该数据集聚焦于人类与LLM代理在信念更新任务中的行为对比,为探索人工智能在社交模拟与说服传播中的前沿研究提供了基准。通过将391名参与者在全民基本收入、点球大战规则及减肥药物三大热点议题上的初始与更新信念,与六种主流LLM模型的条件模拟输出进行系统对齐,该工作开创性地量化了AI在模仿人类认知弹性与说服力排序方面的能力边界。当前研究热点集中于利用该数据集的信念归一化字段与双源排名约定,验证LLM是否能够复现人类面对多源信息时信念漂移的心理学特征,尤其是对错位传播漏斗与确认偏误的响应模式。这为构建更可信的社交模拟代理、优化人机协作中的信息传递策略,以及评估AI在公共舆论模拟中的伦理边界提供了关键实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务