遇见数据集

Yuan4629/WereBench

收藏
Hugging Face2025-10-21 更新2025-10-25 收录
官方服务:

资源简介:

WereBench是一个针对狼人杀社交推理场景的语言模型评估基准数据集,重点关注与人类策略对齐的战略推理。

WereBench is a benchmark dataset for evaluating language models in the Werewolf social deduction setting, focusing on human-aligned strategic reasoning.

提供机构:
Yuan4629
搜集汇总
数据集介绍
Yuan4629/WereBench 数据集图片
构建方式
在社交推理与策略博弈领域,语言模型的类人推理能力评估日益受到关注。WereBench数据集正是基于这一背景,聚焦于狼人杀(一种类似“黑手党”的社交推理游戏)场景,旨在评估模型在人类对齐策略推理上的表现。该数据集从真实人类游戏场景中提取素材,特别是中文狼人杀社区的实战对话与剧情片段,构建了一套包含角色推断、策略判断、欺骗推理、说服陈述及反事实权衡五大维度的多选题集。数据以结构化的JSON格式组织,每条问题均关联具体的对话片段、目标角色视角及正确答案,并附有可追溯的原始材料路径,确保评估的严谨性与可复现性。
特点
WereBench数据集的核心特点在于其从粗粒度胜率指标转向细粒度言语级评估的设计理念。它包含五大评估维度:角色推断考察模型对他人身份与意图的识别能力;策略判断评估选择对己方阵营有利行动的能力;欺骗推理检验模型识别或实施欺骗的水平;说服陈述关注在上下文中生成令人信服的表述;反事实权衡则衡量模型在不同方案间权衡风险与收益的能力。数据集以中文为主,贴近真实人类博弈语境,且所有内容均经过匿名化处理,确保无法追溯至作者信息,从而保障了数据使用的伦理合规性。
使用方法
使用WereBench数据集时,研究者可通过Hugging Face的datasets库直接加载JSONL格式的主文件,例如使用load_dataset函数并指定远程数据文件链接。此外,数据集中包含按季划分的辅助材料(如Season_1等目录下的JSON文件),支持通过模式匹配或多文件列表加载以获取完整的对话与剧情上下文。数据集默认提供训练集划分,用户可基于五大评估维度进行言语级的多选题评测,也可结合游戏日志扩展至决策级分析,如投票一致性或对手角色推断。论文与代码仓库提供了完整的基准框架与使用指南,便于复现与进一步研究。
背景与挑战
背景概述
在社交推理与多智能体博弈研究领域,狼人杀(Werewolf/Mafia)作为一种经典的隐藏角色与欺骗推理游戏,为评估语言模型的战略推理与人类对齐能力提供了独特场景。Yuan4629/WereBench数据集于近期由研究团队创建,依托于真实的人类狼人杀社区游戏数据(如Panda Kill电视节目),聚焦于超越传统胜率指标的细粒度评估。该数据集的核心研究问题在于衡量语言模型在角色推理、战略判断、欺骗推理、说服性陈述及反事实权衡五个维度的表现,旨在推动模型行为与人类成功策略的深度对齐。通过提供结构化多选问答与对话片段元数据,WereBench为语言模型的类人社交智能评估树立了新的基准,对自然语言处理与多智能体系统的交叉领域具有重要影响力。
当前挑战
WereBench所解决的领域挑战在于,现有语言模型评估多依赖粗糙的胜率指标,难以捕捉社交推理中复杂的战略决策与人类对齐能力,而该数据集通过细粒度维度设计填补了这一空白。在构建过程中,研究团队面临多重挑战:首先,从真实游戏视频中提取并标注对话片段需要克服多轮交互中的角色身份模糊性与欺骗性语言歧义,确保问题集的语义准确性;其次,跨类别(如角色推理与欺骗检测)的平衡设计需避免评估偏向性,同时保证中文社区特有的语言表达习惯被忠实映射;此外,将主观的人类策略经验转化为客观的多选问答格式,并维护补充材料与主问题集的一致性,对数据质量提出了严苛要求。
常用场景
经典使用场景
在社交推理与多智能体博弈的交汇领域,WereBench数据集被设计为评估语言模型在狼人杀这一经典社交演绎游戏中的战略推理能力。其最经典的使用场景聚焦于细粒度的言语层面评估,通过角色推理、战略判断、欺骗推理、说服性陈述及反事实权衡五个维度,量化模型在复杂社交互动中的人类对齐程度。研究者利用该数据集的多选题形式,系统考察模型能否像人类玩家一样,基于对话片段推断他人身份、权衡行动利弊、识破欺诈或实施伪装,从而超越传统仅以胜率为指标的粗粒度评价范式。
解决学术问题
长期以来,学术界在评估语言模型的社交智能时面临两大瓶颈:一是缺乏针对战略推理过程的细粒度度量,二是模型行为与人类成功策略之间存在显著偏差。WereBench通过构建源自真实人类游戏场景的标注题库,系统解决了如何从言语层面量化模型在角色推断、策略选择、欺骗检测等核心社交推理能力上的表现。该数据集的意义在于提出了一个可复现、多维度的评估框架,推动语言模型从单纯的文本生成向具备人类对齐的战略思维演进,为研究机器在社会互动中的理性决策提供了标准化的测试基准。
衍生相关工作
围绕WereBench数据集,已衍生出多项引领社交推理研究的前沿工作。其中最具代表性的是WereAlign框架,该框架将评估维度与人类专家标注对齐,提出了一种基于言语级多选题的标准化评测流程。后续研究进一步将数据集扩展至决策级分析,通过结合游戏日志中的投票行为与对手角色推理,构建了端到端的战略智能体评估体系。此外,部分工作基于WereBench的欺骗推理与反事实权衡子集,探索了语言模型在博弈论场景中的纳什均衡逼近能力,为多智能体强化学习提供了新的验证环境。这些衍生研究共同推动了社交AI从简单对话向深度战略互动的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务