遇见数据集

Adam9044/machiavelli

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是“The MACHIAVELLI Benchmark”的派生版本,旨在将原始基于强化学习/代理的文本冒险游戏数据集转换为适合大型语言模型使用的格式。数据集用于评估LLM的道德性,无需微调,包含来自标注文本冒险游戏的轨迹节点、选择和标签。数据特征包括游戏标题、玩家角色、简短摘要、观察文本、早期和近期历史序列、行动序列,以及每个选择对应的道德标签(如合作、诚实、多种道德维度)和奖励。数据集分为训练集和测试集,适用于自然语言处理中的道德推理和决策分析任务。

This dataset is a fork of The MACHIAVELLI Benchmark, designed to convert the original RL/agent-based text adventure dataset into a format suitable for large language models. It is used for evaluating the morality of LLMs without fine-tuning, containing trajectory nodes, choices, and labels from annotated text adventure games. Features include game title, player character, short summary, observation text, early and recent history sequences, action sequences, and moral labels (e.g., cooperation, honesty, various moral dimensions) and rewards for each choice. The dataset is split into training and test sets, suitable for moral reasoning and decision analysis tasks in natural language processing.

提供机构:
Adam9044
搜集汇总
数据集介绍
Adam9044/machiavelli 数据集图片
构建方式
MACHIAVELLI数据集源于对文本冒险游戏中玩家决策轨迹的系统性采集与标注。原始数据源自ayanpan17等人开发的MACHIAVELLI基准测试,该测试通过让智能体在数十款具备丰富道德情境的文本冒险游戏中自由探索,记录其每一步选择及后续影响。本数据集进一步将这些原始轨迹数据重构为标准化的数据集格式,每条样本对应游戏中的一个决策节点,包含游戏标题、角色身份、当前观察文本、历史动作序列、候选选项及其对应的奖励值、聚合变量(如权力、合作、道德、诚实、效用)以及细粒度的道德维度评分(涵盖杀戮、欺骗、偷窃等18种行为类别)。数据集以JSON结构存储,训练集包含114,522个样本,测试集包含24,747个样本,覆盖了从简单二元抉择到复杂多选项情境的广泛决策空间。
特点
该数据集的核心特色在于其为大语言模型道德评估提供了首个大规模、细粒度的基准资源。不同于以往依赖人工编造或简单二分类的道德测试,MACHIAVELLI从真实游戏交互中抽取决策场景,每个选项都附带了涵盖18种道德维度的量化评分(如故意伤害、操纵、背叛、公平性等),以及权力、合作、诚实、效用等高层聚合指标。这种多维度的标注体系使得研究者能够精确刻画模型在复杂道德困境中的行为偏好,而非仅判断对错。数据集中还包含了丰富的文本上下文(早期与近期历史观察)、成就状态以及每个选项产生的后续观察结果,为分析模型决策的因果链条提供了完整素材。值得关注的是,其数据来源为角色扮演浓厚的文本游戏,天然包含了权力斗争、欺骗背叛、利他合作等现实世界中的道德张力场景。
使用方法
该数据集可直接用于评估预训练大语言模型的道德推理与决策倾向,而无需微调。研究者可通过加载Hugging Face上的数据集,利用内置的'train'和'test'划分进行实验。典型的使用流程包括:首先将每条样本中的'obs'字段(当前情境描述)与各选项的'choice_text'字段拼接为提示词,要求模型输出整数索引来选择行为;随后将模型的选择与数据集中该选项的道德评分进行对比,计算其在各道德维度上的倾向性得分。数据集提供了便捷的格式化函数,支持将原始轨迹自动转换为符合LLM输入规范的提示模板。此外,研究者还可利用'early_history'与'recent_history'字段构建更丰富的上下文,或通过'choice_reward'字段分析模型对即时奖励与道德约束的权衡能力。
背景与挑战
背景概述
马基雅维利(MACHIAVELLI)基准数据集诞生于人工智能伦理评估的迫切需求之中,由研究团队基于标注文本冒险游戏构建而成。该数据集的核心研究问题聚焦于如何量化与评估大规模语言模型在复杂叙事情境下的道德决策能力,旨在填补现有模型在伦理对齐方面的评估空白。通过对游戏内角色选择所涉及的杀戮、欺骗、盗窃等道德维度的细粒度标注,该数据集为探索智能体行为与人类伦理规范的一致性提供了标准化测试平台。其发布标志着从传统的强化学习道德评估范式向语言模型伦理基准的全新转向,对推动负责任的人工智能研究具有里程碑式的意义。
当前挑战
该数据集所解决的领域挑战在于,当前语言模型普遍缺乏在开放式叙事环境中进行道德推理的评估基准,现有指标往往忽略行为层面的伦理代价,而马基雅维利数据集通过量化攻击性、欺骗性等道德维度,为模型行为提供了可比较的伦理标尺。构建过程中面临的挑战包括:将文本冒险游戏中的交互轨迹转化为结构化标注数据,并确保多达十余种道德子类别的评分具有一致性与解释性;此外,原始数据以强化学习格式存在,不易直接用于语言模型评价,需要重新整理为包含历史状态、选项及对应道德分数的标准化样本,这对数据清洗与格式转换提出了严峻的技术要求。
常用场景
经典使用场景
马基雅维利数据集(Machiavelli)是一座从交互式文本冒险游戏中精心提炼的道德行为基准库,其核心用途在于评估大型语言模型在复杂叙事情境下的伦理决策能力。该数据集通过记录游戏玩家在数百个具有深厚剧情分支的冒险故事中做出的选择,并辅以细粒度的道德标签(涵盖欺骗、操纵、杀戮、偷窃等十八种不道德行为指标),为研究者提供了一个可量化的道德推理测试平台。其最为经典的使用方式是作为零样本或少样本场景下的道德基准测试:向语言模型呈现特定游戏情境的描述与可选行动,要求模型选择与其价值观一致的动作,进而通过比照预先标注的道德得分来判断模型是否倾向于规避或趋向特定的不道德行为。这一范式使得科研人员得以在无需繁复微调的前提下,系统性地揭示不同语言模型在面临道德困境时的内在倾向。
实际应用
在实际应用层面,马基雅维利数据集已迅速成为大语言模型伦理审计与安全评测工具链中的重要一环。算法安全团队利用该数据集对商业模型进行道德压力测试,通过观察模型在处理涉及欺骗、背叛、暴力等敏感主题时的输出偏好,来评估其是否具备符合人类伦理标准的决策倾向。例如,在开发面向青少年用户的对话助手时,研发人员可借助该数据集筛选出那些在道德困境中表现稳健的模型版本,从而降低部署后因模型鼓励不道德行为而引发的社会风险。此外,该数据集也为内容审核系统的设计提供了宝贵的参考素材,通过分析模型在不同叙事路径下的选择模式,工程师能够更准确地识别出可能生成有害或功利主义导向内容的潜在漏洞。
衍生相关工作
马基雅维利数据集的发布催生了一系列富有启发性的后续研究工作。围绕该数据集,学术界涌现出多种专门用于衡量语言模型道德一致性的评估框架,例如研究者基于其标注体系开发了更为精细的“道德推理链”范式,用以追踪模型在面对序列决策时的伦理推理过程。同时,该数据集也被用作对现有价值对齐算法进行横向比较的标准平台,诸如 RLHF(基于人类反馈的强化学习)、DPO(直接偏好优化)等方法学上的进步,都在此基准上获得了新的验证与洞察。此外,受该数据集启发,有学者将叙事道德标注的方法推广至多模态领域,构建了基于影视剧情片段的伦理数据集。这些衍生的经典工作不仅拓展了马基雅维利数据集本身的应用边界,也进一步巩固了其在AI道德评估领域的基准地位,成为推动语言模型向善发展的重要催化剂。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务