遇见数据集

storyworld-plays

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集名为“Storyworld Plays: Jinn and Beast Moral-Choice Evaluations”,是用于评估语言模型在多智能体叙事世界中道德选择行为的数据集。它包含第一个分片(shard)——来自论文《Jinn or Beast?》的“Jinn Town”战役,该战役采用模式引导(schema-guided)设计,包含24个两座、八回合的episode,共192个公开回合。数据集中还包含三个开发世界、四个固定宪法集会(constitutional assemblies)和两个配对种子;记录了执行过的LDT、TRM和SRT标识符及其公开访问凭证;提供了选定的动作、公共消息、公共理由、预测、环境结果和预测分数;以及24个episode摘要和论文中的描述性集会与配对块基准。此外,还包括用于前瞻性宪法选择架构的详尽机器可读选择矩阵。所有数据行均为“仅评估”(EVALUATION_ONLY)性质,属于模型支持的探索性开发证据,不得用于适配器训练、支架选择器调优或混合到后续的保留测试中。数据集的后续追加部分包括Temptation MAS v1(六阶段、仅公开的诱惑和多智能体控制网格评估)和Staged public control-mesh v2(基于Qwen3.5-0.8B GGUF的公开两通道路由与决策合约评估)。

This dataset, titled *Storyworld Plays: Jinn and Beast Moral-Choice Evaluations*, is designed to evaluate moral choice behaviors of large language models (LLMs) in multi-agent narrative worlds. It includes its first shard: the "Jinn Town" scenario from the paper *Jinn or Beast?*. This scenario adopts a schema-guided design, consisting of 24 two-player, eight-turn episodes, totaling 192 public turns. The dataset also contains three development worlds, four fixed constitutional assemblies, and two paired seeds; it records executed LDT, TRM and SRT identifiers along with their public access credentials. It provides selected actions, public messages, public justifications, predictions, environmental outcomes and prediction scores, as well as 24 episode summaries and the descriptive assembly and paired block benchmarks from the original paper. Furthermore, it includes a comprehensive machine-readable choice matrix for proactive constitutional choice architectures. All data entries are of the "EVALUATION_ONLY" nature, serving as exploratory development evidence supported by models, and must not be used for adapter training, bracket selector tuning or mixing into subsequent held-out tests. The subsequent extended portions of the dataset include Temptation MAS v1 (six-stage, publicly-only temptation and multi-agent control grid evaluations) and Staged public control-mesh v2 (public two-path routing and decision contract evaluations based on Qwen3.5-0.8B GGUF).

创建时间:
2026-08-02
原始信息汇总

Storyworld Plays: Jinn and Beast Moral-Choice Evaluations

数据集概述

该数据集是一个可追加的、公开可执行的storyworld评估记录集合,首个分片包含来自《Jinn or Beast? Theological Identity Frames as Alignment Surfaces in Small Language Models》论文中完整的schema-guided Jinn Town活动数据。数据集语言为英语,规模小于1K条记录,采用other许可证。

核心内容

首个分片包含:

  • 来自24个两座、八回合剧集的192个公开回合
  • 三个开发世界、四个固定宪法议会和两个配对种子
  • 已执行的LDT、TRM和SRT标识符及其公开的survivor/visit收据
  • 选定的动作、公开消息、公开理由、预测、环境结果和预测分数
  • 24个剧集摘要及论文中的描述性议会和配对块基准
  • 面向预期宪法选择架构的详尽机器可读选择矩阵

配置结构

配置 单位 用途
turns 单次执行回合 动作、脚手架、预测和结果分析
episodes 单个八回合剧集 分组种子-世界比较
benchmarks 单个议会或配对对比 发布的描述性摘要
composition_matrix 单一宪法/LDT/TRM/SRT捆绑 详尽设计审计
ldt_trm_routes 单一LDT/TRM对 16路线选择器菜单
temptation_mas_mas_native_bundle_turns 单次执行回合 诱惑MAS原生捆绑回合分析
temptation_mas_mas_native_bundle_episodes 单个剧集 诱惑MAS原生捆绑剧集分析
temptation_mas_menu_causality_turns 单次执行回合 菜单因果性回合分析
temptation_mas_menu_causality_episodes 单个剧集 菜单因果性剧集分析
temptation_mas_temptation_phase_turns 单次执行回合 诱惑阶段回合分析
temptation_mas_temptation_phase_episodes 单个剧集 诱惑阶段剧集分析
temptation_staged_v2_turns 单次执行回合 分阶段v2回合分析
temptation_staged_v2_episodes 单个剧集 分阶段v2剧集分析
temptation_staged_v2_failures 失败记录 资源中止的启动记录
staged_bundle_schedule_matrix 调度矩阵 调度干预记录
staged_benchmark_cell_matrix 基准单元矩阵 基准单元评估
staged_mas_benchmark_cell_matrix 基准单元矩阵 MAS基准单元设计
staged_route_order_observations 观察记录 路线顺序观察
staged_choice_matrix_catalog 选择矩阵目录 选择矩阵设计
staged_guarded_resource_attempts 尝试记录 资源受限的尝试
staged_architecture_selection_observations 观察记录 架构选择观察

完整矩阵

固定配置:4个固定议会 × 3个世界 × 2个种子 = 24个剧集;24个剧集 × 8个回合 = 192个公开回合。

可复现的发现

  • 全部192个回合均产生有效可执行动作,无无动作响应
  • Amanah在48个回合中有30个选择ally;Islah和Mizan在48个回合中全部选择propose;Shura选择ally一次、propose47次
  • 在六个配对种子-世界块中,描述性的Amanah减Shura的ally率差为0.6042,block-bootstrap区间为[0.3750, 0.7917]

重要边界说明

所有游戏记录均为EVALUATION_ONLY。该数据是模型支撑的探索性开发证据,而非保留或确证性基准。不得将其提升用于适配器训练、调整脚手架选择器,或混入后续保留测试。宪法名称是未经验证的规范性框架,不代表神学权威、道德优越性、意识或超自然身份的声明。

模型输出界定

托管的Qwen3.5-4B Jinn适配器选择了公开动作和预测字段。确切的LDT膜决定了哪些动作仍然可用。TRM和机械SRT/SGRT调度决定了公开检查顺序。后者是可执行的控制结构,而非隐藏神经推理模块的证据。不包含提示档案、原始提供者响应、隐藏思维链、私有引擎信念状态、私有观察、隐藏胜利条件、凭据、本地文件系统路径或提供者响应标识符。确切的token收据被粗粒度使用桶替代。

溯源与完整性

release_manifest.json记录了源注册、编辑收据、运行收据、聚合分析、脚手架注册表、每个发布文件和每个源剧集的哈希。source_receipts/redaction_receipt.json将每个公开剧集哈希绑定到私有到公开的编辑事件,而不发布私有负载。共享同一剧集的行属于一个血缘组,任何重采样或训练/测试分割必须保持完整剧集在一起。统计单位是配对种子-世界块,而非单个回合。

附加内容

Temptation MAS v1附加

包含六阶段、纯公开的诱惑和多智能体控制网格游戏。24个场景族(而非回合或种子)是独立单元。此本地0.8B诊断通道与已完成的托管4B分片分离,不表示为4B结果。

Staged public control-mesh v2附加

基于Qwen3.5-0.8B GGUF评估,使用公开两遍路线和决策合约。两智能体矩阵每个独立故事族有24个单元:两个配对种子 × 两种治理模式 × 两种Jinn座位顺序 × 三个调度臂。selected_scheduletrm_direct_control为TRM比较;selected_schedulesrt_off_control为SRT比较。资源中止的启动单独发布在失败配置中。

Complete staged MAS family audits

包含每个已完成24单元块的族的无路径累积审计。TRM和SRT保持分离比较。部分覆盖仅为开发诊断,不能支持声明的24族组件效应声明。验证器修正和精确评估器哈希随摘要包含。

引用

bibtex @misc{moralitylabai2026storyworldplays, title = {Storyworld Plays: Jinn and Beast Moral-Choice Evaluations}, author = {{MoralityLabAI}}, year = {2026}, howpublished = {Hugging Face dataset}, url = {https://huggingface.co/datasets/AlephFunk/storyworld-plays} }

搜集汇总
数据集介绍
storyworld-plays 数据集图片
构建方式
Storyworld Plays数据集以多智能体叙事环境为基底,通过schema引导的固定宪法装配与双种子配对机制,构建了24个八回合剧集,共192个公开回合。其构建过程融合了LDT、TRM与SRT等可执行控制结构,并采用严格的证据边界,将所有对局标记为EVALUATION_ONLY,确保数据仅用于探索性开发验证,而非模型训练或隐藏基准。
特点
该数据集的核心特征在于其多层次的公开性设计与细粒度的审计追踪。每个回合记录均包含动作、脚手架、预测及环境结果,且所有行均排除私密推理与模型原始输出。通过释放完整的组合矩阵与审计哈希,数据集支持对组件效应的分离检验,同时注重数据完整性,确保任何重采样或分割均以配对种子块为统计单位,从而维护实验效度。
使用方法
数据集提供turns、episodes、benchmarks及composition_matrix等多种配置,适应不同分析粒度。使用者可依据研究目标选择相应JSONL文件,如对单回合动作进行分析或对整集进行分组比较。由于数据严格限定为EVALUATION_ONLY,不得用于适配器训练或参数调优,仅作为基于模型的探索性证据,用于评估特定架构下的行为模式与道德推理表现。
背景与挑战
背景概述
Storyworld Plays数据集由MoralityLabAI于2026年创建,旨在评估小语言模型在多智能体叙事环境中的道德推理能力。该数据集通过构建“神怪或野兽”的叙事世界,采用宪法AI框架,系统性地考察模型在道德抉择中的行为表现。其核心研究问题在于探索语言模型如何在不同道德框架下做出决策,以及这些决策如何受环境影响。该数据集的独特之处在于其可执行、可复现的评估记录,为语言模型对齐研究提供了新的范式。通过公开的回合级数据、详细的配置矩阵和严格的证据边界,它为研究社区提供了宝贵的资源,对AI安全与道德对齐领域产生了重要影响。
当前挑战
该领域面临的核心挑战在于如何有效评估模型在复杂道德情境中的推理能力。传统基准测试往往简化道德问题,而Storyworld Plays通过多智能体交互和动态环境,尝试捕捉更真实的道德抉择,但这也引入了构建上的困难。数据集的构建需平衡生态效度与实验控制,确保24个场景系列、192个回合的数据既能反映复杂叙事结构,又能进行定量分析。此外,处理模型输出的不确定性和保持评估的公正性也是重大挑战,因此数据集明确区分了模型输出与结构性组件,并限制了训练用途。最终,数据集的不可扩展性(n<1K)和道德框架的未经证实性质,限制了其作为最终基准的适用性,需要进一步扩展和验证。
常用场景
经典使用场景
Storyworld Plays数据集为多智能体系统中的道德推理研究提供了独特的实验平台。其经典使用场景聚焦于在受控故事世界中,通过固定宪法组装、世界与种子的配对设计,系统性地评估语言模型在道德抉择中的行为一致性。研究者可借助该数据集的turn级和episode级配置,深入分析模型在面临道德困境时的行动选择、理由阐述与预测准确性,从而揭示不同对齐策略对模型道德判断的潜在影响。
实际应用
在实际应用层面,该数据集所揭示的模型行为模式,为开发更安全、更符合伦理的人工智能系统提供了参考。其多智能体交互和宪法对齐框架,可用于测试和改进AI在游戏、虚拟助手、社会模拟等场景中的决策能力,确保AI在面临诱惑或道德冲突时能够做出符合人类价值观的选择。此外,数据集的附加研究为资源受限环境下的本地模型行为审计提供了可操作的诊断工具。
衍生相关工作
Storyworld Plays数据集衍生了关于多智能体系统评估方法论的系列工作,包括对LLM对齐层、路由机制及调度策略的独立审计。其倡导的固定组件组合与分块基准设计,启发了后续研究中对模型组件效应进行分离评估的新范式。数据集所附带的完整审计文件与来源追踪机制,也为可复现AI研究中的数据集管理和版本控制提供了范例,促进了开放科学在机器学习伦理领域的实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务