遇见数据集

ComplexDataLab/socsim26-sharedtask

收藏
Hugging Face2026-06-23 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是COLM 2026研讨会关于基于LLM的社会模拟共享任务发布的扫掠数据,用于构建评估方法以分析社会模拟日志。它包含五个场景研究:11-20金钱请求游戏(beauty_contest,涉及层级推理和玩家角色)、10轮双玩家囚徒困境(iterated_pd,涉及框架和角色立场)、回声室极化研究(polarization,涉及曝光、拓扑和记忆)、观察到的规范研究(observed_norms,基于世界价值观调查的四个国家人口数据)以及角色表达研究(persona_expression,探索代理群体多样性的来源)。每个研究提供假设供评估,并允许用户基于场景和数据提出自己的问题。数据以压缩包形式提供,解压后包含设计文件、运行日志(如动作事件、探测事件和模型调用记录)和元数据。数据集使用CC BY 4.0许可证,适用于研究目的。

This dataset is the released sweep data for the shared task at the COLM 2026 Workshop on LLM-Based Social Simulations, aimed at building evaluation methods over social simulation logs. It includes five scenario studies: the 11-20 money request game (beauty_contest, involving level-k reasoning and player personas), a 10-round two-player prisoners dilemma (iterated_pd, involving framing and persona stances), echo chambers across exposure, topology, and memory (polarization), WVS value battery across four country populations (observed_norms), and where agent-population diversity comes from (persona_expression). Each study provides hypotheses for evaluation and allows users to pose and test their own questions grounded in the scenario and data. The data is provided as tarballs that extract to directories containing design files, run logs (e.g., action events, probe events, and model call records), and metadata. The dataset is released under CC BY 4.0 license for research use.

提供机构:
ComplexDataLab
搜集汇总
数据集介绍
ComplexDataLab/socsim26-sharedtask 数据集图片
构建方式
本数据集源自COLM 2026研讨会关于基于大型语言模型的社会模拟共享任务,旨在推动社会模拟评估方法的发展。数据集涵盖五个独立的情景研究,包括美丽竞赛、迭代囚徒困境、极化现象、观察规范及人格表达等经典社会互动场景。每个研究均通过预定义的实验设计文件(design.yaml)明确记录假设、变量与扫描参数,并利用开源框架silisocs进行大规模仿真运行,生成结构化的运行日志。数据以压缩包形式组织,每个研究目录内包含运行清单、元数据及详细的事件记录、探针响应和模型调用日志,确保了实验的可复现性与透明度。
特点
该数据集的核心特色在于其多层次、高保真的社会模拟日志结构,不仅记录了智能体在游戏中的决策与交互行为(如选择、收益),还包含了探针事件(如问卷调查评分)及完整的大语言模型调用记录(提示与原始响应)。每个研究均内嵌可检验的假设体系,允许研究者通过量化指标验证社会现象的理论预测。此外,数据集涵盖了不同模型规模(从4B到31B参数)与多种实验条件(如框架效应、网络拓扑),为探讨智能体多样性、极化形成机制等问题提供了丰富的实验素材。数据遵循CC BY 4.0许可,便于研究社区自由使用与分析。
使用方法
使用者可通过配套的socsim_eval工具包便捷地访问与分析数据。首先克隆官方仓库并安装包含评估功能的依赖,随后使用HuggingFace CLI将数据集下载至本地,解压后即可获得各研究的完整目录。工具包提供dict命令查看实验设计与假设,head命令预览运行数据,并支持通过Python API加载研究对象、遍历仿真运行、定义自定义度量函数进行大规模评估,最终将结果导出为CSV格式。数据文件为纯JSON/JSONL格式,亦可直接使用标准数据处理库进行灵活分析。详细的评估指南位于仓库文档中,帮助研究者快速上手。
背景与挑战
背景概述
大型语言模型(LLM)驱动的智能体社会模拟是计算社会科学与人工智能交叉的前沿领域,旨在通过多智能体交互复现复杂社会现象,如合作涌现、舆论极化与规范演化。然而,如何系统评估此类模拟的有效性与真实性仍是学界面临的核心难题。在此背景下,Many Worlds——COLM 2026社会模拟共享任务数据集于2026年应运而生,由计算社会科学实验室(ComplexDataLab)主导构建,作为COLM 2026研讨会官方评测基准。该数据集围绕五项经典社会困境实验(如囚徒困境、投票博弈、极化传播、全球价值观表达及个体人格表达)生成超过5200条高保真模拟轨迹,每条轨迹均包含精细的智能体行为日志、提示响应对与环境变量配置。通过提供结构化假设检验框架,该数据集开创了从现象复现迈向方法论验证的新范式,对推动LLM社会模拟的标准化评估与可重复研究具有里程碑意义。
当前挑战
该数据集面临的核心挑战包括:其一,社会模拟评估的领域问题——现有方法多依赖定性观察或启发式规则,缺乏可量化、可复现的评估指标来验证模拟是否真实反映人类社会的合作、极化与规范形成等复杂动态,尤其难以区分模型内生偏差与现象本质特征。其二,构建过程中的技术挑战——需协调多源数据合规性(如World Values Survey的注册授权限制)、确保跨模型(Qwen3.5、Gemma-4系列)生成结果的可比性,并设计能覆盖条件优化、拓扑结构、记忆机制等多元变量的复杂实验设计,同时通过SHA256校验与完整日志记录保障每个运行版本的可追溯性。此外,假设操作化定义需完全由参与者自主创新,避免预设基准评分带来的过拟合风险,这对构建既开放又严谨的评估生态提出了更高要求。
常用场景
经典使用场景
该数据集专为评估大型语言模型社会模拟质量而设计,核心使用场景是评测代理仿真日志中的涌现行为。研究者可基于五个精心构建的情景实验——包括等级推理博弈、迭代囚徒困境、极化传播、规范感知与人格表达——对仿真轨迹进行假设检验。数据集提供了完整的实验设计元数据、条件变量配置以及细粒度的交互事件记录,使得用户能够从多代理系统的宏观模式中审视LLM驱动社群是否展现出类人的社会现象,例如合作演化、信息茧房形成或价值观念的群体差异。
实际应用
在应用层面,该数据集直接服务于需要对大规模文本代理行为进行系统性评估的各类实践。例如,社会科学研究者可利用其检验不同提示策略下LLM代理在谈判、合作与意见形成过程中是否与真实人类行为统计一致。计算社会科学平台开发者可借助该数据集验证仿真引擎的鲁棒性与可解释性。此外,政策模拟、群体决策支持系统以及舆论演化预测工具等上游应用,均可基于该数据集提供的标准化假设与日志格式来测试自身评估管线的有效性,从而将LLM社会模拟从演示驱动推向证据驱动。
衍生相关工作
该数据集的发布催生了一系列围绕社会仿真评估方法学的衍生工作。一方面,研究者设计了多种针对仿真日志的统计检验与因果推断框架,例如基于博弈论层级理性假设的行为分类器、衡量群体规范收敛度的认知距离度量,以及利用反事实推理来评估网络效应极化强度的归因指标。另一方面,社区围绕该共享任务的假设检验格式,开发了包括socsim_eval在内的开源评估工具包,推动了可重复的社会计算基准建设。这些工作共同促进了面向LLM社会仿真质量的系统化评测体系从零散指标向标准化协议演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务