遇见数据集

SocietyBench

收藏
github2026-08-04 更新2026-08-21 收录
官方服务:

资源简介:

反事实社会世界的演化预测

Evolutionary Prediction of Counterfactual Social Worlds

创建时间:
2026-07-31
原始信息汇总

数据集概述

SocietyBench 是一个用于评估大语言模型在反事实社会世界演化预测能力上的基准测试数据集。其核心目标在于衡量模型是否能够预测真实社会事件在匿名化后如何继续发展,从而排除模型通过预训练数据直接“识别”事件的捷径。

核心设计

该基准通过一个独特的反事实化处理流程来构建测试环境:

  • 实体替换:将所有命名实体(如人物、公司、地点)替换为占位符。
  • 日期偏移:将每个事件的所有日期按固定常数进行平移。
  • 结构保留:在去除可识别标签的同时,完整保留事件的因果和时间结构。

这使得模型面对的是一个只能预测、无法回忆的反事实社会世界

评估维度

模型被置于一个截止日期,只能看到该日期之前的全部信息,然后回答关于未来的两类问题:

评估轴 问题类型 评估指标 平凡锚点
概率校准 事件 E 是否会在未来 W 天内发生? 加权平均绝对误差(归一化至 0–100 分) 对所有问题都回答 50%,得分恰好为 50
时间准确性 事件 e 具体发生在哪一天? 分段归一化天数误差(归一化至 0–100 分) 猜测区段中点,得分约为 50

两个维度相互独立,每个事件分别计算得分,最终按事件求平均。

数据规模

项目 数量
事件 5 个(涵盖公共争议、地缘政治、科技政策、金融市场、贸易政策)
预测点 每个事件 25 个,总计 125
校准问题 每个语言版本 25,364
时间事件 每个语言版本 3,112
语言版本 中文和英文,一对一对应

当前基准表现

最强模型在基准上达到了 75.0 / 100 分,大约是平凡锚点以上一半的上升空间。这表明当前基准远未饱和,仍有充分的挑战性。

数据构建流程

整个流水线包含五个阶段:

  1. 采集:从五个平台抓取网络新闻和社交媒体帖子,输入为一行事件主题。
  2. 蒸馏:通过智能体链将原始条目压缩为按日期索引的时间线,并区分事实事件公众舆论两个独立层面。
  3. 匿名化:包括三个阶段——实体替换和日期平移、对抗性反向识别审计、语义一致性修复。
  4. 出题:每个截止日期都生成经过审计的校准和时间问题题库。
  5. 评分:计算两个独立的百分制评分轴。
搜集汇总
数据集介绍
SocietyBench 数据集图片
构建方式
SocietyBench的构建始于对真实社会事件的系统采集,涵盖公共争议、地缘政治、科技政策、金融市场与贸易政策五大领域,通过五个平台的网络新闻与社交媒体信息汇聚原始素材。随后,一个智能体链将原始条目蒸馏为按日期索引的时间线,清晰区分事实性事件与公众意见层。为规避模型基于预训练知识的记忆捷径,构建过程实施了严格的三阶段匿名化处理:实体替换与日期平移打乱可识别标记,对抗性反向识别审计排查泄露风险,语义一致性修复确保因果与时间结构完整保留。每个截止日期均生成经过审计的问题库,最终形成包含25,364个校准问题与3,112个时间事件的双语平行语料,构建出一个仅可预测而无法回忆的反事实社会世界。
使用方法
使用者可通过克隆代码库并配置环境变量(需提供兼容OpenAI的API端点)快速启动评测。内置复现命令可一键拉取数据集中的指定事件(如event3_tiktok),完成双轴评估并输出结果至工作区,支持从任一阶段恢复执行以适应个性化需求。对于构建自定义基准,用户只需提供一行事件主题及实体映射文件,主程序将自动执行爬取、蒸馏、匿名化、出题与评分全流程。附带丰富的文档体系,详述技术方法论、评分公式与架构设计,并提供案例研究指导,使研究者既能复现论文数字,亦能便捷地拓展新事件,推动社会演化预测领域的深入探索。
背景与挑战
背景概述
SocietyBench 数据集由 Wang Zhenran、Bian Zhonghan、Li Jinsong 和 Qi Zhangyang 等研究者于 2026 年创建,旨在评估大型语言模型(LLM)在反事实社会世界中的演化预测能力。与传统任务完成型基准不同,SocietyBench 通过匿名化处理(如实体替换和日期偏移),消除模型依赖预训练数据记忆事件的可能性,从而专注于模型对事件时间线后续发展的推理与预测。该数据集涵盖五个社会事件领域,包含 25,400 余道校准问题和 3,100 余个时间事件,提供中英双语版本,并评价了六个前沿 LLM、三个智能体框架及两个无模型基线。其核心创新在于构建了反事实环境,迫使模型基于因果与时间结构而非记忆进行预测,填补了现有基准在动态社会事件预测评估上的空白,对 AI 社会推理能力的研究具有重要影响。
当前挑战
SocietyBench 所面临的挑战主要来自两个方面。在领域问题层面,它直面 LLM 在社会事件长期演化预测中的核心难题:如何超越对训练数据的模式识别,实现真正基于因果推理的预测。由于真实事件常被预训练数据覆盖,模型容易通过记忆捷径获得高分,而反事实匿名化虽切断了这种捷径,却要求模型具备更强的泛化能力与对事件动态的深刻理解,这远超现有任务完成型基准的评估范畴。在构建过程中,挑战同样严峻:实体替换与日期偏移必须在不破坏时间线因果与语义一致性的前提下进行,需经过对抗性反向识别审计和语义一致性修复以确保匿名化的可靠性;此外,生成覆盖多时间截止点的高质量问题库、确保事实与观点层面的分离,以及实现中英文版本的严格对齐,均需精细的流水线设计与大量人工审核,这些环节共同构成了数据集构建的显著难点。
常用场景
经典使用场景
SocietyBench作为一项面向反事实社会世界演化预测的基准测试,其核心使用场景在于评估前沿大语言模型在给定事件截断时间点后,对事件后续发展轨迹的预测能力。该基准通过将真实社会事件中的实体匿名化与日期偏移,构建出无法依赖记忆检索的平行世界时间线,要求模型仅凭因果与时间结构推断事件概率与发生日期。这一设计使得研究者能够严格剥离预训练知识带来的捷径,纯粹衡量模型的时序推理与概率校准能力,适用于大模型社会智能、事件预测与反事实推理等领域的系统性评估。
解决学术问题
该数据集精准回应了现有任务完成型基准无法触及的能力维度——模型能否在无法识别具体事件的前提下,预测社会事件的持续演化。通过匿名化处理消除记忆匹配的可能性,SocietyBench迫使模型依赖因果逻辑与时间模式进行推断,从而解决了评估中常见的预训练数据污染问题。其双轴评分体系将概率校准与时间精度分离,为衡量模型在不确定环境下的决策可靠性提供了标准化工具,推动了社会预测领域从简单事实记忆向深层情境理解的范式转变。
实际应用
在实际应用中,SocietyBench的评估框架可迁移至舆情监测、风险评估与政策模拟等场景。例如,政府或企业可利用其匿名化流程构建内部事件的预测基线,检验AI系统在敏感信息不可见时的预警能力。对于金融市场的波动预判、地缘政治冲突态势推演或重大科技政策的社会反响模拟,该基准提供了从数据采集、时间线蒸馏到预测评分的一体化方案,辅助决策者在信息不完备条件下优化响应策略,并推动可解释、可审计的自动化预测工具落地。
数据集最近研究
最新研究方向
SocietyBench数据集聚焦于反事实社会世界的演化预测,通过匿名化处理真实事件的时间线,剥离模型对已知事件的记忆识别能力,从而评估其对社会动态的因果推断和时序预测能力。该基准涵盖五个关键领域(公共争议、地缘政治、技术政策、金融市场、贸易政策),设有双重评估轴:事件发生概率校准与事件发生日期预测,并引入对抗性逆向识别审计和语义一致性修复流程,确保数据匿名化的严谨性。当前前沿方向包括多语言(中英)跨国界的预测能力对比、前沿大语言模型与多智能体框架在反事实场景下的性能差距度量,以及模型-free基线的鲁棒性探索。SocietyBench为评估大模型在复杂社会系统中的泛化推理能力提供了全新范式,推动AI从模式识别向真正的动态因果理解演进,对政策模拟、风险预警等应用具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务