遇见数据集

Social Tasks in Sandbox Simulation (STSS)

收藏
arXiv2024-04-08 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

STSS数据集由清华大学计算机科学与技术系开发,旨在通过沙盒模拟评估语言代理的社会智能。该数据集包含30个社会任务模板,涵盖5个类别,用于客观评估语言代理在多代理模拟中的目标达成情况。数据集创建过程中,通过模拟轨迹和自动后分析来量化任务成功度。STSS数据集的应用领域包括语言模型和代理架构的评估,旨在解决现有社会智能评估中主观性和语言层面评估的不足。

The STSS dataset was developed by the Department of Computer Science and Technology, Tsinghua University. It is designed to evaluate the social intelligence of language agents via sandbox simulations. This dataset contains 30 social task templates across 5 categories, which are utilized to objectively assess the goal achievement of language agents in multi-agent simulation scenarios. During the dataset construction process, task success rates are quantified based on simulation trajectories and automated post-analysis. The application scope of the STSS dataset includes the evaluation of language models and agent architectures, aiming to address the limitations of subjectivity and linguistic-level evaluation in existing social intelligence assessment studies.

创建时间:
2024-04-08
搜集汇总
数据集介绍
Social Tasks in Sandbox Simulation (STSS) 数据集图片
构建方式
在社交智能评估领域,现有基准多停留于语言层面或依赖主观指标,难以真实反映智能体在行动层面的社交能力。为弥补这一空白,STSS基准基于Smallville沙盒模拟环境构建,精心设计了涵盖公共活动、预约会面、邀请同伴、在线活动及求助五大类别的30个社交任务模板。每个模板均明确了任务类型、目标、时间、地点及预期参与者等关键要素,并通过实例化生成具体任务。评估时,将单一社交任务分配给指定智能体,其余角色对任务不知情,通过分析模拟轨迹中的行动与位置,依据参与者数量、目标达成度等客观规则计算量化得分,从而实现对语言智能体行动层面社交智能的客观评测。
特点
STSS基准的核心特色在于其客观性与行动导向性。与仅评估语言输出的传统基准不同,STSS通过沙盒模拟将文本输出具象化为可观察的行动,使评估从语言层面下沉至行动层面,显著提升了评价的可靠性。基准覆盖了规划、表达、协商等社交核心能力,任务设计聚焦于“谁、何时、何地”三要素,并通过自动后验分析生成量化指标,如参与者比例、子任务完成率等。此外,STSS还配套构建了语言层面的情境对话基准,包含325个从模拟中采集的对话场景,作为经济高效的初步评估手段,与行动层面评估互为补充,形成了从语言到行动的双层评测体系。
使用方法
使用STSS基准时,研究者需将待评估的语言智能体部署于沙盒模拟环境中,并为其分配一个具体的社交任务。智能体需自主规划、执行邀请、协商等行动,模拟器会记录其完整轨迹。评估过程完全自动化:系统根据任务类型对应的规则集分析智能体的行动序列与位置变化,自动计算得分。例如,对于公共活动任务,得分取决于实际参与者与预期参与者的比例。为降低评估成本,可先利用语言层面的对话基准进行初步筛选,再对表现优异的智能体进行完整的沙盒模拟评估。此外,研究者还可通过集成目标驱动规划(TDP)模块来探索智能体架构对社交任务执行效果的影响,从而将STSS作为语言模型与智能体架构的双重测试平台。
背景与挑战
背景概述
在大型语言模型展现出类人水平性能的背景下,语言智能体在模拟人类社会交互方面取得了显著进展。然而,现有社会智能基准测试多停留于语言层面或依赖主观评估指标,难以真实反映智能体在行动层面的社交能力。为弥合这一鸿沟,清华大学与微软小冰团队于2024年联合提出了沙盒模拟中的社交任务(STSS)基准。该基准以行动级客观评估为核心,通过多智能体沙盒模拟环境,定量衡量语言智能体在完成目标导向社交任务时的表现。STSS涵盖30个模板、五大类社交任务,并配套语言级对话基准,为全面评估智能体的规划、表达与协商能力提供了标准化平台,对推动社会智能评估从主观向客观、从静态向动态演进具有里程碑意义。
当前挑战
STSS基准面临的挑战主要源于社交智能评估的复杂性与模拟环境的不确定性。其一,领域问题层面,现有语言级评估无法捕捉智能体“说而不做”的言行不一现象,而行动级评估需在动态多智能体交互中量化任务达成度,对智能体的规划连贯性与行为一致性提出了严苛要求。其二,构建挑战方面,如何设计可客观量化的指标以区分偶然路过与主动参与、如何确保模拟中智能体的日程与社交网络多样性以逼近真实场景,以及如何在经济成本可控下维持评估的统计稳健性,均为棘手难题。此外,语言级与行动级评估间的性能落差揭示出信息传达准确性与行为落地之间的鸿沟,成为制约智能体迈向真实世界应用的核心瓶颈。
常用场景
经典使用场景
STSS基准测试被设计用于在沙盒模拟环境中评估语言代理的社会智能。其经典使用场景是将一个面向特定目标的社会任务(如举办艺术展览或安排约会)分配给代理,然后通过多代理模拟中的行动轨迹来客观量化任务的完成度。该基准通过分析参与者是否在正确的时间和地点执行预期行动,从而超越单纯的语言层面评估,提供了一种基于行动的目标达成度衡量标准。
实际应用
在实际应用中,STSS可用于开发和完善具备社会交互能力的虚拟助手、游戏NPC或社交机器人。例如,在虚拟世界中,代理需要自主邀请他人参加活动、协调时间地点或请求帮助,这些能力对于构建逼真的数字人类或自动化社交协调系统至关重要。此外,该基准的经济高效语言级子集也为资源受限的场景提供了初步评估手段,有助于筛选适合实际部署的语言模型。
衍生相关工作
STSS衍生出了目标驱动规划模块,该模块作为生成式代理的增强组件,显著提升了代理在社会任务中的表现。相关工作包括在代理架构中引入结构化规划与对话提醒,以弥补语言模型在复杂社交场景中的不足。此外,该基准的评估方法论启发了后续研究,如将行动级客观度量与语言级主观评估相结合,或探索沙盒模拟与真实世界对齐的迁移学习,从而进一步扩展了社会智能评估的深度与广度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务