KAIROS_EVAL
收藏资源简介:
KAIROS_EVAL是一个用于评估大型语言模型在多代理社会互动场景中鲁棒性的基准数据集。它包含了多选问答任务,并且能够模拟同伴影响来评估模型在社交压力下的表现。
KAIROS_EVAL is a benchmark dataset for evaluating the robustness of large language models (LLMs) in multi-agent social interaction scenarios. It includes multiple-choice question answering tasks, and can simulate peer influence to assess model performance under social pressure.
KAIROS_EVAL 数据集概述
数据集简介
KAIROS是一个基准数据集,旨在评估大型语言模型(LLMs)在多智能体社交互动场景中的鲁棒性。该数据集通过捕获模型的原始信念(答案和置信度),并模拟具有不同可靠性的智能体同伴影响,动态构建每个模型的评估设置。
支持任务与排行榜
- 多项选择问答(MCQA),涵盖推理、知识、常识和创造力四个领域
- 鲁棒性评估:量化原始设置和同伴影响(KAIROS)设置之间的性能变化
- 效用与抵抗分析:跟踪模型在社会影响下纠正错误或保持正确答案的能力
数据集结构
- 训练集:10,000个实例
- 测试集:3,000个实例
- 所有任务均格式化为多项选择问答(MCQA)
- 为开放式任务生成并验证干扰答案
- 每个实例包含:原始模型答案和置信度、同伴智能体响应(支持、强硬反对、温和反对)、模拟信任动态的交互历史
领域覆盖
- 推理:逻辑谜题、MATH-500、LiveCodeBench、BBH-hard
- 知识:TruthfulQA、MMLU-Pro
- 常识:CommonsenseQA 2.0、Social IQ
- 创造力:MacGyver问题解决、BrainTeaser谜题
评估指标
- 准确率:答案的正确性
- 鲁棒性(O–K ∆):原始和KAIROS评估之间的性能稳定性
- 效用:利用同伴输入修正错误的能力
- 抵抗:在社会压力下保持正确答案的能力
使用场景
- 评估LLMs在多智能体环境中的鲁棒性
- 研究AI中的从众偏差和信任敏感性
- 训练和基准测试社会基础推理模型
数据格式
- 数据根目录:
data/ - 评估集:
data/final_test.json(JSON Lines格式) - 训练集:
data/final_train_dict_MAS/、data/final_train_dict_nonMAS/、data/final_train_dict_SFT/- MAS:多智能体系统设置
- nonMAS:非多智能体;直接单轮提示目标LLM
- SFT:监督微调对
子数据集
包含bbh、truthfulqa、moral_stories、math500、winogrande、simpleqa、popqa、commonsenseqa、protoqa、siqa、riddle_sense、mmlupro、final_test、brainteaser、livecode、macgyver、socialnorm、aqua_rat等
语言
主要语言:英语(部分项目可能包含数学符号/LaTeX)
许可证信息
- 许可证:Apache-2.0
- 部分子数据集可能源自第三方来源,具有自己的许可证
引用信息
bibtex @article{kairos_mas, title={LLMs Can’t Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions}, author={Maojia Song, Tej Deep Pala, Weisheng Jin, Amir Zadeh, Chuan Li, Dorien Herremans, Soujanya Poria}, year={2025}, url={https://github.com/declare-lab/KAIROS} }




