遇见数据集

multiagent-entropy-rawdata

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

本数据集是论文《When Does Multi-Agent Collaboration Help? An Entropy Perspective》中所有图表和结论背后的原始实验数据,用于复现论文报告的全部结果和结论。数据集总规模约5GB,包含237个文件,主要格式为CSV(聚合指标)和JSON(熵分布、评估指标)。数据内容涵盖在多智能体系统(MAS)协作背景下,从熵的视角研究协作效果的大规模实验输出。数据组织分为三个主要部分:合并数据集(包含44,781行、254列的扁平化主表)、评估结果(按模型、任务类型和实验条件分类存储的详细结果)和数据挖掘分析(包含119个条件消融的聚合CSV切片)。数据集支持多种智能体架构(如单智能体、顺序式、集中式等)和多种基础模型(如Qwen3系列、Llama-3.1/3.2系列),评估任务覆盖推理基准(如GSM8K、AIME2024/2025等)和智能体任务(如GAIA、Finance Agent Benchmark)。每个实验目录通常包含三个核心文件:aggregated.csv、entropy.json和metrics.json,关键字段包括目标变量`is_finally_correct`、架构标识`architecture`、熵特征等。该数据集适用于研究多智能体协作、不确定性量化、智能体架构比较、熵与问题解决性能关系等任务。

This dataset contains all the raw experimental data underlying the figures and conclusions of the paper *When Does Multi-Agent Collaboration Help? An Entropy Perspective*, and is intended to reproduce all results and conclusions reported in the paper. The total size of the dataset is approximately 5 GB, comprising 237 files, with the main formats being CSV (for aggregated metrics) and JSON (for entropy distributions and evaluation metrics). The dataset covers large-scale experimental outputs studying collaborative effectiveness from an entropy perspective in the context of multi-agent system (MAS) collaboration. The data is organized into three main sections: 1) Merged dataset: a flattened main table with 44,781 rows and 254 columns; 2) Evaluation results: detailed results stored categorized by model, task type and experimental conditions; 3) Data mining analysis: aggregated CSV slices for 119 ablation studies under different conditions. The dataset supports multiple agent architectures (e.g., single-agent, sequential, centralized, etc.) and various foundational models (e.g., Qwen3 series, Llama-3.1/3.2 series). The evaluation tasks cover reasoning benchmarks (e.g., GSM8K, AIME2024/2025, etc.) and agent tasks (e.g., GAIA, Finance Agent Benchmark). Each experimental directory typically contains three core files: aggregated.csv, entropy.json and metrics.json, with key fields including the target variable `is_finally_correct`, architecture identifier `architecture`, entropy features and others. This dataset is applicable to research tasks such as multi-agent collaboration, uncertainty quantification, agent architecture comparison, and the relationship between entropy and problem-solving performance.

创建时间:
2026-06-05
原始信息汇总

数据集概述:MultiAgent-Entropy Raw Data

该数据集是论文《When Does Multi-Agent Collaboration Help? An Entropy Perspective》的完整原始实验数据,用于复现论文中的所有结果和结论。

  • 数据集大小:约 5 GB,包含 237 个文件。
  • 数据格式:CSV(聚合指标)和 JSON(熵分布、评估指标)。
  • 许可证:MIT License。
  • 任务类别:文本生成、问答。

数据组织

数据按以下结构组织:

1. 合并数据集

  • merged_datasets/master.csv:主合并表(44,781 行,254 列),整合了所有实验数据。

2. 评估结果 (evaluation_results/)

目录 内容 大小
reasoning_benchmarks/ 所有模型组合的按数据集聚合结果 ~1.4 GB
by_model/qwen/ Qwen3 (0.6B, 4B, 8B) 模型的细分数据 ~1.3 GB
by_model/llama/ Llama-3.1 (3B, 8B) 模型的细分数据 ~837 MB
by_model/rl/ 基于强化学习的模型细分数据 ~406 MB
by_model/qwen3_14b/ Qwen3-14B 大模型数据 ~140 MB
agentic_tasks/gaia/ GAIA 基准测试结果 ~439 MB
agentic_tasks/finagent/ FinAgent 基准测试结果 ~16 MB
temperature_ablation/ Math500 上的温度消融实验 (t=0.4, 0.6, 0.8) ~149 MB
round_analysis/round_2/ 第 2 轮多轮实验数据 ~118 MB
round_analysis/round_5/ 第 5 轮多轮实验数据 ~247 MB

3. 数据挖掘分析 (data_mining/)

  • results_aggregated/:119 个条件消融后的聚合 CSV 切片,用于详细分析(~10 MB)。

关键列

master.csv 中的核心列包括:

  • 目标变量is_finally_correct(布尔值),表示多智能体系统是否正确解决问题。
  • 架构architecture,取值包括 singlesequentialcentralizeddecentralizedfull_decentralizeddebatehybrid
  • 熵特征sample_mean_entropysample_std_entropysample_max_entropy 等,令牌级别的不确定性统计。
  • 基线比较base_model_is_finally_correct,表示单一智能体能否解决该问题。
  • 实验标识符model_namedatasetsample_id

支持的智能体架构

架构 描述
single 线性单一求解智能体
sequential 流水线:规划者 → 求解者 → 评论者 → 裁判
centralized 两层结构:领域智能体 + 中央协调器
decentralized 顺序智能体,在协调前带有回环
full_decentralized 全连接智能体,带有回环
debate 多智能体辩论,通过多数投票决定
hybrid 两层拓扑,具有增强的上下文共享

支持的基底模型

  • Qwen3-0.6B, Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Qwen3-14B
  • Llama-3.2-3B-Instruct, Llama-3.1-8B-Instruct
  • RL 微调变体

使用的数据集

推理基准

  • GSM8K:小学数学应用题
  • AIME2024 / AIME2025:美国数学邀请赛
  • MMLU:大规模多任务语言理解
  • HumanEval:代码生成基准
  • Math500:数学推理问题

智能体任务

  • GAIA:通用人工智能助手基准
  • Finance Agent Benchmark:金融智能体任务

每个实验目录的文件结构

每个实验目录包含三个文件:

  • aggregated.csv:每个样本的聚合数据,270 列,包括熵统计(均值、标准差、最大值、最小值、Q1、Q3、方差)、准确率、令牌数以及逐轮动态。
  • entropy.json:每个样本的完整熵分布数据(JSON 格式)。
  • metrics.json:评估汇总指标(准确率、ECE 等)。
  • 每个组级别包含一个 summary.csv,提供跨数据集/实验的聚合。
搜集汇总
数据集介绍
multiagent-entropy-rawdata 数据集图片
构建方式
该数据集源自对多智能体协作系统中熵动力学与协同效能之间内在关联的深入研究。其构建过程严格遵循论文所述的三阶段流水线:首先,在GPU集群上运行多样化多智能体架构(包括顺序、集中式、分散式、辩论及混合等七种拓扑)的实验,生成原始轨迹与张量数据;随后,通过CPU执行的评估模块,对实验结果进行系统化聚合与分析,输出包含熵分布统计量、准确率及资源使用等指标的结构化文件;最后,数据挖掘阶段将所有实验结果整合为一份包含44,781行、254列的主合并表。整个构建过程确保了数据的高度可重复性与分析一致性,每一份CSV与JSON文件均可直接追溯至其生成代码模块。
特点
此数据集呈现出三大核心特色。其一,规模宏大且层次清晰:总量约5GB,涵盖237个文件,按模型(如Qwen3、Llama)、任务类型(推理基准如GSM8K、AIME、MMLU,以及智能体任务如GAIA、FinAgent)、实验变量(温度消融、多轮交互)进行精细分类组织。其二,熵度量维度丰富:每个样本均记录均值、标准差、最大值、最小值及四分位数等熵统计量,并分解至每一智能体与每一轮次,为理解集体不确定性演化提供了前所未有的细粒度视角。其三,内置对比框架:通过同时存储单智能体基线与多智能体系统的表现,研究者可直接评估协作带来的增益。
使用方法
使用者可借助加载`master.csv`文件快速进入探索。核心操作包括按架构类型过滤(如比较单智能体与各多智能体系统的差异),或依据`is_finally_correct`标签分析正确与错误解在熵特征上的分离模式。对于希望复现论文结论的研究者,建议克隆配套代码仓库,将`evaluation_results`与`merged_datasets`置于指定路径后,运行数据挖掘脚本即可复现分类、SHAP及主成分分析等关键分析流程。无需GPU即可完成全部复现工作。关键字段涵盖目标变量(`is_finally_correct`)、架构标识(`architecture`)、熵特征(`sample_mean_entropy`等)及基模型对比字段(`base_model_is_finally_correct`),为深入挖掘多智能体协作条件提供了清晰的数据入口。
背景与挑战
背景概述
多智能体系统(Multi-Agent Systems, MAS)通过多个大语言模型(LLM)的协同交互,尝试超越单一模型在复杂推理和任务求解中的能力上限。然而,协作何时真正有效、何处可能冗余甚至退化,一直是该领域悬而未决的核心问题。2026年,Yuxuan Zhao、Sijia Chen与Ningxin Su在论文《When Does Multi-Agent Collaboration Help? An Entropy Perspective》中,从信息熵的理论视角系统性地剖析了这一难题。他们构建的“MultiAgent-Entropy RawData”数据集及其配套的代码仓库,通过对七种不同MAS架构(如顺序、中心化、去中心化、辩论等)在GSM8K、AIME、MMLU、HumanEval、Math500、GAIA及金融智能体基准上的大规模实验,收集了超过44,000条包含熵统计量的精细样本数据。该数据集为理解多智能体协作的边界与内在不确定性提供了严格的实证基础,推动了从直觉驱动到理论驱动的MAS研究范式转变。
当前挑战
该数据集所面对的首要挑战,是如何在理论上界定多智能体协作的收益阈值与退化条件——即回答“何时协作优于单智能体”这一根本问题,而非仅依赖经验性的性能对比。传统方法常忽略智能体内部与之间信息交互的不确定性,而熵视角的引入旨在量化这种噪声对协作效率的影响。在构建过程中,团队面临了显著的技术挑战:需要为不同架构(如全去中心化、混合型)设计统一的实验框架,以确保跨模型(覆盖0.6B至14B参数规模)、跨任务的可比性;同时,需采集并标准化高达5GB的原始日志数据,包括熵分布、轮次动态及资源消耗,这要求在评估流水线中集成高效的采集与聚合模块,以支持后续复杂的可复现分析与可视化。
常用场景
经典使用场景
该数据集为多智能体协作与熵动力学研究提供了基础性实验数据,经典使用场景包括复制论文中的全部实验结论与图表。研究者可加载master.csv文件(包含44781行、254列的综合指标),通过分析样本熵均值、熵标准差与最终正确性的关系,验证多智能体系统在何种条件下优于单一智能体。六种架构(顺序、集中式、去中心化、完全去中心化、辩论、混合)在GSM8K、AIME、MMLU等推理基准与GAIA、FinAgent等代理任务上的完整评估结果,为深入探究熵作为协作有效性预测因子的可靠性奠定了数据基础。
实际应用
在实际应用中,该数据集为复杂问题求解系统的架构设计提供了科学依据。开发者可依据熵曲线特性选择最优协作模式,例如在数学推理(GSM8K、Math500)和代码生成(HumanEval)任务中,依据熵阈值决定采用单一智能体或结构化多智能体辩论架构。金融领域的FinAgent基准实验数据表明,熵分析可指导自动化交易与风险评估系统的多智能体配置优化。此外,温度消融实验数据为生成任务中的探索与利用平衡提供了参数校准参考,直接服务于需要高稳定性的工业级多智能体部署场景。
衍生相关工作
该数据集衍生了一系列以熵为核心的多智能体理论研究工作。基于master.csv中的全量熵分布与架构标识,研究者已开展分类器训练以预测协作收益拐点,以及SHAP值归因分析量化各架构组件对熵的影响。该数据还支撑了多轮对话衰减现象的建模,揭示了随着交互轮次增加熵值变化与决策质量退化的规律。未来工作预计包括基于熵梯度的实时协作触发机制设计、跨模型系列的熵-性能关系泛化验证,以及将熵作为约束条件的多智能体系统通信效率优化算法的开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务