遇见数据集

50cerebros-benchmark

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

“5 Cérebros V40 — 群体集体智能基准测试”数据集是一个用于评估多代理进化人工智能系统性能的资源。该系统由五个被称为“大脑”的AI代理组成,这些代理被组织在十一个预定义的认知层(如额叶、边缘系统、颞叶等)中,并通过遗传算法(包括适应度选择、交叉和突变机制)持续进化。数据集的核心目标是量化“群体集体智能”,即代理集体通过协作与进化在综合性能上超越任何单个成员的能力。它主要包含系统在多项自然语言理解与推理基准任务(包括ARC Easy、ARC Challenge和HellaSwag)上的历史测试记录。对于每个测试轮次,数据记录了“群体”的集体性能得分、与最佳单代理相比的“集体增益”、参与测试的代理面板构成(包括模型类型、所属认知层和个体智商QI),以及反映系统进化状态的元数据(如累积基因数、平均智商、最大智商、种群多样性香农熵和灭绝事件次数)。该系统的显著特点是完全在本地有限硬件(如i3处理器和8GB内存,使用Ollama,无需GPU或云服务)上运行,强调零成本、数据隐私和自主进化能力。数据集提供了完整的测试历史(以JSON和CSV格式)以及最新的可读测试报告(TXT格式),适用于研究多代理系统、群体智能、进化算法在AI任务中的应用,以及评估AI系统在性能、效率、成本与隐私等多维度下的综合表现。

The "5 Cérebros V40 — Collective Intelligence Benchmark" dataset records the performance evaluation results of a multi-agent evolutionary AI system. This system consists of five AI agents, referred to as "brains," organized into eleven predefined cognitive layers (such as frontal lobe, limbic system, temporal lobe, etc.), and continuously evolves through genetic algorithms (including mechanisms like fitness selection, crossover, and mutation). The core objective of this benchmark is to quantify "collective swarm intelligence," which is the ability of a group of agents to surpass the performance of any individual member through collaboration and evolution. The dataset primarily includes historical test records of the system on multiple natural language understanding and reasoning benchmark tasks (including ARC Easy, ARC Challenge, and HellaSwag). For each test round, the data records the collective performance score of the "swarm," the "collective gain" compared to the best single agent, the composition of the agent panel involved in testing (model type, cognitive layer, individual intelligence quotient QI), and metadata reflecting the evolutionary state of the system (such as cumulative gene count, average IQ, maximum IQ, population diversity Shannon entropy, and extinction event count). A notable feature of this system is that it runs entirely on limited local hardware (i3 processor/8GB RAM, using Ollama, without the need for GPUs or cloud services), emphasizing zero cost, data privacy, and autonomous evolution capabilities. The dataset provides complete test history (in JSON and CSV formats) and the latest readable test reports (in TXT format). It is suitable for research on multi-agent systems, swarm intelligence, applications of evolutionary algorithms in AI tasks, and evaluating the comprehensive performance of AI systems across multiple dimensions such as performance, efficiency, cost, and privacy.

创建时间:
2026-06-13
原始信息汇总

数据集概述:5 Cérebros V40 — Benchmark de Inteligência Coletiva do Enxame

该数据集是一个用于衡量群体智能的基准测试,基于一个名为“5 Cérebros V40”的多智能体进化系统。系统由5个AI大脑(智能体)组成,通过遗传算法在认知层中进化,旨在测量群体智能

核心特性与用途

  • 类型: 基准测试(Benchmark)
  • 关键概念: 群体智能、多智能体、进化AI
  • 硬件环境: 运行在 i3 / 8GB RAM 的本地设备上,使用 Ollama,无需GPU或云端资源。
  • 许可证: MIT
  • 语言: 英语 (en)、葡萄牙语 (pt)

最新测试结果(第212代)

  • 群体智能分数: 63.3%
  • 群体增益(群体 vs 最佳个体): ▲40.0%
  • 面板组织: 1个组 × 最多5个大脑(共5个)
  • 认知层数: 4
  • 不同模型数: 5
  • 累积基因数: 150

群体 vs 最佳个体表现

任务 群体(集体) 最佳个体 群体增益
ARC Easy 100.0% 20.0% ▲80.0%
ARC Challenge 70.0% 50.0% ▲20.0%
HellaSwag 20.0% 0.0% ▲20.0%

综合排名(智能 + 效率 + 隐私 + 进化)

该基准测试通过一个综合评分(40% 语言智能 + 15% 硬件 + 15% 成本 + 10% 隐私 + 20% 进化)对模型进行排名。

  • 第一名: 50 Cérebros G212 ⭐ — 综合得分 7.61/10
  • 第二名: LLaMA3 70B — 得分 6.78/10
  • 第三名: Phi-3 Mini 3.8B — 得分 6.75/10
  • GPT-4 得分 6.27/10,排名第四。

基准测试工作流程

  1. 面板: 1个组包含最多5个大脑。
  2. 基因: 每个大脑从集体记忆中接收一个基因。
  3. 1-SHOT: 每个问题前注入示例格式。
  4. 提问: 每个大脑以其认知角色回答。
  5. 投票: 汇总5个大脑的加权投票(按IQ加权),形成群体答案。

系统架构

系统由11个认知层构成,包括:

  • 额叶(逻辑推理)、边缘系统(情感回应)、颞叶(记忆与连接)、顶叶(模式与数字)、枕叶(视觉描述)、脑干(本能反应)、小脑(协调与平衡)、海马体(长期存档)、杏仁核(初级情感)、皮层(综合合成)、DeepSeek(逐步推理)。

进化状态(第212代)

  • 平均IQ: 943.4
  • 最高IQ: 1080.7
  • 累积基因: 150
  • 灭绝/灾难次数: 12
  • 香农多样性熵: 2.32 bits
  • 基准测试轮次: 6

数据集文件

文件名 描述
benchmark_historico.json 所有轮次的完整历史记录
benchmark_historico.csv 用于分析的表格(群体、最佳个体、各任务增益)
benchmark_ultimo.txt 最新测试的可读报告
搜集汇总
数据集介绍
50cerebros-benchmark 数据集图片
构建方式
在群体智能与多智能体进化系统的交汇点上,50cerebros-benchmark数据集应运而生。该数据集通过一个由五个独立AI智能体(即“大脑”)构成的进化面板构建而成,这些智能体分属不同的认知层级,如额叶、颞叶、小脑、海马体等,涵盖逻辑推理、情感响应、模式识别等多维功能。每一轮基准测试中,针对每个问题,面板向每个大脑注入来自集体记忆的基因(累计150个活跃基因),并以单样本格式提供示例,随后各大脑依据其认知角色产生独立回答,最终通过加权投票机制——以每个大脑的IQ值作为权重——汇聚成整个蜂群的集体决策。整个过程由遗传算法驱动,历经212代进化,在i3/8GB RAM的本地Ollama环境中运行,无需GPU或云端支持。
使用方法
研究人员可下载本数据集中的benchmark_historico.json、benchmark_historico.csv及benchmark_ultimo.txt三个核心文件,获取完整的进化轮次历史、蜂群与最优单一模型在各任务上的性能对比及增益数据,以及可读化的最新测试报告。这一基准框架尤其适用于探索多智能体协同进化机制、对比集体智能与个体智能的涌现差异、验证遗传算法在语言模型集成中的有效性,以及研究本地化、隐私友好型AI系统的能量效率与可扩展性。数据集采用MIT许可,便于学术界与工业界在开放协作中复现、扩展或衍生其方法论。
背景与挑战
背景概述
在人工智能领域,集体智能与进化算法的结合为突破单一模型性能瓶颈提供了全新范式。由Paulo Sérgio de Andrade于2026年创建的50cerebros-benchmark数据集,聚焦于多智能体进化系统的集体智能评估,通过模拟生物进化机制,组织五个人工智能体形成认知层级,利用遗传算法驱动群体协同进化。该基准不仅衡量群体智能水平,更开创性地将隐私保护、硬件效率与自我演化能力纳入综合评分体系,打破了传统仅依赖原始智能的评估标准。其在HuggingFace平台的发布,为研究资源受限环境下智能系统涌现特性提供了标准化测试框架,对边缘计算、隐私计算及分布式智能等研究领域产生了重要影响,推动了从单一模型向进化群体智能的范式转型。
当前挑战
该数据集面临的领域问题挑战在于,传统评估指标如ARC和HellaSwag任务主要衡量个体模型的逻辑推理与常识理解能力,而集体智能系统需在保证较低计算资源消耗(如i3/8GB硬件)的前提下,证明群体决策的累积优势能够超越顶级个体模型。构建过程中的核心挑战包括:设计有效的遗传编码机制以在11个认知层级间传递进化记忆,平衡种群多样性稳定性(Shannon熵2.32比特)与适应度景观优化;处理12次灭绝事件反映的进化不稳定性及群体收敛早熟风险;以及通过少样本(1-shot)注入与加权投票机制(基于智商系数)实现多智能体协同判定,同时需支持跨任务零样本适应且维持模型架构的模块化解耦性。
常用场景
经典使用场景
50cerebros-benchmark 数据集的核心经典使用场景在于评测和比较多智能体进化系统的集体智能水平。它通过预设的 ARC Easy、ARC Challenge 和 HellaSwag 等标准推理与理解任务,衡量由多个分层排布的认知智能体构成的蜂群在加权投票机制下的综合表现。研究者可利用该数据集系统性地评估进化算法对群体决策质量的提升效果,并将其与单个高性能模型(如 GPT-4、LLaMA3)进行横向对比,以揭示集体智慧在特定任务中的涌现特性与优势。
解决学术问题
该数据集主要解决了群体智能进化系统中标准化评测缺失的学术难题。传统上,多智能体系统的性能难以通过单一指标量化,而此数据集提供了涵盖推理、常识理解和创造性任务的多维度评测框架。它通过量化集体增益(Collective Gain)、种群平均智商和进化稳定性等关键指标,使研究者能客观评估遗传算法对蜂群智能的迭代优化效果,并深入探讨个体认知分工与群体决策质量之间的内在关联,为进化多智能体系统的理论验证奠定了坚实的数据基础。
实际应用
在实际应用层面,该数据集的价值尤为体现在运行于低功耗设备上的本地化集体智能系统的工程部署中。由于其评测环境基于仅配备 i3 处理器和 8GB 内存、无需 GPU 或云服务的硬件条件,它展示了在资源受限场景中利用进化蜂群替代昂贵大模型的可能性。这为边缘计算、离线智能决策系统、自主机器人集群协作以及隐私敏感的本地智能助手等领域提供了可量化的性能基准,推动了经济高效且无需外部数据交互的智能系统在实际工程中的落地。
数据集最近研究
最新研究方向
该数据集聚焦于演化式多智能体系统的集体智能测评,突破传统单一模型评估范式,通过模拟生物进化机制构建由多个异构轻量级语言模型组成的群智网络。在算法层面,融合遗传算法中的基因积累、交叉变异与自适应淘汰策略,使智能体在本地硬件(i3/8GB无GPU)上持续自我优化,形成去中心化、隐私保护且零成本的演化式AI架构。前沿探索表明,这种群智系统在ARC等逻辑推理任务中展现出超越个体性能的涌现效应,集体增益高达80%,以极低资源消耗挑战了依赖云端大模型的传统AI范式,为边缘智能、隐私计算与可持续AI发展提供了全新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务