6G-Bench
收藏资源简介:
6G-Bench是一个开放的标准化基准,用于评估基础模型(LLMs及其他)在AI原生6G网络中的语义通信和网络级推理能力。它包含113,475个源场景、10,000个非常难的多选题和3,722个经过专家验证的多选题,用于评估模型在网络意图和政策推理、网络切片和资源管理、信任、安全和SLA意识、AI原生网络和代理控制以及分布式智能和新兴6G用例等方面的能力。
6G-Bench is an open standardized benchmark for evaluating the semantic communication and network-level reasoning capabilities of foundation models (including LLMs and other types) in AI-native 6G networks. It comprises 113,475 source scenarios, 10,000 extremely challenging multiple-choice questions, and 3,722 expert-validated multiple-choice questions, designed to assess model performance across domains including network intent and policy reasoning, network slicing and resource management, trust, security and SLA awareness, AI-native network and agent control, as well as distributed intelligence and emerging 6G use cases.
6G-Bench 数据集概述
数据集基本信息
- 数据集名称:6G-Bench
- 核心定位:用于评估AI原生6G网络中基础模型语义通信和网络级推理能力的开放标准化基准。
- 官方论文:https://arxiv.org/pdf/2602.08675
- 官方发布地址:https://dx.doi.org/10.21227/c8pt-hc87
- 联系邮箱:mohamed.ferrag@uaeu.ac.ae / mohamed.amine.ferrag@gmail.com
核心特点与贡献
- 标准化对齐的任务分类法:包含30个决策任务(T1–T30),组织成五个源自6G和AI智能体标准化工作的能力类别。
- 不确定性下的网络级语义推理:任务要求基于意图、策略、信任和未来后果进行多步推理,并使用最坏情况后悔最小化原则。
- 大规模高难度基准:
- 源场景数量:113,475个
- 生成的极难多选题数量:10,000个
- 发布用于评估的专家验证多选题数量:3,722个
- 严格的验证流程:结合自动化结构检查和人类专家评审,确保语义正确性和唯一性。
- 全面的模型评估:评估了22个最先进的基础模型,涵盖密集和MoE架构、开源权重和专有系统、短上下文和长上下文设计。
能力类别
- 意图与策略推理:意图可行性评估、冲突解决、意图漂移检测、不确定性下的保守决策。
- 网络切片与资源管理:切片选择与切换、计算放置、优雅降级、SLA违规预测、能源感知决策。
- 信任、安全与SLA意识:信任感知卸载、智能体身份与上线、第三方暴露控制、自动化安全响应。
- AI原生网络与智能体控制:智能体互操作性、智能体间通信、生命周期管理、网络知识RAG决策。
- 分布式智能与新兴6G用例:联邦学习编排、ISAC决策、数字孪生、灾难响应、沉浸式服务。
问题形式与评估
- 问题形式:每个基准实例代表一个不确定性下的语义决策。所有问题均为多项选择题(A–D),但需要多步定量推理、不确定性感知预测、策略和信任约束评估以及未来后果比较。
- 评估协议:
- 确定性 pass@1 准确率
- 每任务准确率(T1–T30)
- 组级准确率(五个能力类别)
- 针对推理密集型任务的选择性 pass@k 准确率
- 模型响应格式:必须返回结构化JSON响应,例如
{"answer": "..."}。
基准设计流程
- 标准化收集与任务提取
- 语义状态与动作抽象
- 网络级语义推理与任务条件化
- 数据集验证(自动化 + 人在回路)
- 评估与指标
任务覆盖与示例
- 任务分布涵盖上述五个能力类别及30个具体任务。
- 问题示例展示了任务T1至T6的格式,包括问题描述、选项、正确答案、推理原因、理性标签和难度等级(例如“very_hard”)。




