EMRB
收藏数据链接:
官方服务:
资源简介:
EMRB是一个多层级基准测试,用于评估大语言模型在原始电磁信号上的推理能力,提供原始I/Q采集文件和五个难度级别的工程问题。
EMRB is a multi-level benchmark designed to evaluate the reasoning capabilities of Large Language Models (LLMs) on raw electromagnetic signals, providing raw I/Q acquisition files and engineering problems across five difficulty levels.
创建时间:
2026-07-27
原始信息汇总
EMRB:电磁原始信号大语言模型推理多层级基准
数据集概述
EMRB 是一个面向大语言模型(LLM)的多层级评估基准,旨在测试模型对原始电磁信号(I/Q 数据)的推理能力。与基于预处理特征或结构化表格的基准不同,EMRB 仅提供原始 I/Q 捕获数据,模型必须通过编写 Python 代码来分析信号、在沙盒环境中执行并迭代,最终产出结构化答案。
基准规模与结构
- 问题总数:200 个问题,分布在 5 个难度级别(每级 40 个问题,8 种原型 × 5 个随机种子)
- 子问题总数:920 个(L1–L4 每问题 5 个子问题,L5 每问题 3 个子问题)
- 信号类型:11 种,包括 BPSK、QPSK、8PSK、16QAM、64QAM、FM、AM-DSB、OFDM、2FSK、4FSK、Chirp
- 问题类型:27 种,各级别之间零重叠
- 难度级别:
| 级别 | 主题 | 子问题数 | 主要议题 |
|---|---|---|---|
| L1 | 基础测量 | 5 | 信号检测、功率、采样参数、噪声底、分类 |
| L2 | 信号处理 | 5 | FFT/加窗、带宽、自相关、STFT、能量/PSD |
| L3 | 通信理论 | 5 | 比特率/符号率、Eb/N0 与 BER、PAPR、ADC 量化、DDC/混频 |
| L4 | 多信号分析 | 5 | 符号率、FM、chirp/雷达、突发、链路预算、OFDM、干扰、AM、Shannon |
| L5 | 系统设计 | 3 | 频谱调查、雷达共存、OFDM 系统设计 |
模型表现与排行榜
在 15 个 LLM 上的总得分范围为 24.1%(Llama 3.3 70B)至 78.8%(GPT-5.5),未出现天花板效应。各级别平均分从 L1 的 84.9% 下降至 L5 的 21.2%,且没有任何单一模型在所有级别上均占优。
ReconPilot 管道
EMRB 附带 ReconPilot,一个三阶段结构化管道,用于将信号侦察与针对性分析分离:
| 阶段 | 功能 | 轮次 |
|---|---|---|
| 阶段 1:侦察 | 固定代码模板定位占用频谱区域并标记时间/频率行为,生成未解析区域图 | 1 |
| 阶段 2:分析 | 标准自由形式智能体循环,模型接收侦察摘要作为上下文解决所有子问题 | 最多 12 |
| 阶段 3:验证 | 确定性自一致性检查(如比特率与调制阶数、缺失子问题),若发现不一致则引导一次修复 | 最多 3 |
在三种骨干模型上,ReconPilot 将总体分数提升了 3.8 至 17.6 分,并改善了 15 种骨干-级别组合中的 13 种。
评估与评分机制
- 完全确定性评分:不使用 LLM 作为裁判
- 实体绑定匹配:每个答案针对其对应的特定信号和子问题进行验证
- 数量特定容差:如中心频率 ±0.5 MHz、功率电平 ±2 dB
- 前置条件门控评分(L5):下游答案仅在先决条件正确时才被计分
- 来源指纹:结果携带任务和评分器版本哈希以确保可复现性
- 评估 CLI 支持:单问题运行、整级别并行评估、ReconPilot 管道模式、仅重打分模式、跳过已完成问题等功能
数据与代码许可
- 代码:MIT 许可证
- 数据:CC BY 4.0 许可证
搜集汇总
数据集介绍

构建方式
EMRB基准数据集旨在评估大型语言模型对原始电磁信号的推理能力,其构建方式独树一帜,摒弃了预处理特征或结构化表格,直接提供原始的I/Q捕获数据(以.npy文件形式)。数据集包含200个问题,均匀分布于五个难度层级(L1至L5),每个层级涉及多个专题,从基础测量到系统设计,共涵盖11种信号类型和27种问题类型。每个问题附带原始信号数据,模型必须通过编写Python代码来自行发现信号结构,在沙盒环境中执行并迭代,最终产生结构化答案。所有问题均通过确定性生成脚本创建,确保可复现性。
特点
EMRB数据集的核心特色在于其多层级架构与真实信号处理挑战的紧密结合。五个层级(L1至L5)逐步递进,从基础测量到系统设计,全面覆盖信号检测、处理、通信理论、多信号分析及系统设计等维度。数据集包含920个子问题,问题类型多样且层级间无重叠,有效检验模型的综合能力。尤为突出的是,评分系统完全确定性,无LLM裁判参与,通过实体绑定匹配、数量特定容差及先决条件门控评分等机制,确保评估的客观公正。此外,数据集内置ReconPilot三阶段流水线,通过固定侦察、自由分析及确定性验证,可显著提升模型性能,为基准测试提供了更强的挑战与指导。
使用方法
使用EMRB数据集进行模型评估十分便捷。用户可通过GitHub克隆代码库并安装依赖,配置API密钥后,即可运行评估脚本。评估命令支持按层级(--level)、按问题ID(--id)或全量(--all)运行,并可设置并行工作者数(--workers)及最大迭代轮次(--max-turns)。为复现结果,数据集提供确定性生成脚本,可按需重新生成各层级数据。用户还可通过--pipeline标志启用ReconPilot流水线,提升模型表现。评分工具支持重新评分(--score-only)及跳过已有结果(--skip-existing),便于增量评估。详细的CLI标志和配置指南确保用户能快速上手,将自选模型接入评估框架,进行公平比较与深入研究。
背景与挑战
背景概述
电磁信号解析在通信、雷达及频谱管理等关键领域具有核心地位,然而现有基准多依赖预处理特征或结构化表格,难以反映真实场景下模型对原始信号的理解能力。为此,Mingxu Zhang等研究人员于近年构建了EMRB基准,旨在评估大语言模型对原始电磁I/Q数据的多层级推理能力。该基准包含200个问题、920个子问题,覆盖11种信号类型与27种问题类型,并按难度分为五个层级,从基础测量延伸至系统设计。通过对15种主流LLM的评测,得分区间为24.1%至78.8%,揭示了模型在该任务上的显著性能差异。EMRB的提出填补了原始信号推理评估的空白,为推动LLM在物理信号处理领域的研究提供了重要支撑。
当前挑战
EMRB基准面临多重挑战。在领域层面,模型需从原始I/Q数据中自主发现信号结构,这要求其具备卓越的代码生成与数值分析能力,而当前LLM在不同难度层级上的表现波动极大,如L1平均得分84.9%而L5仅21.2%,凸显系统设计级推理的薄弱。在构建层面,确保问题生成的可重复性与验证的确定性是一大难点,为此设计了基于实体匹配、容差范围及前置条件门控的评分机制,但如何平衡问题多样性与评分严谨性仍需持续探索。此外,构建一个涵盖多信号场景(L4)及复杂系统设计(L5)的高质量问题集,需精细的参数控制与领域知识整合,这构成了数据集制作的主要技术挑战。
常用场景
经典使用场景
EMRB数据集构建了一个多层级、多维度的基准测试框架,旨在全面评估大语言模型在原始电磁信号上的推理能力。其核心使用场景是要求模型直接处理未经预处理的I/Q采样数据,通过自主编写并执行Python代码来发现信号参数、解析调制方式、计算通信指标,进而回答涵盖从基础测量到系统设计等五个难度层级的问题。该基准涵盖了200个问题、920个子问题,涉及11种信号类型和27种问题类型,为研究人员提供了一个严谨且标准化的评估平台,用以度量模型在信号处理、通信理论及系统级设计等方面的综合表现。
实际应用
在实际应用中,EMRB所评测的推理能力可迁移至诸多无线电与通信工程领域,如频谱监测、信号侦察、干扰识别及认知无线电系统设计。模型若能在此基准上表现优异,则有望被部署于自动化频谱管理平台,辅助工程师快速分析未知信号、优化通信参数或进行系统兼容性评估。此外,其强调的代码驱动分析模式也契合软件定义无线电的发展趋势,为构建智能化的信号分析与决策支持工具提供了理论验证基础,进而促进电磁频谱资源的有效利用与安全维护。
衍生相关工作
EMRB的发布催生了若干衍生研究方向,其中最显著的是提出了ReconPilot——一种三阶段处理流水线,通过先进行信号侦察生成未解析频谱区域图,再引导模型进行针对性分析,并辅以确定性自验证,有效提升了多个模型在基准上的得分。这一方法论启发了后续研究将结构化侦察与自由形式推理相结合,以提高智能体在复杂物理信号环境中的任务效率。此外,该数据集亦促进了跨学科合作,例如将视觉-语言模型与信号处理结合,探索多模态理解在电磁数据分析中的潜力,进一步拓展了大语言模型在科学发现与工程应用中的边界。
以上内容由遇见数据集搜集并总结生成



