遇见数据集

anomaly_detection_cmsl1t

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集名为“大型强子对撞机新物理的触发异常检测”,源自欧洲核子研究中心(CERN)大型强子对撞机(LHC)的CMS实验,专为在触发层面进行无监督异常检测研究而设计,旨在发现新物理。数据集包含2025年质子-质子对撞中记录的零偏置事件作为正常数据(共20,887,636个事件),以及20个模拟信号数据集(涵盖Higgs、多Higgs、超对称性和奇异场景,共13,012,931个事件)和一个模拟零偏置背景样本(SingleNeutrino,2,000,000个事件)。所有数据以Parquet格式存储,预划分为训练集、验证集和测试集:零偏置数据按60/20/20划分,模拟样本按60/40划分(验证和测试)。每个事件提供Level-1触发对象(μ子、喷注、电子-γ、τ子)的特征、能量总和(ET、HT、MET、MHT、FET、FHT)以及事件信息(run、lumi、event、bx、orbit、time、nPV_True)。所有特征值以触发硬件整数格式表示,并给出了转换为GeV、弧度和伪快度的单位系数。此外,还提供了触发算法判决结果(-seeds配置),包含每个触发算法的布尔列,用于与其他算法比较。数据集标签:0为零偏置,负数为模拟背景,正数为信号。该数据集适用于表格回归和表格分类任务,特别用于开发无监督异常检测算法。注意事项包括:触发器中对象的读取顺序(量热器对象按ET降序,μ子不按此序);数据与模拟的触发菜单不同(零偏置数据有183个算法列,模拟有161个,共享147个);nPV_True字段在零偏置中为float32,在模拟中为int32;模拟样本中run=1,bx=429。

The dataset is named Trigger Anomaly Detection for New Physics at the Large Hadron Collider, derived from the CMS experiment at CERNs Large Hadron Collider (LHC), specifically designed for unsupervised anomaly detection at the trigger level to discover new physics. It contains zero-bias events recorded in 2025 proton-proton collisions as normal data (20,887,636 events), along with 20 simulated signal datasets (covering Higgs, multi-Higgs, supersymmetry, and exotic scenarios, totaling 13,012,931 events) and one simulated zero-bias background sample (SingleNeutrino, 2,000,000 events). All data are stored in Parquet format, pre-split into training, validation, and test sets: zero-bias data split 60/20/20, simulated samples split 60/40 (validation and test). Each event provides Level-1 trigger object features (muons, jets, e-gamma, taus), energy sums (ET, HT, MET, MHT, FET, FHT), and event information (run, lumi, event, bx, orbit, time, nPV_True). All feature values are represented in trigger hardware integer format, with unit conversion factors to GeV, radians, and pseudorapidity provided. Additionally, trigger algorithm decisions (-seeds configuration) are provided as boolean columns for each trigger algorithm, enabling comparison with other algorithms. Dataset labels: 0 for zero-bias, negative for simulated background, positive for signal. This dataset is suitable for tabular regression and tabular classification tasks, particularly for developing unsupervised anomaly detection algorithms. Notes include: read order of trigger objects (calorimeter objects in descending ET order, muons not in this order); different trigger menus between data and simulation (zero-bias has 183 algorithm columns, simulation has 161, with 147 shared); nPV_True field is float32 in zero-bias and int32 in simulation; in simulation samples, run=1, bx=429.

创建时间:
2026-08-11
原始信息汇总

数据集概述

数据集名称: Trigger Anomaly Detection for New Physics at the Large Hadron Collider

数据集地址: https://huggingface.co/datasets/podagiu/anomaly_detection_cmsl1t

许可证: CC0-1.0

语言: 英文

任务类型: 表格回归、表格分类

数据集大小: 10M < n < 100M

标签: 物理学、粒子物理学、异常检测、CMS、一级触发

数据集内容

该数据集包含来自欧洲核子研究中心大型强子对撞机CMS实验的一级触发(Level-1 Trigger)对象,用于研究触发系统中的无监督异常检测,目标是发现新物理。数据集中不包含新物理,仅用于异常检测器的研究。

数据集提供三类数据:

  • 正常数据: 2025年质子-质子运行期间记录的零偏差事件(run 396102、398183),从CMS探测器内发生的所有质子-质子碰撞中随机选取。
  • 异常模拟: 20个模拟信号数据集,涵盖希格斯、多希格斯、超对称和奇异场景,来自CMS Run 3 Winter25活动。
  • 正常数据模拟: 一个模拟零偏差背景样本(SingleNeutrino)。

数据规模

  • 正常数据:20,887,636个事件
  • 正常数据模拟:2,000,000个事件
  • 20个异常模拟:共计13,012,931个事件

数据已预划分为训练、验证和测试集:零偏差数据按60/20/20划分,模拟样本按60/40在验证和测试之间划分。

配置列表

数据集包含多个配置,每个配置对应一个独立的数据集(如GluGluHTo2B_Par-MH-125ZB_run396102WtoTauto3Mu等),每个配置都有对应的-seeds版本,包含其他触发算法对相同事件的决策结果。每个配置通常包含testvalidation分割,零偏差数据配置另有train分割。

数据列结构

  • 集合特征:<集合名>_<分支名>格式,如muons_muonIEt,集合包括muonsjetsegammastaus及能量总汇ETHTMETMHTFETFHT
  • 事件信息:无前缀的runlumieventbxorbittimenPV_True
  • 分区与顺序:split(发布分区)、order(分区内位置)。
  • 触发结果:L1bit(触发菜单是否接受事件)。
  • 数据来源:dataset(行所属的数据集)。
  • 标签:label(0为零偏差,负数为模拟背景,正数为信号)。

集合列是列表类型(每个事件的一个对象一个条目),其他列是普通标量值。

单位说明

各对象特征值为触发硬件整数格式,需乘以换算系数得到物理单位(GeV、弧度、伪快度)。例如,缪子Et的系数为0.5 GeV,缪子eta系数为0.010875,phi系数为0.0109083 rad;喷注、e-gamma、tau的eta系数为0.0435,phi系数为0.0436332 rad。注意muons_muonIEtUnconstrained系数为1 GeV/单位,jets_jetRawEt无文档化标度。

使用注意事项

  1. 对象排序: 对象按触发读出顺序排列,量热器对象按ET降序,缪子不按此排序。提供的加载器会在处理前按ET排序。
  2. 菜单差异: 零偏差数据有183个算法列,模拟数据有161个,其中147个是共享的。
  3. 类型差异: nPV_True在零偏差数据中为float32,在模拟数据中为int32。
  4. 坐标缺失: 模拟数据不含束流坐标,所有模拟样本run为1,bx为429。
  5. 数据加载: 可使用load_dataset直接加载原始数据,也可使用提供的加载器(需Python 3.10+及若干依赖库)。
搜集汇总
数据集介绍
anomaly_detection_cmsl1t 数据集图片
构建方式
该数据集源自CMS实验在大型强子对撞机上的Level-1触发系统,旨在为无监督异常检测研究提供真实且高统计量的数据基础。其构建过程融合了真实数据与模拟数据:正常数据为2025年质子-质子对撞期间记录的零偏事件,共计约2088万例,未经过任何选择偏向,代表了标准模型背景;异常信号模拟则涵盖希格斯、多希格斯、超对称及奇异物理场景,包含20个数据集,总事件数约1301万;此外,还包含一个用于模拟零偏背景的单一中微子样本。所有数据均以Parquet格式存储,预先划分为训练、验证和测试集,其中真实数据按60/20/20比例划分,模拟样本按60/40比例划分至验证和测试集。每个事件保留触发系统原始硬件整数格式的特征值,包括缪子、喷注、电磁簇射、τ子及能量和等对象的运动学信息,并附加运行号、亮度区、事件编号等元数据。
使用方法
该数据集可通过HuggingFace的datasets库便捷加载,每个物理过程对应一个配置,并附带-seeds版本提供触发算法输出。研究者可直接使用load_dataset函数获取原始数据,或利用仓库内置的dataloader进行预处理,该加载器能执行切片、标准化并将对象集合堆叠成PyTorch张量,直接输入模型。数据预划分为训练、验证和测试集,其中真实零偏数据用于训练,模拟信号用于验证和测试。对于需要对比其他触发算法的研究,可使用-seeds配置中的算法决策列。此外,数据集的列结构清晰,支持灵活的过滤和连接操作,便于构建自定义的异常检测流程。
背景与挑战
背景概述
在大型强子对撞机(LHC)的高能物理探索中,CMS实验的第一级触发系统承担着在极短时间内筛选海量质子-质子碰撞事件的关键使命。传统触发算法基于物理假设设计,可能对新物理信号产生系统性偏差。为此,该数据集于2025年由CMS合作组创建,旨在推动基于无监督异常检测的新物理搜索研究。核心研究问题在于:如何在缺乏真实异常样本的情况下,利用数据驱动的算法识别超越标准模型的新物理特征。数据集包含超过2000万个零偏事件作为正常数据,以及20个模拟异常信号数据集,覆盖希格斯物理、超对称理论等前沿领域。其发布为触发层异常检测算法提供了标准化的基准,对相关领域的研究产生了重要影响,促进了融合机器学习与高能物理数据采集系统的发展。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两个层面。在领域问题层面,新物理搜索的异常检测与工业应用不同,难以获取或模拟真实异常,需依赖模拟信号,但模拟数据与真实数据之间可能存在分布差异,影响算法泛化能力。同时,触发层数据具有硬件整数格式、非均匀对象集合以及高维稀疏特征,而传统监督学习方法难以有效利用这类数据,无监督异常检测则需解决高维空间中的异常定义与检测灵敏度问题。在构建过程层面,需确保正常数据(零偏事件)的真实代表性与统计量,并协调模拟数据与真实数据在触发算法菜单、数据格式(如nPV_True类型不一致)及特征单位上的差异,同时数据划分需兼顾训练、验证与测试的独立性,以支持可靠算法评估。
常用场景
经典使用场景
该数据集源自CMS实验在大型强子对撞机上的Level-1触发系统,专为无监督异常检测研究而构建。其经典使用场景聚焦于开发与评估异常检测算法,以在触发层面识别超越标准模型的新物理信号。数据集提供了大量零偏置事件作为正常背景,同时包含多种模拟的新物理信号(如希格斯玻色子产生、超对称粒子衰变等),以及相应的触发算法决策信息,使得研究者能够在此框架下训练和验证异常检测模型,探索在强子对撞机环境中发现未知物理现象的新途径。
解决学术问题
在粒子物理领域,新物理的探寻往往受限于标准模型背景的复杂性和未知信号的稀缺性。该数据集解决了传统异常检测研究中最关键的难题——缺乏真实异常样本的问题,其独到之处在于同时提供了高统计量的正常数据与多种理论信号的模拟,使得研究者能够开发基于无监督学习的异常检测器,以在触发阶段捕捉可能因能量或拓扑特征而未被标准触发算法捕获的新物理事件。这不仅推动了异常检测算法在高能物理中的应用,也为触发系统的智能化升级提供了重要的研究基础,对提升探索新物理的灵敏度具有深远意义。
实际应用
在实际应用中,该数据集主要用于训练和测试部署于CMS Level-1触发系统的实时异常检测模型。鉴于触发系统需在微秒级处理海量事件,数据集所模拟的硬件整数格式特征和算法决策记录,为开发高效、低延迟的机器学习模型提供了真实基准。研究者可借此评估各种异常检测架构(如自编码器、变分自编码器、深度学习集成等)在区分潜在新物理信号与标准模型背景时的性能,从而筛选出可实际集成到触发硬件中的算法,增强实验对未知现象的捕捉能力,为未来高亮度LHC运行期间的数据采集策略提供关键参考。
数据集最近研究
最新研究方向
该数据集聚焦于大型强子对撞机CMS实验第一级触发系统中无监督异常检测的前沿探索,旨在挖掘超越标准模型的新物理信号。鉴于真实新物理事件的不可模拟性,数据集创新性地提供了零偏置数据作为正常样本,并涵盖希格斯、多希格斯、超对称及奇异物理等多类模拟异常信号,为开发新颖异常检测算法提供了基准测试平台。当前研究热点集中于利用无监督学习方法在触发层面实时识别潜在的未知物理过程,同时数据集内置了与其他触发算法的比较配置(-seeds),促进了与现有算法性能的对比与分析。其海量事件数和硬件整数格式的特征数据,也推动了机器学习在实时数据处理与决策中的高效应用研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务