⏶5
学习触发:大型强子对撞机中的强化学习
发表
由
Zixin Ding 提交
作者:
Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen
摘要
AI 生成总结
强化学习智能体通过将组过滤策略优化适应流式控制,优化粒子对撞机中的实时触发阈值,从而在模拟和真实碰撞数据上都提高了信号效率和背景率管理。大型强子对撞机等高通量科学设施依赖于在带宽、延迟和存储的严格约束下进行实时事件过滤(触发)。在实践中,触发菜单大多是静态且手动调优的,并且随着探测器条件、堆积和背景组成的随时间漂移而变得次优。我们将在线阈值调优视为一个序贯决策问题:一个强化学习智能体摄取最近速率和信号敏感特征的流式摘要,并更新触发阈值以最大化信号效率,同时将目标背景速率跟踪在容差带内。我们将群组过滤策略优化(GFPO)应用于流式控制,并引入两种变体(GFPO-F、GFPO-FR),它们在训练期间强制背景速率可行性。在一个模拟真实对撞机操作的基准上,我们研究了两种代表性触发器:一种对堆积变化敏感的总横向能量(H_T)触发器,以及一种基于重构损失的用于稀有或非标准特征的异常检测(AD)触发器。在蒙特卡洛流上,我们的智能体将容差内时间间隔的比例提高了48%(H_T)和28%(AD),在这些容差内间隔上的信号效率累积增益高达2%。从模拟转移到真实碰撞数据(CMS Run 283408),同一个智能体在不进行微调的情况下,相对于基线实现了56%(H_T)和28%(AD)的容差内改进,并且两种触发器都获得了进一步的信号效率增益。据我们所知,这是首次在真实大型强子对撞机碰撞数据上演示基于RL的触发控制。代码可在https://github.com/Zixind/GFPO_LHC获取(详情请参阅存储库)。
学习触发:大型强子对撞机中的强化学习
LHC触发菜单大多是静态和手动调整的,因此随着探测器条件、堆积和背景成分的变化,它们会逐渐失调。我们将在线阈值调整重构为序贯决策:一个RL智能体读取流速率和信号敏感特征,并更新触发阈值以最大化信号效率,同时将背景速率保持在容差范围内。
我们将群过滤策略优化(GFPO)应用于流式控制,并添加了两种变体,GFPO-F和GFPO-FR,它们在训练期间强制执行背景速率可行性,并修复了GRPO在严格速率约束下的零可行性故障。在没有微调的情况下,从模拟转移到真实的CMS Run 283408碰撞数据,同一个智能体将容差时间比基线提高了56%(H_T)和28%(AD),并且在两个触发器上都取得了进一步的信号效率增益。
据我们所知,这是首次在真实LHC碰撞数据上演示基于RL的触发控制。代码: https://github.com/Zixind/GFPO_LHC