arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-19 至 2026-06-19 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 12 篇

2510.06846 2026-06-19 eess.SY cs.SY 版本更新 78%

Decentralized CBF-based Safety Filters for Collision Avoidance of Cooperative Missile Systems with Input Constraints

基于CBF的去中心化安全滤波器:面向输入受限的协同导弹系统碰撞避免

Johannes Autenrieb, Mark Spiller

专题命中 安全训练 :safety(title,abstract)

AI总结 针对多飞行器拦截场景,提出基于鲁棒控制屏障函数的去中心化安全滤波器,通过事件触发和松弛变量优化实现碰撞避免,兼顾计算效率与可扩展性。

Comments 7 pages, 5 figures, accepted for presentation at the 2026 American Control Conference (ACC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21546 2026-06-19 eess.SY cs.SY 版本更新 78%

Auction-Based Responsibility Allocation for Scalable Decentralized Safety Filters in Cooperative Multi-Agent Collision Avoidance

基于拍卖的责任分配用于可扩展的去中心化安全滤波器在多智能体协同避碰中

Johannes Autenrieb, Mark Spiller

专题命中 安全训练 :safety(title,abstract)

AI总结 提出基于高阶控制屏障函数和拍卖责任分配的可扩展去中心化安全滤波器,通过非对称分配约束减少计算负荷,实现多智能体协同避碰。

Comments 6 pages, 3 figures, accepted for presentation at the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19831 2026-06-19 cs.CL cs.LG 新提交 62%

Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models

杠杆不等于可达性:语言模型中单神经元操控的控制窗口定律

Hongliang Liu

机构 * Palo Alto Networks

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出预算归一化控制窗口框架,通过残差范数与写入范数之比定义的相干预算,预测单神经元干预何时产生连贯行为控制,并在15个神经元上验证了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19632 2026-06-19 cs.RO cs.AI cs.LG cs.LO cs.MA 新提交 62%

Formal Verification of Learned Multi-Agent Communication Policies via Decision Tree Distillation

通过决策树蒸馏对学习到的多智能体通信策略进行形式化验证

Ahmad Farooq, Kamran Iqbal

机构 * University of Arkansas at Little Rock(阿肯色大学小石城分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出通过决策树蒸馏将多智能体强化学习策略转化为可解释模型,并利用PRISM进行形式化验证,确保安全属性转移至原始网络,在无人机编队任务中实现88.9%属性满足率。

Comments 9 pages, 3 figures, 7 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026), Pittsburgh, Pennsylvania, USA, September 27-October 1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22748 2026-06-19 cs.RO cs.AI cs.LG cs.MA 版本更新 62%

Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning

通过多智能体强化学习实现超人类安全且敏捷的赛车

Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组) Google DeepMind(谷歌DeepMind) Nomagic

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过多智能体强化学习在高速四旋翼赛车中实现安全且敏捷的性能,展示了多智能体交互对真实世界交互安全性的关键作用,同时在高速赛车中超越人类飞行员并减少碰撞率。

Comments 12 pages (+4 supplementary). Website: https://rpg.ifi.uzh.ch/marl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06866 2026-06-19 cs.LG cs.AI econ.EM stat.AP stat.ML 版本更新 62%

Global Ease of Living Index: a machine learning framework for longitudinal analysis of major economies

全球生活便利指数:面向主要经济体纵向分析的机器学习框架

Arun Kumar Selvaraj, Tanay Panat, Rohitash Chandra

机构 * Transitional Artificial Intelligence Research Group, School of Mathematics and Statistics(过渡人工智能研究组,数学与统计学学院) Centre for Artificial Intelligence and Innovation(人工智能与创新中心) Pingla Institute(Pingla研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出全球生活便利指数,结合社会经济和基础设施因素,利用机器学习处理缺失数据,并通过主成分分析和因子分析降维,为政策制定者提供改善生活质量的可操作工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19914 2026-06-19 cs.RO cs.AI 新提交 57%

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

Co-policy: 响应式人机音乐共创框架

Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Automation, Wuhan University of Technology(武汉理工大学自动化学院) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出Co-policy框架,通过语义锚定、约束变分和视觉运动策略实现人机音乐实时共创,在真实钟琴实验中优于扩散策略基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19542 2026-06-19 cs.LG 新提交 57%

Tracking Representation Dynamics in Large Language Models with Persistent Homology

利用持续同调追踪大型语言模型中的表示动态

Naman Malhotra, Jay Ambadkar, Abhinav Gupta, Kushal Kasivel, Abbas Schwarz, Kamillo Ferry, Anthea Monod

机构 * Imperial College London(伦敦帝国学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16326 2026-06-19 cs.GT cs.AI q-fin.RM 新提交 57%

Gaming-Resistant Insurance Contracts for Autonomous AI Agents: Strategy-Proof Toll Mechanism Design

自主AI代理的抗博弈保险合约:策略证明的通行费机制设计

Hao-Hsuan Chen

机构 * Hao-Hsuan Chen(何浩轩)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。

Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17015 2026-06-19 cs.AI cs.MA cs.RO 版本更新 57%

UniMM: A Unified Mixture Model Framework for Multi-Agent Simulation

UniMM:一种用于多智能体仿真的统一混合模型框架

Longzhong Lin, Xuewu Lin, Kechun Xu, Haojian Lu, Lichao Huang, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出UniMM框架统一回归混合模型与离散NTP模型,通过闭环样本生成缓解分布偏移,并在WOSAC基准上取得最优性能。

Comments Accepted author manuscript. The version of record has been published in IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 50%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 安全训练 :safety(abstract)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 50%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏