arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2608.07148 2026-08-10 cs.AI 新提交 57%

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构

Fouad Bahrpeyma, Dirk Reichelt

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05732 2026-08-07 cs.LG 新提交 57%

CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

CircuitSteer:基于稀疏自编码器回路的几何对齐多层引导方法

Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

机构 * University of Southern California(南加利福尼亚大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 CircuitSteer是利用SAEs识别多层语义回路的新型框架,通过几何对齐合成引导向量实现多点干预,在多任务多模型上,其引导效果优于牺牲流畅性或覆盖不足的对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05588 2026-08-07 cs.RO cs.AI cs.MA 新提交 57%

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations

用于带旋转的鲁棒终身多智能体路径规划的搜索辅助联合智能体-环境强化学习

He Jiang, Jingtian Yan, Yulun Zhang, Yimin Tang, Tanishq Duhan, Rishi Veerapaneni, Guillaume Sartoretti, Jiaoyang Li

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对带旋转约束的鲁棒终身多智能体路径规划难题,提出搜索辅助联合强化学习方法,通过结合Causal PIBT与联合优化智能体-环境策略,在高密度地图及混合现实仓库环境中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05438 2026-08-07 cs.CY 新提交 57%

A Vision for the Future of an AI-Integrated Research Ecosystem

人工智能整合型研究生态系统的未来愿景

Ryan E. Dougherty, Natalie Kiesler

专题命中 安全训练 :trustworthy(abstract);分类 cs.CY

AI总结 本文探讨生成式AI渗透研究生涯后科学交流的演变,提出从管控AI转向构建溯源、校准与问责基础设施的愿景,并邀请学界参与相关对话。

Comments 4 pages, accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 57%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 57%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04065 2026-08-06 cs.CR cs.AI 新提交 57%

An Inline Control Architecture for Language Models in Intelligent Transportation Systems

智能交通系统中语言模型的内联控制架构

Narendra Kumar Dewangan, Mounira Msahli

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对V2X系统中LLM的提示级攻击问题,提出Guarded-V2X内联语义护栏架构,经四阶段实验验证其可降低入侵成功率且不超延迟预算。

Comments 18 pages, under minor revision (IEEE transactions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03838 2026-08-05 cs.AI 新提交 57%

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法

Zhinan Liu, Jie Li, Mingyu Kang, Jiayi Ji

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02595 2026-08-04 cs.LG 新提交 57%

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

onepot-Bench 0:面向实验室实际场景的计算机化学基准测试

Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02446 2026-08-04 cs.IR cs.LG 新提交 57%

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

利用视觉语言模型推进Web规模搜索的相关性测量

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。

Comments RecSys'26 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 57%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 57%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28826 2026-08-03 cs.LG 新提交 57%

Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体

Konur Tholl, François Rivest, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Royal Military College of Canada(加拿大皇家军事学院) Defence Research and Development Canada(加拿大国防研究与发展部) Polytechnique Montreal(蒙特利尔理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 57%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28520 2026-07-31 cs.GT cs.AI cs.MA 新提交 57%

Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation

可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应

Boning Li, Longbo Huang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28187 2026-07-31 cs.AI cs.CR cs.SE 新提交 57%

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26200 2026-07-30 cs.CL 新提交 57%

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

机构 * Microsoft Responsible AI(微软负责任人工智能部门) Goodfire(古德法尔公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24893 2026-07-29 cs.CR cs.AI 新提交 57%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 57%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24672 2026-07-28 cs.LG 新提交 57%

Explainable Reinforcement Learning via Physics-Aware Policy Distillation

通过物理感知策略蒸馏实现可解释强化学习

Shaker Al-Tamari, Waled Kadour

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24057 2026-07-28 cs.LG 新提交 57%

Constrained Reinforcement Learning Using Successor Representations

使用后继表示的约束强化学习

Michael Girstl, Alexander Mattick, Christopher Mutschler

机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) University of Technology Nuremberg (UTN)(纽伦堡工业大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。

Comments published in Transactions for Machine Learning Research 2026

Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23336 2026-07-28 cs.CY 新提交 57%

Constitutional governance for societies of AI agents in the built environment: a research agenda

建筑环境中人工智能代理社会的宪法治理:一项研究议程

Ali Ghoroghi

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文针对建筑环境中人工智能代理社会的治理提出研究议程,围绕深度不确定性下改造的机制设计、建筑运营中代理的物理信息验证、冲击下城市基础设施的抗脆弱协调三个问题,借鉴多代理系统研究成果,阐述基础、识别问题并概述相关要求。

Comments 23 pages, 2 figures. Supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22611 2026-07-28 cs.AI cs.CR cs.ET cs.MA 新提交 57%

Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure

关键基础设施中智能体人工智能系统的去中心化粒度访问控制

Arun Malik, Deepal Jayasinghe, Bradley Klemick, Prachi Shah, Nitish Talasu, Vineet Tushar Trivedi

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。

Comments 7 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23617 2026-07-28 cs.LG math.OC 新提交 57%

Optimal Reward Shaping: Autonomous Car Parking Case Study

最优奖励塑造:自动驾驶汽车停车案例研究

Emre Özkaya, Nicolas R. Gauger

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。

Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 57%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 57%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20547 2026-07-24 cs.LG 新提交 57%

Conflict Resolution under Degraded Surveillance in Air Corridors Using Multi-Agent Reinforcement Learning

使用多智能体强化学习解决空中走廊降级监视下的冲突

Esrat Farhana Dulia, Syed Arbab Mohd Shihab, Caleb Adams, Ruben Del Rosario

机构 * College of Aeronautics and Engineering(航空与工程学院) Center for Advanced Air Mobility(先进空中交通中心)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对空中走廊降级监视下的冲突解决问题,开发基于深度Q网络的多智能体强化学习框架,为两类飞机训练策略,经模拟评估策略效果,揭示安全与走廊容量权衡,支持相关冲突解决策略评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20488 2026-07-24 cs.AI 新提交 57%

Autonomous Topology Mutation: Safe Runtime Restructuring for Multi-Agent LLM Systems with Capability, State, and Shadow Invariants

自主拓扑变异:具有能力、状态和影子不变量的多智能体大语言模型系统的安全运行时重组

Bronislav Sidik, Chaya Levi, Nizzan Kimhi

机构 * Toga Networks (Huawei)(托加网络(华为))

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统运行时无自我重组机制的问题,提出自主拓扑变异(ATM)机制,结合遥测驱动过载检测与安全不变量,经实验验证可提升任务成功率、减少隐私内存暴露并降低延迟,且相关内容已开源。

Comments 9 pages, 5 tables. Code and benchmark harness available at https://github.com/sidikbro/jiuwen_atm

详情

展开后加载摘要…

URL PDF HTML 收藏