Robust Critics: Defending LLMs Against Multi-Turn Attacks
鲁棒评论家:防御大语言模型免受多轮攻击
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
鲁棒评论家:防御大语言模型免受多轮攻击
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。
基于控制障碍函数层的高维安全最优反馈控制的端到端学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究在硬安全约束下高维半全局反馈控制器的学习问题,结合算子分裂与无雅可比反向传播方法,实现可扩展端到端训练并保持安全保证,证明该方法在高维多智能体非线性控制问题上的有效性。
弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架
机构 * HIVE Robots(蜂巢机器人公司) ; Technical University of Denmark(丹麦技术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。
Comments 8 pages. This work has been submitted to the IEEE for possible publication
PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理
机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。
Comments 19 pages, 3 figures
作为微服务系统中风险约束干预决策的安全修复
机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) ; Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) ; School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。
OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对LLM-MAS中对手通过通信注入恶意指令的双重动态攻击,提出OpenEvoShield持续防御框架,含不对称速率控制器等组件,实验表明其在多基准和拓扑上优于基线,能检测多数未见攻击且误报率低。
Comments 29 pages, 5 figures, 14 tables
用于弹性关键基础设施的去中心化多智能体强化学习
机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) ; School of Energy Systems, LUT University(卢特大学能源系统学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究用于弹性关键基础设施的去中心化多智能体强化学习,基于对其特性与基础设施要求的分析,指出信用分配和通信是实际可行的核心条件,提出包含结构、因果、弹性感知信用分配及相关通信等的研究议程,为弹性关键基础设施构建有条件的基础。
Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)
Fence:用于大语言模型应用的专用小型语言模型护栏
机构 * JPMorgan(摩根大通)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。
动态限制人工智能性能的硬件机制
机构 * Princeton University(普林斯顿大学) ; Princeton University Electrical(普林斯顿大学电子与计算机工程)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究在人工智能模型集成到关键系统时缺乏意图控制的问题,提出用微架构旋钮动态控制硬件资源限制AI性能,评估候选旋钮并构建机制,展示其高性能敏感度等优势及多旋钮组合效果。
一种用于大语言模型护栏的双假设推理框架
机构 * University of Arizona(亚利桑那大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。
指定委托自治边界:智能体人工智能的需求工程
机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) ; University of Duisburg-Essen(杜伊斯堡-埃森大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。
以少胜多:一种简单方法构建的大规模遥感视觉语言模型
机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息与自动化研究所)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究针对遥感视觉语言模型,质疑架构专业化必要性,提出通用模型经大规模跨数据和任务训练可获好性能。核心方法是用单一语言策略及多任务强化学习框架训练。主要贡献是在多基准测试中取得竞争力结果,证明数据规模更关键。
EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师
专题命中 安全训练 :alignment(abstract);分类 cs.CY
AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。
AnovaX:一个具有大语言模型规划、类型化执行器和自适应恢复功能的本地多智能体语音助手
机构 * BITS Pilani(贝拉理工学院皮拉尼分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究桌面语音助手局限,提出AnovaX本地多智能体语音助手,通过Python进程连接多组件,含规划器、安全层等,各工具对应专用智能体类,有递归元智能体及自适应恢复循环,还介绍配套服务器功能,展示其独特优势。
地震人工智能:一种基于评分标准评估的小学地震教育检索增强生成框架
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对小学生地震教育问题,提出地震人工智能混合教育框架,集成检索增强生成对话式AI助手,结合乐高机器人、评分标准和AI,通过不同年级的渐进学习提升学生地震应对能力,实验显示有高可信度和准确性。
Comments 17 pages, 4 figures
安全强化学习中高效探索的方向约束
机构 * Dipartimento di Automatica e Informatica, Politecnico di Torino(自动控制与信息工程系,都灵理工大学) ; Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems(同济大学,上海智能自主系统研究院) ; German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) ; Intelligent Autonomous Systems Group, TU Darmstadt(智能自主系统组,达姆施塔特工业大学) ; Lund University(隆德大学) ; Istituto Italiano di Tecnologia(意大利技术研究院)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 针对安全强化学习中约束学习降低速度和性能的问题,提出扩展ATACOM框架的ATACOM-DC方法,通过引入方向约束区分动作,改善安全与性能权衡,在模拟机器人控制任务中评估,分析约束违反成本和任务性能。
Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026. 8 pages, 8 figures
非平稳性下的上下文强化学习:一项综述
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。
用于安全开放式探索的异构智能体群组及运行时约束记忆
机构 * Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对语言模型智能体安全与探索困境,提出将关注点分离到专门角色,通过蒙特卡洛树搜索编译失败为‘伤疤’约束补丁,在空间语义沙盒实验中,该方法能到达远程目标、防止违规、减少令牌消耗,还能在资源约束下降低成本。
Comments 12 pages, 1 figure, 12 tables
EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。
Comments 10 pages, 2 figures
存在但重新缩放:加法激活引导的聊天到智能体的转移
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。
Comments 12 pages, 3 figures, 4 tables
基于合约的组合屏蔽实现安全多智能体强化学习
机构 * Imperial College London(伦敦帝国学院) ; University of Manchester(曼彻斯特大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出一种去中心化屏蔽方法,通过合约机制协调智能体局部LTL安全义务,在无集中运行时控制下保证全局安全并优化团队奖励。
Comments Accepted to EUMAS 2026, the 23rd European Conference on Multi-Agent Systems
提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) ; Ant International, Ant Group(蚂蚁集团蚂蚁国际) ; Shanghai Innovation Institute(上海创新研究院) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。
Comments 42 pages, 19 figures, 16 tables
智能体数据环境
机构 * Columbia University(哥伦比亚大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。
Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026
利用模型预测控制思想的安全强化学习
机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) ; Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。
Comments Accepted at Eurocast 2026
超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。
aiAuthZ:人工智能代理的远程、身份绑定授权
机构 * SportsVision AI
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究人工智能代理授权问题,提出aiAuthZ授权网关,通过消息签名验证身份、评估策略,加入审计日志并生成认证收据,有效降低攻击成功率,保障代理调用安全,减少决策延迟。
Comments Technical Report
弹性组:与操作系统进程协同调度的硬屏障大语言模型推理组的逐令牌成员变更
机构 * Independent Researcher(独立研究员)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究设备上大语言模型解码中CPU - SIMD计算与操作系统对核心资源需求冲突问题,提出弹性组机制,通过ACK锁定期协议实现逐令牌核心成员变更,提升吞吐量并保障正确性。
Comments 14 pages, 1 figure, 6 tables
Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理
机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) ; Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。
Comments 20 pages 7 figures
Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理
机构 * Stanford University(斯坦福大学) ; QuadriumAI
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。
Comments 41 pages, 25 tables, 6 figures
探索智能体数据系统中的语义鸿沟:分析工作流中操作化失败的形成性研究
机构 * Megagon Labs(Megagon实验室)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究通过跨领域分析236个分析意图,识别出153种反复出现的操作化失败,归纳为五类语义鸿沟,揭示用户分析概念与系统可用信息之间的差距,并提出未来智能体数据系统需要更丰富的语义表示。