Addressing Over-Refusal in LLMs with Competing Rewards
用竞争奖励解决大语言模型中的过度拒绝问题
机构 * Carnegie Mellon University(卡内基梅隆大学) ; SynthLabs
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
用竞争奖励解决大语言模型中的过度拒绝问题
机构 * Carnegie Mellon University(卡内基梅隆大学) ; SynthLabs
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。
基于知识接地LLM代理的自主容错控制教程
机构 * Autonomous Industrial Systems Laboratory, Imperial College London(帝国理工学院自主工业系统实验室) ; Institute of Automation Technology, Helmut Schmidt University(赫尔穆特·施密特大学自动化技术研究所)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出利用LLM代理作为约束监督规划器,通过外部验证器确保安全,辅助过程工厂故障恢复决策,并提供了可执行的Python环境。
当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复
机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) ; Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。
Comments Accepted at SIGDIAL 2026
不可信AI代理的认证推测执行
机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) ; College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。
Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)
从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话
机构 * Brandeis University(布兰迪斯大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 将摩擦策略优化从共享感知场景扩展到感知不对称场景,通过跨语料库分析和LLM探测验证,发现摩擦函数仅在参与者信息视野内有效,并提出标注改进。
Comments 11 pages. To appear in Proceedings of SIGDIAL 2026
基于先进调节控制理论的多智能体AI系统化方法:用于过程控制的安全且可审计的LLM操作员智能体
机构 * Norwegian University of Science and Technology (NTNU)(挪威科技大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出将先进调节控制理论映射为多智能体系统,每个反馈回路对应一个专业LLM操作员智能体,通过确定性或LLM编排器解决约束冲突,在奶牛场通风案例中实现可审计轨迹。
智能体原生免疫系统:架构、分类与工程
机构 * Novo Ordo for AI
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。
它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用
机构 * Fudan University(复旦大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。
Comments work in progress
SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力
机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。
安全自回归图像生成与迭代自改进码本
机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) ; Torr Vision Group, University of Oxford(牛津大学Torr视觉组)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。
Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)
上下文模型预测生成:从语言模型到物理的开放词汇运动合成
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) ; School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。
通过约束流形控制实现安全且可泛化的分层多智能体强化学习
机构 * University of California, Berkeley(加州大学伯克利分校) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出分层多智能体强化学习框架,低层通过约束流形强制执行硬安全约束,高层学习协调策略,实现理论安全保证、稳定训练和高效泛化。
Comments 10 pages
AOHP:一个用于个性化、高效和安全交互的开源操作系统级Agent框架
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出AOHP,一个基于AOSP的操作系统级Agent框架,通过将Agent视为一等OS参与者,实现个性化服务组合、高效Agent接口和安全信息流,在任务完成率、令牌成本和策略合规性上优于现有系统。
Comments 17 pages, 3 figures
Harness-MU:面向多用户LLM代理的安全、可控且有效的框架
机构 * OpenAI Codex team(OpenAI Codex团队)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对多用户LLM代理的权限冲突与数据泄露问题,提出模型无关、零微调的基础设施框架Harness-MU,通过执行钩子强制执行确定性治理约束,在Muses-Bench基准上实现隐私保护并提升指令遵循准确率高达48.9个百分点。
Comments 15 pages, 4 figures, 15 tables
安全检查,不安全使用:LLM代理压缩边界处的重链接
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。
微调视觉-语言-动作模型所需的层数比你想象的少
机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; VinRobotics ; University of Arkansas(阿肯色大学) ; Technical University of Denmark(丹麦技术大学) ; Hanoi University of Science and Technology(河内科技大学) ; KAIST(韩国科学技术院) ; Monash University(莫纳什大学) ; Oldenburg University(奥尔登堡大学) ; DFKI(德国人工智能研究中心) ; University of Stuttgart(斯图加特大学) ; IMPRS-IS(国际马克斯·普朗克智能系统研究学院) ; Stanford University(斯坦福大学) ; Technische Universität Darmstadt(达姆施塔特工业大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。
Co-policy: 响应式人机音乐共创框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; School of Automation, Wuhan University of Technology(武汉理工大学自动化学院) ; School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出Co-policy框架,通过语义锚定、约束变分和视觉运动策略实现人机音乐实时共创,在真实钟琴实验中优于扩散策略基线。
利用持续同调追踪大型语言模型中的表示动态
机构 * Imperial College London(伦敦帝国学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。
Comments 29 pages
自主AI代理的抗博弈保险合约:策略证明的通行费机制设计
机构 * Hao-Hsuan Chen(何浩轩)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。
Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)
从自身错误中学习:为自蒸馏构建可学习的微反思轨迹
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。
大语言模型生成器-调节器博弈的变分框架
机构 * Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA(电气工程系,工程学院,纽约大学,布鲁克林,纽约,美国)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出一个变分框架,将语言生成建模为熵正则化吉布斯分布,将调节建模为最优判别器,通过鞍点问题平衡效用、熵、调节一致性和有限长度可检测性,并通过审查过滤和钓鱼防御案例验证。
RadSEM:放射学报告中临床一致性的逐发现指标
机构 * JDH Algo, JD Health International Inc., China ; Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China ; Zhejiang Engineering Research Center for Hospital Emergency ; Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出RadSEM指标,通过约束LLM辅助将报告重写为原子发现句,进行矛盾感知的多对多匹配,并计算异常加权的F1分数,在SSREE测试中优于现有指标,实现高一致性评分。
空间视觉语言模型中的双路径推理强化
机构 * The University of Hong Kong(香港大学) ; NVIDIA(英伟达) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。
基于数字孪生模拟的治疗响应优化临床决策支持AI系统
机构 * The Cancer Genome Atlas (TCGA)(癌症基因组图谱(TCGA))
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出在线自适应框架,结合治疗效果估计、患者数字孪生和强化学习,在安全约束下实时优化治疗推荐,经合成和真实临床数据验证有效且稳定。
Comments Accepted for presentation at the IEEE Engineering in Medicine and Biology Conference (EMBC) 2026
GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; Renmin University of China(中国人民大学) ; Peking University(北京大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。
Comments 24 pages, 9 figures
你的轨迹位移在长尾场景中安全吗?
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Tsinghua University(清华大学) ; Tongji University(同济大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。
Comments 20 pages, 15 figures
SPARK: 基于安全知识引导与表示激活的LLM安全代码生成
机构 * Radboud University(拉德堡德大学) ; University of Bristol(布里斯托大学) ; University of Zagreb(扎格雷布大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。
面向帕累托最优工具集成智能体的帕累托排名策略优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。
Comments ICML 2026 Spotlight Paper
校准的分诊,而非自主:医学视觉-语言模型的置信度估计
机构 * Michigan State University(密歇根州立大学)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL
AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。
基于AI的自适应水网管理框架及概念验证实施:解决约旦无收益水问题
机构 * Jordan(约旦)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出集成EPANET水力建模、数字孪生、SCADA和LLM智能体的框架,通过实时数据与物理模拟结合实现异常检测与自适应决策,概念验证在约旦1164节点管网中实现2分钟内自动生成健康报告,爆管检测定位准确。
Journal ref 2026 2nd International Conference on Computational Intelligence Approaches and Applications (ICCIAA)