Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents
安全检查,不安全使用:LLM代理压缩边界处的重链接
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
安全检查,不安全使用:LLM代理压缩边界处的重链接
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。
微调视觉-语言-动作模型所需的层数比你想象的少
机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; VinRobotics ; University of Arkansas(阿肯色大学) ; Technical University of Denmark(丹麦技术大学) ; Hanoi University of Science and Technology(河内科技大学) ; KAIST(韩国科学技术院) ; Monash University(莫纳什大学) ; Oldenburg University(奥尔登堡大学) ; DFKI(德国人工智能研究中心) ; University of Stuttgart(斯图加特大学) ; IMPRS-IS(国际马克斯·普朗克智能系统研究学院) ; Stanford University(斯坦福大学) ; Technische Universität Darmstadt(达姆施塔特工业大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。
Co-policy: 响应式人机音乐共创框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; School of Automation, Wuhan University of Technology(武汉理工大学自动化学院) ; School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出Co-policy框架,通过语义锚定、约束变分和视觉运动策略实现人机音乐实时共创,在真实钟琴实验中优于扩散策略基线。
利用持续同调追踪大型语言模型中的表示动态
机构 * Imperial College London(伦敦帝国学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。
Comments 29 pages
自主AI代理的抗博弈保险合约:策略证明的通行费机制设计
机构 * Hao-Hsuan Chen(何浩轩)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。
Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)
从自身错误中学习:为自蒸馏构建可学习的微反思轨迹
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。
大语言模型生成器-调节器博弈的变分框架
机构 * Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA(电气工程系,工程学院,纽约大学,布鲁克林,纽约,美国)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出一个变分框架,将语言生成建模为熵正则化吉布斯分布,将调节建模为最优判别器,通过鞍点问题平衡效用、熵、调节一致性和有限长度可检测性,并通过审查过滤和钓鱼防御案例验证。
RadSEM:放射学报告中临床一致性的逐发现指标
机构 * JDH Algo, JD Health International Inc., China ; Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China ; Zhejiang Engineering Research Center for Hospital Emergency ; Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出RadSEM指标,通过约束LLM辅助将报告重写为原子发现句,进行矛盾感知的多对多匹配,并计算异常加权的F1分数,在SSREE测试中优于现有指标,实现高一致性评分。
空间视觉语言模型中的双路径推理强化
机构 * The University of Hong Kong(香港大学) ; NVIDIA(英伟达) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。
基于数字孪生模拟的治疗响应优化临床决策支持AI系统
机构 * The Cancer Genome Atlas (TCGA)(癌症基因组图谱(TCGA))
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出在线自适应框架,结合治疗效果估计、患者数字孪生和强化学习,在安全约束下实时优化治疗推荐,经合成和真实临床数据验证有效且稳定。
Comments Accepted for presentation at the IEEE Engineering in Medicine and Biology Conference (EMBC) 2026
GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; Renmin University of China(中国人民大学) ; Peking University(北京大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。
Comments 24 pages, 9 figures
你的轨迹位移在长尾场景中安全吗?
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Tsinghua University(清华大学) ; Tongji University(同济大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。
Comments 20 pages, 15 figures
SPARK: 基于安全知识引导与表示激活的LLM安全代码生成
机构 * Radboud University(拉德堡德大学) ; University of Bristol(布里斯托大学) ; University of Zagreb(扎格雷布大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。
面向帕累托最优工具集成智能体的帕累托排名策略优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。
Comments ICML 2026 Spotlight Paper
校准的分诊,而非自主:医学视觉-语言模型的置信度估计
机构 * Michigan State University(密歇根州立大学)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL
AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。
基于AI的自适应水网管理框架及概念验证实施:解决约旦无收益水问题
机构 * Jordan(约旦)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出集成EPANET水力建模、数字孪生、SCADA和LLM智能体的框架,通过实时数据与物理模拟结合实现异常检测与自适应决策,概念验证在约旦1164节点管网中实现2分钟内自动生成健康报告,爆管检测定位准确。
Journal ref 2026 2nd International Conference on Computational Intelligence Approaches and Applications (ICCIAA)
MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别
机构 * Tiktok(字节跳动) ; National University of Singapore School of Computing(新加坡国立大学计算机学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。
LoMC: 路由基础模型中拒绝抑制的局部多方向校正
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。
CSPO: 面向安全强化学习的约束敏感策略优化
机构 * University of Luxembourg(卢森堡大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出约束敏感策略优化(CSPO),通过引入局部约束敏感性修正原目标,加速安全恢复并减少振荡,在导航与运动基准上取得更高约束回报。
Comments Accepted as a Spotlight paper at the 43rd International Conference on Machine Learning (ICML 2026)
信任但验证:通过事后对抗审计和多智能体反馈循环减轻医学幻觉
机构 * Data Science and Machine Learning Lab, SINES, NUST(NUST SINES数据科学与机器学习实验室) ; SINES, NUST(NUST SINES) ; CEME, NUST(NUST CEME)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本研究提出一种五智能体“信任但验证”系统,通过事后对抗审计和多智能体反馈循环,将大型语言模型在临床问题中推荐禁用药品的幻觉错误率降低约53%。
个体控制障碍函数引导的扩散模型用于安全离线多智能体强化学习
机构 * Department of Electrical Engineering and Automation, Aalto University(阿尔托大学电气工程与自动化系) ; School of Computing and Data Science, Xiamen University Malaysia(厦门大学马来西亚分校计算与数据科学学院) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出一种将神经个体控制障碍函数嵌入扩散模型的离线多智能体强化学习算法,通过逆动力学恢复控制策略,在保证奖励的同时显著提升轨迹生成的安全性。
Comments Accepted to the 23rd IFAC World Congress, 2026
学习对你的VLA说什么:基本无害的视觉语言动作模型引导
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 安全训练 :harmlessness(abstract);分类 cs.LG
AI总结 提出一个框架,通过交互式搜索语言序列改进闭环VLA任务性能,并学习一个改进头预测何时语言引导能提升性能,同时通过共形化防止有害干预。
Comments 22 pages, 14 tables, 14 figures
生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究
机构 * Qiyuan Tech(奇元科技)
专题命中 安全训练 :prompt injection(abstract);分类 cs.CL
AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。
HERO: 基于环境观察的后见增强反思的智能体自蒸馏
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Independent Researcher(独立研究员) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出HERO框架,利用环境观察作为局部对齐反馈进行自蒸馏,解决多轮设置中特权反馈与当前决策上下文不对齐导致的性能下降问题,在TauBench和WebShop上提升任务成功率并减少冗余轮次。
零空间约束的低秩自适应用于指定响应的大型语言模型遗忘
机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University(北京交通大学智能交通信息安全与隐私保护北京市重点实验室) ; College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院) ; Institute of Computing Technologies, China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司计算技术研究所)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出零空间约束响应指定遗忘框架,通过正交投影低秩参数化将LoRA更新限制在保留子空间的零空间内,在抑制遗忘知识的同时保持模型效用。
通过视觉反馈的自蒸馏策略优化:连接代码与视觉工件
机构 * Microsoft(微软)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出Visual-SDPO框架,利用渲染视觉反馈作为特权上下文,通过自蒸馏和视觉引导的代码信用加权优化代码生成视觉工件的质量,在图表、UI和幻灯片生成任务上显著提升性能。
面向工具增强型大语言模型的能力对齐分层学习
机构 * Jilin University(吉林大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出CAHL方法,利用RLVR联合优化高层规划器与低层执行器,解决分层工具学习中的规划-执行对齐问题,在多个基准上验证有效性。
Comments 14 pages, 5 figures, 6 tables. Preprint
环境能否为自己发声?$T^{2}$-GRPO:一种面向护理智能体的转向-轨迹组相对策略优化
机构 * University of California, Irvine(加州大学尔湾分校) ; Independent Researcher(独立研究员) ; Kennesaw State University(肯尼索州立大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出T²-GRPO框架,通过解耦护理强化学习为两个归一化奖励视界,并利用二元硬否决确保安全,从环境状态转换中提取密集转向级奖励,结合轨迹级评估,有效处理即时患者反馈、长期护理结果和安全约束。
通过自进化桥接专家知识与自动化特征工程
机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) ; IIIT-Delhi(德里印度理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。
将LLM推理蒸馏为可解释的策略树用于人机协作
机构 * Sun Yat-sen University(中山大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出Co-pi-tree方法,通过将大语言模型推理蒸馏为可执行策略树,在Overcooked-AI中平均奖励提升35.4%,同时减少77.7%的LLM查询和97.1%的测试延迟。