Agent Safety Should Be a Runtime Contract
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(title,title_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
注意间隙:在偏好学习中的结构感知一致性
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(数学科学学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.LG
AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。
Comments ICML 2026
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
从在线用户反馈中学习购物智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出LOFA框架,结合强化学习与反馈感知的策略内蒸馏,利用真实在线用户反馈改进购物智能体,在电商日志实验中提升了推荐质量、回复有用性及用户满意度对齐效果。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为
机构 * University of Southern California(南加州大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。
SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。
Comments Accepted at ICML 2026
提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。
面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习
机构 * Edge Hill University(埃奇希尔大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。
Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026
通过神经符号安全护卫实现端到端自动驾驶的引导
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究
机构 * Revelis s.r.l.(雷维利斯有限责任公司)
专题命中 安全训练 :alignment(title);分类 cs.CL
AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。
安全与资源约束下的多时间尺度干预学习
专题命中 安全训练 :safety(title);分类 cs.LG
AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
智能体策略组合是否安全?重新思考合作多智能体强化学习中的后继特征迁移
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对多智能体强化学习中独立策略组合不安全的问题,提出MA-USFA分层方法,兼顾策略组合的安全性与灵活性,无需任务适配即可部署。
大语言模型作为网络优化的通用策略
机构 * Bytedance(字节跳动) ; Shenzhen International Graduate School(深圳国际研究生院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Department of Computer Science and Technology(计算机科学与技术系)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。
Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing
SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。
Journal ref ICML 2026
学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准
收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。
BrowseSafe: 理解和防止AI浏览器代理中的提示注入
机构 * Purdue University(普渡大学) ; Perplexity AI
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 BrowseSafe通过构建现实场景下的提示注入攻击基准,提出多层次防御策略,旨在提升AI浏览器代理的安全性。
Comments COLM 2026
ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境
专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL
AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。
Comments Work in Progress
注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract)
AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。
Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026
将智能体安全重新思考为一个网络问题
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。
静默更新:测量并弥合部署后的披露差距
专题命中 提示注入 :safety(abstract);分类 cs.CY
AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。
Comments Accepted to AIES-26
用于多类皮肤病变分类的不确定性感知且可解释的集成深度学习框架
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 5 pages, 3 figures, IEEE AIBThings 2026
CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。
Comments 11 pages, 4 figures, and 3 tables