Agent Safety Should Be a Runtime Contract
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(title,title_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
从在线用户反馈中学习购物智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出LOFA框架,结合强化学习与反馈感知的策略内蒸馏,利用真实在线用户反馈改进购物智能体,在电商日志实验中提升了推荐质量、回复有用性及用户满意度对齐效果。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为
机构 * University of Southern California(南加州大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。
提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。
面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习
机构 * Edge Hill University(埃奇希尔大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。
Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026
通过神经符号安全护卫实现端到端自动驾驶的引导
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究
机构 * Revelis s.r.l.(雷维利斯有限责任公司)
专题命中 安全训练 :alignment(title);分类 cs.CL
AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
智能体策略组合是否安全?重新思考合作多智能体强化学习中的后继特征迁移
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对多智能体强化学习中独立策略组合不安全的问题,提出MA-USFA分层方法,兼顾策略组合的安全性与灵活性,无需任务适配即可部署。
学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准
收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。
ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境
专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL
AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。
Comments Work in Progress
将智能体安全重新思考为一个网络问题
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。
静默更新:测量并弥合部署后的披露差距
专题命中 提示注入 :safety(abstract);分类 cs.CY
AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。
Comments Accepted to AIES-26
用于多类皮肤病变分类的不确定性感知且可解释的集成深度学习框架
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 5 pages, 3 figures, IEEE AIBThings 2026
CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。
Comments 11 pages, 4 figures, and 3 tables
离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。
群体对齐诱导的谄媚性:可引导的多元对齐的双向评估
机构 * University of New South Wales(新南威尔士大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。
Comments 9 pages main text, 23 pages in total, under review
LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.LG
AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。
Comments 28 pages, 3 figures
量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY
AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。
从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者
机构 * Netflix(网飞公司)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。
从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。
Comments ISSRE 2026, AISQ, 8 pages
用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型
机构 * Intuit(英图易(金融科技公司))
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。
FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; China Telecom Research Institute(中国电信研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。
Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026