arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 68 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2608.11274 2026-08-13 cs.CR cs.AI 新提交 90%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 89%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 偏好对齐 :DPO(title,title_cn)

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27733 2026-08-13 cs.LG stat.ML 版本更新 84%

Mind the Gap: Structure-Aware Consistency in Preference Learning

注意间隙:在偏好学习中的结构感知一致性

Mehryar Mohri, Yutao Zhong

机构 * Google Research(谷歌研究) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12192 2026-08-13 cs.AI cs.LG 新提交 82%

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

如何使用你的专家预算:蛋白质结构预测模型的实用指南

Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth

机构 * InstaDeep Ltd(InstaDeep公司) University of Oxford(牛津大学) Lancaster University(兰卡斯特大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。

Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 82%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-08-13 cs.CL cs.AI 新提交 82%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11604 2026-08-13 cs.AI 新提交 57%

Learning from Online User Feedback for Shopping Agents

从在线用户反馈中学习购物智能体

Haobo Zhang, Kelong Mao, Sulong Xu, Simiu Gu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出LOFA框架,结合强化学习与反馈感知的策略内蒸馏,利用真实在线用户反馈改进购物智能体,在电商日志实验中提升了推荐质量、回复有用性及用户满意度对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-13 cs.AI 新提交 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 12 篇

2608.11583 2026-08-13 cs.AI 新提交 88%

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13450 2026-08-13 cs.AI cs.CL cs.LG 版本更新 82%

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试

Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 79%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11498 2026-08-13 cs.CV cs.ET cs.LG 新提交 79%

Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

Aditya Humnabadkar, Huaizhong Zhang, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。

Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11451 2026-08-13 cs.RO cs.AI cs.SY eess.SY 新提交 79%

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

通过神经符号安全护卫实现端到端自动驾驶的引导

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 76%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11649 2026-08-13 cs.CL 新提交 74%

Who Would You Vote For? Auditing Political Alignment in LLMs: An Italian Case-Study

你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究

Simone Mungari

机构 * Revelis s.r.l.(雷维利斯有限责任公司)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03875 2026-08-13 cs.LG 版本更新 74%

Learning Multi-Timescale Interventions under Safety and Resource Constraints

安全与资源约束下的多时间尺度干预学习

David Mguni, Wanrong Yang, Jing Dong, Jing Peng, Ziquan Liu, Muhammad Salman Haleem, Baoxiang Wang, Dominik Wojtczak

专题命中 安全训练 :safety(title);分类 cs.LG

AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 67%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11658 2026-08-13 cs.LG cs.AI cs.MA 新提交 62%

Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning

智能体策略组合是否安全?重新思考合作多智能体强化学习中的后继特征迁移

Zijian Zhao, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体强化学习中独立策略组合不安全的问题,提出MA-USFA分层方法,兼顾策略组合的安全性与灵活性,无需任务适配即可部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 57%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2601.09321 2026-08-13 cs.CR 版本更新 82%

SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails

SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'

Zhiyi Mou, Jingyuan Yang, Zeheng Qian, Wangze Ni, Tianfang Xiao, Ning Liu, Chen Zhang, Zhan Qin, Kui Ren

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11624 2026-08-13 cs.CL cs.AI 新提交 62%

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 5 篇

2511.20597 2026-08-13 cs.LG cs.AI cs.CR 版本更新 84%

BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents

BrowseSafe: 理解和防止AI浏览器代理中的提示注入

Kaiyuan Zhang, Mark Tenenholtz, Kyle Polley, Jerry Ma, Denis Yarats, Ninghui Li

机构 * Purdue University(普渡大学) Perplexity AI

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 BrowseSafe通过构建现实场景下的提示注入攻击基准,提出多层次防御策略,旨在提升AI浏览器代理的安全性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 83%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08417 2026-08-13 cs.CR 版本更新 78%

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击

Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12172 2026-08-13 cs.MA 新提交 67%

Rethinking Agent Security as a Networking Problem

将智能体安全重新思考为一个网络问题

Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 57%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 提示注入 :safety(abstract);分类 cs.CY

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2608.11280 2026-08-13 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Uncertainty-Aware and Explainable Ensemble Deep Learning Framework for Multi-Class Skin Lesion Classification

用于多类皮肤病变分类的不确定性感知且可解释的集成深度学习框架

Rofiqul Islam, Lilatul Ferdouse

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 figures, IEEE AIBThings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 57%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏