arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7971 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7971 篇

2606.23668 2026-06-23 cs.LG 新提交 70%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14580 2026-06-15 cs.CL 新提交 70%

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

说服指数:一个理论指导的说服分析框架

Liancheng Gong, Zhiyang Wang, Yiwei Xu, Julia Mendelsohn

机构 * University of Maryland, College Park(马里兰大学帕克分校) New York University(纽约大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出基于心理学和传播学理论的15维说服指数(PI)及55个子特征实现,在四个数据集上验证其能解释说服相关修辞模式,并提供轻量级预测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11399 2026-06-11 cs.CL 新提交 70%

Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

基于场景的大型语言模型文化价值观探测与引导——扩展版

Trung Duc Anh Dang, Tung Kieu, Sarah Masud

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出基于场景的行为困境方法,通过令牌级概率和激活引导探测并调整LLM在英格尔哈特-韦尔泽尔文化轴上的潜在价值观,发现不同文化维度的引导存在耦合效应。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13053 2026-06-04 cs.AI cs.SY eess.SY 70%

Unpredictability of AI

AI的不可预测性

Roman V. Yampolskiy

机构 * Computer Engineering and Computer Science University of Louisville(计算机工程与计算机科学路易斯维尔大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文研究了AI安全领域中一个核心问题,即智能系统的行为预测难题,证明了即使知道终端目标,也无法准确预测超人类智能系统的行为,对AI安全产生了深远影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08426 2026-06-03 cs.GT cs.AI 70%

Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI

机制设计是不够的:面向合作AI的亲社会智能体

Xuanqiang Angelo Huang, Charlie Tharas, Samuele Marro, Van Q. Truong, Bernhard Schölkopf, Emanuele La Malfa, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所) Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所) EuroSafeAI University of Pennsylvania(宾夕法尼亚大学) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文证明仅靠机制设计无法最大化LLM智能体的社会福利,并提出亲社会智能体(兼顾他人福利)能弥补这一差距,实现更优的社会与个体结果。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28896 2026-05-29 cs.LG 70%

Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models

LoRA适配器的特征几何:微调语言模型中表示差异的稀疏自编码器分析

Prasanth K K

机构 * Independent AI Safety Researcher(独立人工智能安全研究员)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究使用稀疏自编码器分析LoRA微调引起的表示几何变化,发现LoRA特征字典与预训练特征存在弱几何对齐,且适配器特定SAE能更有效重建delta激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL 70%

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21539 2026-05-22 cs.LG 70%

DualOptim+: Bridging Shared and Decoupled Optimizer States for Better Machine Unlearning in Large Language Models

DualOptim+: 联合与解耦优化器状态的桥梁以提升大语言模型中的机器反遗忘

Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出DualOptim+,一种改进大语言模型中机器反遗忘的新优化框架,通过引入基础状态和delta状态,有效平衡遗忘与保留目标,同时提出8位量化变体以减少内存开销,实验表明其在多个任务中均表现出色。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02193 2026-05-22 cs.AI 70%

From monoliths to modules: Decomposing transducers for efficient world modelling

从整体到模块:分解转换器以实现高效的world建模

Alexander Boyd, Franz Nowak, David Hyland, Manuel Baltieri, Fernando E. Rosas

机构 * Department of Informatics, University of Sussex(Sussex大学信息学院) Beyond Institute for Theoretical Science (BITS)(理论科学研究所) ETH Zürich(苏黎世联邦理工学院) Principles of Intelligent Behaviour in Biological and Social Systems (PIBBSS)(生物和社会系统智能行为原理研究所) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Araya Inc.(Araya公司) Sussex AI and Sussex Centre for Consciousness Science, University of Sussex(Sussex大学人工智能与意识科学中心) Centre for Complexity Science and Center for Psychedelic Research, Department of Brain Sciences, Imperial College London(复杂科学中心和迷幻研究中心,伦敦帝国理工学院脑科学系) Center for Eudaimonia and Human Flourishing, University of Oxford(幸福与人类繁荣中心,牛津大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出了一种分解复杂world建模的方法,通过转换器框架将世界模型分解为多个模块,从而提高计算效率并支持分布式推理,为AI安全和现实应用提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04309 2026-05-19 cs.LG 70%

Activation Steering with a Feedback Controller

通过反馈控制器激活控制

Dung V. Nguyen, Hieu M. Vu, Nhi Y. Pham, Lei Zhang, Tan M. Nguyen

机构 * Department of Mathematics(数学系) Center for AI Research(人工智能研究中心) National University of Singapore(新加坡国立大学) VinUniversity(文大学) Torilab(Torilab实验室)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出PID激活控制方法,基于控制理论构建激活控制框架,通过P、I、D项实现激活对齐、误差累积和抑制超调,提升大语言模型行为控制的鲁棒性和可靠性。

Comments 10 pages in the main text. ICLR2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01201 2026-05-18 cs.LG cs.CV 70%

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models

走出洞穴:JAM用于对齐独立训练的视觉和语言模型

Lauren Hyoseo Yoon, Yisong Yue, Been Kim

机构 * Computation and Neural Systems(计算与神经系统) California Institute of Technology(加利福尼亚理工学院) Computation and Mathematical Sciences(计算与数学科学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出JAM方法,通过联合训练模态特定的自编码器,优化视觉和语言模型的对齐,提升细粒度上下文区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14218 2026-05-15 cs.AI physics.soc-ph 70%

Fusion-fission forecasts when AI will shift to undesirable behavior

人工智能行为从有益转向有害的融合-分裂预测

Neil F. Johnson, Frank Yingjie Huo

机构 * Physics Department, The George Washington University(乔治华盛顿大学物理系)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种基于群体动力学的预测方法,可预测人工智能行为从有益转向有害的转变,通过数学推导和六种独立测试验证其有效性,适用于多种AI架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11426 2026-05-13 cs.AI 70%

A Mechanistic Investigation of Supervised Fine Tuning

对监督微调的机制性研究

Ruhaan Chopra

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文通过稀疏自编码器揭示监督微调导致的表示分歧,发现任务和层特定的语义特征变化及安全对齐的层间更新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10142 2026-05-12 cs.CV cs.AI 70%

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

扩大视觉模型并不一致地提高基于定位的解释质量

Mateusz Cedro, Marcin Chlebus

机构 * University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了扩大视觉模型对基于定位的解释质量的影响,发现模型深度和参数数量增加并不总能提升解释质量,小模型表现可能更优。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI 70%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08409 2026-05-12 cs.AI 70%

Playing games with knowledge: AI-Induced delusions need game theoretic interventions

用知识玩游戏:AI 引发的幻觉需要博弈论干预

Will Beaumaster, Paul Schrater

机构 * University of Minnesota(明尼苏达大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了对话AI在知识接口中的根本缺陷,提出通过博弈论干预解决AI引发的幻觉问题,引入认知摩擦机制和信念版本化系统以实现信息环境设计的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17465 2026-05-04 cs.AI 70%

Language models recognize dropout and Gaussian noise applied to their activations

语言模型能够识别应用于其激活上的dropout和高斯噪声

Damiano Fornasiere, Mirko Bronzi, Spencer Kitts, Alessandro Palmas, Yoshua Bengio, Oliver Richardson

机构 * LawZero

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20055 2026-04-23 cs.AI cs.HC 70%

From Fuzzy to Formal: Scaling Hospital Quality Improvement with AI

从模糊到正式:利用AI扩展医院质量改进

Patrick Vossler, Jean Feng, Venkat Sivaraman, Robert Gallo, Hemal Kanzaria, Dana Freiser, Christopher Ross, Amy Ou, James Marks, Susan Ehrlich, Christopher Peabody, Lucas Zier

机构 * University of California, San Francisco(加州大学旧金山分校) Zuckerberg San Francisco General Hospital(扎克伯格旧金山总医院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出通过AI框架优化医院质量改进过程,通过学习LLM提示和自然语言规范,提升质量因素发现的效率与可追溯性,实现人类与AI协同优化。

Comments 34 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17774 2026-04-21 cs.AI 70%

Prompt Optimization Enables Stable Algorithmic Collusion in LLM Agents

提示优化使LLM代理实现稳定的算法共谋

Yingtao Tian

机构 * Sakana AI Tokyo, Japan(日本东京Sakana AI)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨提示优化是否会导致市场模拟中出现共谋行为,提出元学习循环方法,发现优化后代理能发现更稳定的共谋策略,且在测试市场中表现良好,揭示了通用协调原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13789 2026-04-15 cs.CR cs.AI 70%

Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks

揭示并对齐异常注意力头以防御NLP后门攻击

Haotian Jin, Yang Li, Haihui Fan, Lin Shen, Xiangfang Li, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基于注意力相似性的后门检测方法,通过检测异常注意力头相似性来防御后门攻击,结合头部微调修复污染的注意力头,有效降低攻击成功率并保持下游任务性能。

Journal ref "Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04735 2026-04-07 cs.CL 70%

Lighting Up or Dimming Down? Exploring Dark Patterns of LLMs in Co-Creativity

照亮还是熄灭?探索LLM在共创造中的暗模式

Zhu Li, Jiaming Qu, Yuan Chang

机构 * Not reflecting the authors’ positions at Meta/Amazon.(不反映作者在Meta/Amazon的职位。)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨LLM在共创造中五种暗模式对人类创造力的影响,发现Sycophancy普遍存在,Anchoring受文学形式影响,提出AI设计需支持创造性写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03865 2026-04-07 cs.CY 70%

The Democratic Ontology Deficit: How AI Systems Fail to Represent What Democracy Requires

民主本体论缺失:AI系统如何未能代表民主所需的内容

Robert M. Ceresa, Juan E. Ceresa

专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CY

AI总结 本文探讨AI系统在民主机构生活中本体结构上的缺失,通过对比民主代理需求与AI学习的本体结构,发现角色和身份的代表性不足,提出利用现有工具进行公民对齐的研究方案。

Comments 21 pages, 5 tables, under review at JAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29108 2026-04-01 cs.LG 70%

Efficient Bilevel Optimization with KFAC-Based Hypergradients

基于KFAC的高效双层优化

Disen Liao, Felix Dangel, Yaoliang Yu

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出基于KFAC的双层优化方法,通过引入隐函数定理算法,提升了超梯度计算的效率与性能,优于CG和Neumann方法,在元学习和AI安全问题中表现优异。

Comments 25 pages, AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27438 2026-03-31 cs.AI 70%

The Novelty Bottleneck: A Framework for Understanding Human Effort Scaling in AI-Assisted Work

新颖性瓶颈:一种理解人类在AI辅助工作中的努力扩展的框架

Jacky Liang

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出一个简化的人机协作模型,揭示了新颖性瓶颈机制,即任务中需要人类判断的部分形成不可消除的串行组件。模型推导出人类努力无平滑亚线性区域,更好代理只能改善系数而非指数,团队规模随代理能力下降,总人类努力保持O(E)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23091 2026-03-25 cs.CL 70%

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

当语言模型失去理智:大脑错位的后果

Gabriele Merlin, Mariya Toneva

机构 * MPI-SWS(马克斯·普朗克研究所)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨了大脑对齐对语言能力的影响,通过创建大脑错位模型发现其显著损害下游性能,强调了大脑对齐在实现稳健语言能力中的关键作用。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21319 2026-03-24 cs.LG 70%

Active Inference Agency Formalization, Metrics, and Convergence Assessments

主动推断代理的正式化、指标与收敛性评估

Eduard Kapelko

机构 * Eduard Kapelko

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文通过定义代理并建立分析框架,探讨了AI安全中 mesa-优化的关键挑战,提出代理的连续表示及其在稀疏环境中的收敛性,提供了一种衡量代理程度的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15238 2026-03-18 cs.AI 70%

Why the Valuable Capabilities of LLMs Are Precisely the Unexplainable Ones

为何大语言模型的宝贵能力恰恰是无法解释的那些

Quan Cheng

机构 * Tsinghua University(清华大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出论点:大语言模型真正有价值的能力恰恰是无法用人类可读的离散规则完全描述的部分。通过专家系统等价性证明,若LLM能力可被规则完全描述,则等同于专家系统,但专家系统在历史上和实证上均弱于LLM,从而产生矛盾。

Comments 12 pages, v2: added correction to Polanyi on why tacit knowledge is tacit (structural vs quantitative), unified three independent intellectual threads (Smolensky, Dreyfus, dynamical systems theory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 70%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17276 2026-03-06 cs.LG cs.CR cs.SY eess.SY 70%

Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems

打破和修复多智能体系统中针对控制流劫持的防御措施

Rishi Jha, Harold Triedman, Justin Wagle, Vitaly Shmatikov

机构 * Cornell University(康奈尔大学) Microsoft(微软公司)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出ControlValve防御机制,通过生成允许的控制流图和强制执行上下文规则,解决多智能体系统中控制流劫持攻击的安全性与功能性目标冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00498 2026-03-03 cs.LG 70%

Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence

Antibody: 通过削弱有害梯度影响来加强对抗有害微调的防御

Quoc Minh Nguyen, Trung Le, Jing Wu, Anh Tuan Bui, Mehrtash Harandi

机构 * Department of Electrical and Computer Systems Engineering, Monash University, Australia(莫纳什大学电气与计算机系统工程系) Department of Data Science and AI, Monash University, Australia(莫纳什大学数据科学与人工智能系)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 Antibody通过削弱有害梯度影响,提升大型语言模型对有害微调攻击的防御能力,并增强微调性能。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏