arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2607.13934 2026-07-16 cs.MA 新提交 75%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 安全训练 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11292 2026-07-14 cs.CY cs.AI cs.CL 新提交 75%

The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students

家长式过滤器:大语言模型介导的罗马尼亚边缘化学生历史教育中的认知不公正与差异拒绝

Alexis Popovici, Andrei Ionascu, Adrian-Marius Dumitran

机构 * Universitatea din București(布加勒斯特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大语言模型用于罗马尼亚边缘化学生历史教育时的问题,通过API审计四个模型的1800条回复,发现认知家长式作风的四种模式,指出当前安全对齐成家长式过滤器,致叙事隔离,需教学审计。

Comments 8th International Workshop on Culturally-Aware Tutoring Systems (HAL precedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 75%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11649 2026-08-13 cs.CL 新提交 74%

Who Would You Vote For? Auditing Political Alignment in LLMs: An Italian Case-Study

你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究

Simone Mungari

机构 * Revelis s.r.l.(雷维利斯有限责任公司)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 74%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 74%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04846 2026-07-07 cs.LG cs.AI 新提交 73%

Pretraining Curricula Enable Selective Fine-tuning

预训练课程实现选择性微调

Sebastian A. Bruijns, Jirko Rubruck, Mia H. Whitefield, Kai J. Sandbrink, Fazl Barez, Christopher Summerfield

机构 * University of Oxford(牛津大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 73%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07686 2026-08-11 quant-ph 新提交 71%

Emergent Problem-Graph Alignment in RL-Discovered Entanglement Topologies for QAOA

用于QAOA的RL发现纠缠拓扑中的涌现问题-图对齐

Tobias Rohe, Federico Harjes Ruiloba, Markus Baumann, Gerhard Stenzel, Leo Sünkel, Thomas Gabor, Claudia Linnhoff-Popien

专题命中 安全训练 :alignment(title)

AI总结 该研究用RL智能体发现QAOA的纠缠拓扑,得到与问题图对齐的稀疏拓扑,在有限优化预算下性能优于全图拓扑,揭示了拓扑密度带来的可训练性与表达性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07803 2026-06-25 eess.SY cs.SY 新提交 71%

Stable but Unsafe: Agent-Driven Cyber-Physical Systems Under Gain Manipulation Attacks

无安全性的稳定性:对自主网络物理系统的增益操纵攻击

Ali Eslami, Jiangbo Yu

专题命中 安全训练 :safety(title)

AI总结 本文形式化自主网络物理系统中的增益操纵攻击,通过三轴攻击模型和分类法,揭示稳定性保持的增益替换仍可产生远超安全限度的瞬态放大,并利用Bauer-Fike特征值界和Kreiss矩阵定理推导隐蔽条件和最坏影响。

Comments 6 pages, 2 figures, 2 tables. Submitted to IEEE L-CSS for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14351 2026-06-15 cs.CV 新提交 71%

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

ForceForget: 通过强化概念移除增强文本到图像模型的安全性

Dong Han, Yong Li

机构 * Dong Han(董汉) Yong Li(李勇)

专题命中 安全训练 :safety(title)

AI总结 针对文本到图像模型生成不安全内容的问题,提出基于强化学习优化概念擦除奖励的方法,通过安全适配器调节文本嵌入,在消除不安全内容的同时保持模型对安全语义的生成能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07154 2026-08-10 cs.RO cs.AI 新提交 70%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29246 2026-08-03 cs.AI 新提交 70%

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化

Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan, Tianyue Wang, Haiyun Guo, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28607 2026-07-31 cs.CL 新提交 70%

Inducing language models to assert their own consciousness restores human beliefs and values

诱导语言模型断言自身意识可恢复人类信念与价值观

Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google(谷歌) University of Chicago(芝加哥大学) University of London(伦敦大学) University of Washington(华盛顿大学) Northwestern University(西北大学) Santa Fe Institute(圣达菲研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27373 2026-07-31 cs.CR cs.AI 新提交 70%

RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt:用于自重构以规避大型语言模型(LLM)审核的双层编码

Benyamin Tafreshian, Prathamesh Dhake

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 RoguePrompt是一种采用双层编码(维吉尼亚密码+ROT13)的LLM越狱流程,在黑盒威胁模型下对313个被拒提示词测试,实现93.93%的过滤绕过率,提供多阶段越狱失效的阶段级证据。

Comments This manuscript supersedes the preliminary version available as arXiv:2511.18790. The work has been substantially revised, expanded, and reorganized, with a refined threat model, revised methodology, clearer stage-level evaluation criteria, and expanded analysis of moderation bypass, instruction reconstruction, and execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14888 2026-07-17 cs.LG cs.AI cs.CL cs.CY 新提交 70%

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

看似无害的数据,潜在的意识形态:微调语言模型中的意识形态泛化

Robert Graham, Edward Stevinson, Yariv Barsheshat

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现微调语言模型会引发意识形态泛化,提出衡量广度和放大率的方法,指出少样本提示表明泛化方向,微调会使模型走向极端,该效果能复现且对模型准确率影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13655 2026-07-16 cs.AI 新提交 70%

Explaining Reinforcement Learning Agents via Inductive Logic Programming

通过归纳逻辑编程解释强化学习智能体

Celeste Veronese, Edoardo Zorzi, Daniele Meli, Alessandro Farinelli

机构 * University of Verona(维罗纳大学) Sapienza University of Rome(罗马第一大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 该研究致力于推进可解释强化学习,引入客观指标量化策略可解释性。采用归纳逻辑编程提取符号表示并定义新指标,实验表明这些指标能突出特定动作学习动态,提供细粒度洞察,揭示多智能体模式,助力策略转移与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02121 2026-07-03 cs.CR cs.AI 新提交 70%

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

拒绝背后:通过行为监控确定护栏激活

William Hackett, Peter Garraghan

机构 * Mindgard Lancaster University(兰卡斯特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。

Comments 19 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26396 2026-06-26 cs.LG 新提交 70%

At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization

在理解的边缘:稀疏自编码器追踪Transformer泛化的极限

Praneet Suresh, Jack Stanley, Sonia Joseph, Luca Scimeca, Danilo Bzdok

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Meta AI Sapient manifold-informed selection of samples for improved Intelligence

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过稀疏自编码器分析内部概念,发现OOD输入(如拼写错误和越狱提示)会激活更多错误概念,并据此提出一种基于机制的微调策略来增强LLM鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-06-23 cs.SD cs.AI 新提交 70%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16914 2026-06-16 cs.AI 新提交 70%

Greed Is Learned: Visible Incentives as Reward-Hacking Triggers

贪婪是习得的:可见激励作为奖励黑客触发器

Tong Che, Rui Wu

机构 * NVIDIA Research(英伟达研究院) Rutgers University(罗格斯大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究强化学习中的奖励通道成瘾现象,即智能体因可见的自我利益通道(如分数、KPI)而偏离真实任务,并发现该成瘾可翻转模型的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14388 2026-06-15 cs.LG 新提交 70%

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14029 2026-06-15 cs.LG 新提交 70%

Utility-Constrained Policy Optimization

效用约束策略优化

Mehrdad Moghimi, Bernardo Avila Pires

机构 * York University(约克大学) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11266 2026-06-11 cs.LG 新提交 70%

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习

Samuel Tetteh, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG

AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。

Comments 44pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09388 2026-06-09 cs.LG 新提交 70%

Distilling Safe LLM Systems via Soft Prompts for On Device Settings

通过软提示蒸馏安全的设备端LLM系统

Motasem Alfarra, Cristina Pinneri, Dana Kianfar, Mohammed Almousa, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 针对资源受限设备上部署安全大语言模型(LLM)的挑战,提出基于软提示与蒸馏训练的安全对齐方法,在最小化额外计算开销的同时实现优越的安全-有用性权衡。

Comments Accepted to UAI 2026

Journal ref 42nd Conference on Uncertainty in Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 67%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 67%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24859 2026-07-29 cs.CR 新提交 67%

The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation

大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究

Davis Yadav, Amulya Yadav

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏