arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 27 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 27 篇

2605.08930 2026-05-12 cs.AI 89%

Internalizing Safety Understanding in Large Reasoning Models via Verification

通过验证内部化安全理解以提升大推理模型

Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,summary_cn);alignment(abstract);分类 cs.AI

AI总结 本文提出Safety Internal框架,通过训练模型在安全验证任务中自我批判生成答案,提升模型对自身输出安全性的判断能力,增强对抗性突破的鲁棒性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20129 2026-05-12 cs.CR cs.AI 85%

SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models

SAID: 通过前缀探测实现大型语言模型的安全意识意图防御

Yulong Chen, Qi Zhang, Jiawen Zhang, Yadong Liu, Mu Li, Jie Wen, Yong Xu

机构 * Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology, Harbin Institute of Technology, Shenzhen, Shenzhen, China(深圳视觉目标检测与识别重点实验室,哈尔滨工业大学,哈尔滨工业大学,深圳,深圳,中国)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SAID框架,通过意图层面的安全探测实现无训练的对抗防御,通过核心意图提炼和安全前缀探测减少有害响应,同时保持良性任务的实用性。

Comments 12 pages, 5 figures. V2: Updated title, author list, and extensive experiments; expanded background on LLM security applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17546 2026-05-12 cs.CL cs.LG 84%

Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning

学习保持安全:在微调过程中对抗安全退化的一种自适应正则化方法

Jyotin Goel, Souvik Maji, Pratik Mazumder

机构 * Indian Institute of Technology Jodhpur(印度理工学院乔浦尔)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种自适应正则化框架,通过评估安全风险来维持模型在微调过程中的安全性,实验表明该方法能有效降低攻击成功率并保持下游性能。

Comments Work in progress (48 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08878 2026-05-12 cs.CR cs.AI 83%

Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

为何对齐的LLM仍可被劫持:拒绝-逃逸方向、操作级来源及安全-效用权衡

Yu Chen, Yuanhao Liu, Qi Cao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究揭示对齐LLM仍易被劫持的原因,通过连续输入变换视角,发现拒绝-逃逸方向(RED)及操作级来源的结构漏洞,揭示安全与效用的权衡关系。

Comments 40 pages, 45 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10653 2026-05-12 cs.RO 82%

Embodied AI in Action: Insights from SAE World Congress 2026 on Safety, Trust, Robotics, and Real-World Deployment

具身人工智能在行动:来自2026年SAE世界大会关于安全、信任、机器人和现实世界部署的洞察

Jan-Mou Li, Paul Schmitt, Wei Tong, Majed Mohammed, Akshay Chalana, Arpan Kusari, Edward Griffor

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract)

AI总结 本文探讨了具身人工智能在现实系统中的应用挑战,强调需通过系统工程、生命周期管理与标准制定来确保安全可靠部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08416 2026-05-12 cs.AI cs.CY cs.LG 82%

Alignment as Jurisprudence

对齐作为法学

Nicholas Caputo

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文探讨法学与对齐的相似结构,通过法律解释主义和宪法AI等方法,揭示两者在规则与案例互动中的价值,并指出AI如何改进法律理解和应用。

Journal ref 27 Yale Journal of Law and Technology 390 (Sept. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01507 2026-05-12 cs.AI 79%

MILD: Mediator Agent System with Bidirectional Perception and Multi-Layered Alignment for Human-Vehicle Collaboration

MILD:具有双向感知和多层对齐的中介代理系统用于人车协作

Jiyao Wang, Yunbiao Wang, Yubo Jiao, Xiao Yang, Dengbo He, Sasan Jafarnejad, Luis Miranda-Moreno, Raphael Frank, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Interdisciplinary Centre for Security, Reliability and Trust, University of Luxembourg(卢森堡大学安全、可靠与信任跨学科中心)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文提出MILD系统,通过双向感知和多层对齐提升人车协作效率,采用ECPO算法确保策略符合安全规范和人类价值观,实验证明其在感知准确性和策略质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18901 2026-05-12 cs.LG cs.AI cs.CL 75%

Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams

有害意图作为LLM残差流中的几何可恢复特征

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过几何方法识别LLM残差流中有害意图的特征,发现其在不同模型架构中线性可分离,并通过优化策略实现高检测性能。

Comments 26 pages, 1(+6) figures, 4(+14) tables. Code at https://github.com/isaac-6/harm-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08765 2026-05-12 cs.LG cs.AI 73%

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10862 2026-05-12 cs.CL 70%

RUBEN: Rule-Based Explanations for Retrieval-Augmented LLM Systems

RUBEN:基于规则的检索增强大语言模型输出解释工具

Joel Rorseth, Parke Godfrey, Lukasz Golab, Divesh Srivastava, Jarek Szlichta

机构 * University of Waterloo(滑铁卢大学) York University(约克大学)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 RUBEN通过新型剪枝策略发现最小规则集解释检索增强大语言模型输出,用于测试安全训练和对抗性提示注入效果。

Comments Accepted by ICDE 2026 (Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11734 2026-05-12 cs.RO cs.AI 70%

SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving

SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶

Haojie Bai, Aimin Li, Ruoyu Yao, Xiongwei Zhao, Tingting Zhang, Xing Zhang, Lin Gao, and Jun Ma

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Middle East Technology University (METU)(中东技术大学) Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11491 2026-05-12 cs.RO cs.LG cs.SY eess.SY 70%

Constraint-Aware Reinforcement Learning via Adaptive Action Scaling

通过自适应动作缩放实现约束感知强化学习

Murad Dawood, Usama Ahmed Siddiquie, Shahram Khorshidi, Maren Bennewitz

机构 * Humanoid Robots Lab University of Bonn(人类机器人实验室 柏林洪堡大学)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种模块化成本感知调节器,通过预测约束违反来缩放智能体动作,与SAC和TD3等off-policy方法无缝集成,显著提升安全性和回报率。

Comments Accepted in 8th Annual Learning for Dynamics & Control Conference (L4DC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR 70%

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08592 2026-05-12 cs.CL cs.AI cs.LG 67%

Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models

多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院) University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学) University of California, Davis, California, USA(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了测试时缩放(TTS)中多样性降低导致安全风险增加的问题,提出RefDiv协议用于检测TTS管道中的漏洞,并发现现有安全防护措施对此类风险效果有限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14107 2026-05-12 cs.LG cs.AI cs.CE cs.ET cs.NE 62%

ST-ResGAT: Explainable Spatio-Temporal Graph Neural Network for Road Condition Prediction and Priority-Driven Maintenance

ST-ResGAT:用于道路状况预测和优先级驱动维护的可解释时空图神经网络

Mohsin Mahmud Topu, Azmine Toushik Wasi, Mahfuz Ahmed Anik, MD Manjurul Ahsan

机构 * Shahjalal University of Science and Technology(沙赫拉尔科学与技术大学) University of Oklahoma(俄克拉荷马大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ST-ResGAT,一种融合残差图注意力编码与GRU时间聚合的时空残差图注意力网络,用于预测道路损坏并生成ASTM合规的维护优先级,实验显示其预测精度高且具有可解释性。

Comments 40 Pages. 10 Tables. 8 Figures

Journal ref Intelligent Transportation Infrastructure, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08737 2026-05-12 cs.LG cs.CL 62%

The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs

近确定性结构输出在线策略蒸馏中的外推悬崖

Xin Li, Hao Jiang, Annan Wang, Yichi Zhang, Chau Yuen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在线策略蒸馏中近确定性结构输出任务的外推悬崖问题,推导了基于模态概率、预热质量及重要性采样剪切强度的闭式安全阈值,并展示了在Amazon Fashion数据集上通过调整参数实现模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09096 2026-05-12 cs.RO cs.AI cs.LG 62%

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

当机器人比人类更强大时:从受限演示中学习

Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık

机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) Meta AI Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI 62%

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10901 2026-05-12 cs.LG 57%

Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

超越红队测试:LLM防护分类器的正式保证

Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi

机构 * Delft University of Technology(代尔夫特理工大学) University of Birmingham(伯明翰大学) Zeroth Research(Zeroth研究)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出通过将验证空间从离散输入空间转移到分类器预激活空间,定义有害区域为包含已知有害提示表示的凸形区域,从而为LLM防护分类器提供正式保证,揭示了不同模型在安全性和鲁棒性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09757 2026-05-12 cs.LG stat.ML 57%

On Uniform Error Bounds for Kernel Regression under Non-Gaussian Noise

关于在非高斯噪声下核回归的统一误差界

Johannes Teutsch, Oleksii Molodchyk, Marion Leibold, Timm Faulwasser, Armin Lederer

机构 * Chair of Automatic Control Engineering, Department of Computer Engineering, Technical University of Munich(自动控制工程学系,计算机工程系,慕尼黑技术大学) Institute of Control Systems, Hamburg University of Technology(控制系统研究所,汉堡技术大学) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出非渐近的核回归统一误差界,适用于广泛非高斯分布,包括亚高斯、有界、亚指数和方差/矩有界的噪声,并在安全控制中验证了界的有效性。

Comments This paper has been accepted at the 43rd International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09364 2026-05-12 cs.LG 57%

Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

多尺度预测表示用于目标条件强化学习

Valliappan Chidambaram Adaikkappan, David Meger, Sai Rajeswar, Pietro Mazzaglia

机构 * Mila, McGill University(蒙特利尔大学Mila实验室) ServiceNow Research(ServiceNow研究) Qualcomm Research(高通研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文探讨了离线目标条件强化学习中鲁棒表示学习问题,提出多尺度预测监督框架Ms.PR,通过多尺度预测提升潜在空间中目标导向对齐,提升表示质量和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07649 2026-05-12 cs.CV cs.AI cs.RO 57%

Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models

在操作设计域内运行:基于视觉-语言模型的零样本感知

Berkehan Ünal, Hauke Dierend, Dren Fazlija, Christopher Plachetka

机构 * Volkswagen Aktiengesellschaft(大众汽车股份有限公司) L3S Research Center(莱比锡大学汉诺威研究中心) Faculty of Information Technology(信息科技学院) MOIA GmbH(MOIA公司) Motor AI GmbH(Motor AI公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型在无监督条件下对操作设计域的零样本感知能力,通过实验验证了基于链式推理的提示方法在OBD感知中的有效性,并提出了可重用的提示模板。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01008 2026-05-12 cs.CL 57%

MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL

MARS-SQL: 一种用于文本到SQL的多智能体强化学习框架

Haolin Yang, Jipeng Zhang, Zhitao He, Alexander Zhou, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 MARS-SQL通过多智能体框架解决文本到SQL任务中的逻辑与模式对齐问题,采用生成代理与验证机制提升交互学习效果,实现77.84%和89.75%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI 57%

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16708 2026-05-12 cs.CR cs.AI cs.MA 57%

Formal Policy Enforcement for Real-World Agentic Systems

面向现实代理系统的正式政策执行

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Langroid

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出基于面向切面编程的框架,通过Datalog语言实现跨代理系统的政策执行,解决传统方法无法保证正式执行的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10481 2026-05-12 cs.MA 50%

Safe Multi-Agent Behavior Must Be Maintained, Not Merely Asserted: Constraint Drift in LLM-Based Multi-Agent Systems

安全多智能体行为必须被维护,而非仅仅被断言:基于LLM的多智能体系统中的约束漂移

Tianxiao Li, Yixing Ma, Haiquan Wen, Zhenglin Huang, Qianyu Zhou, Zeyu Fu, Guangliang Cheng

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了基于LLM的多智能体系统中约束漂移问题,指出安全约束在执行过程中可能丢失、扭曲或减弱,提出约束状态治理作为研究范式,以确保安全行为在轨迹中持续有效。

Comments 12 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09606 2026-05-12 cs.CR cs.CV 50%

On the Generation and Mitigation of Harmful Geometry in Image-to-3D Models

关于图像到3D模型中有害几何的生成与缓解

Yule Liu, Yilong Yang, Jiale Teng, Hanze Jia, Zeren Luo, Jingyi Zheng, Zifan Peng, Ke Li, Yifan Liao, Zhen Sun, Jiaheng Wei, Yang Liu, Zhuo Ma, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究探讨了图像到3D模型生成有害几何的风险及缓解方法,通过系统评估发现当前模型能有效重建有害几何,但现有防护措施存在不足,提出堆叠防御策略以降低有害几何留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏