arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 17 篇

2507.20704 2026-03-05 cs.CL cs.AI cs.CR 86%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 安全训练 :alignment(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 82%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 79%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 73%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03323 2026-03-05 cs.CL cs.AI 73%

Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement

辨别真伪:通过对比细化减少过度拒绝

Yuxiao Lu, Lin Xu, Yang Sun, Wenjun Li, Jie Shi

机构 * Huawei Technologies co. ltd(华为技术有限公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCR方法,通过对比细化减少LLM的过度拒绝问题,同时保持安全性和通用能力。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 67%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01870 2026-03-05 cs.MA cs.GT 67%

$\aleph$-IPOMDP: Mitigating Deception in a Cognitive Hierarchy with Off-Policy Counterfactual Anomaly Detection

$\aleph$-IPOMDP:通过非策略反事实异常检测缓解认知层级中的欺骗

Nitay Alon, Joseph M. Barnby, Stefan Sarkadi, Lion Schulz, Jeffrey S. Rosenschein, Peter Dayan

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 $\aleph$-IPOMDP通过非策略反事实异常检测机制,缓解认知层级中的欺骗问题,提升博弈中的公平性和安全性。

Comments 28 pages, 12 figures

Journal ref Journal of Artificial Intelligence Research (JAIR), Volume 85, Article 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07757 2026-03-05 cs.AI cs.LG 62%

Emotion-Gradient Metacognitive RSI (Part I): Theoretical Foundations and Single-Agent Architecture

情绪梯度元认知递归自我改进(第一部分):理论基础与单体代理架构

Rintaro Ando

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EG-MRSI框架整合反思元认知、情绪内在动机和递归自我修改,通过可微奖励函数和安全机制实现单体代理的理论基础,为安全AGI提供严谨基础。

Comments Withdrawn due to a critical error discovered in the stability and convergence proofs (specifically Lemma 2, Theorem 12, and Proposition 10) in Section 3. The identified flaw invalidates the core theoretical guarantees regarding capability growth and system stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01440 2026-03-05 cs.RO cs.AI cs.LG 62%

A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving

强化学习在自动驾驶领域的奖励函数综述

Ahmed Abouelazm, Jonas Michel, J. Marius Zoellner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫研究所信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了强化学习在自动驾驶中奖励函数的设计,分析了不同方法的优缺点,并提出了未来研究方向,如奖励验证框架和情境感知奖励。

Comments Accepted at the 35th IEEE Intelligent Vehicles Symposium (IV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03541 2026-03-05 cs.CL cs.AI 62%

RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering

RAG-X: 用于医疗问答的检索增强生成系统系统性诊断

Aswini Sivakumar, Vijayan Sugumaran, Yao Qiang

机构 * Oakland University(奥克兰大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 RAG-X通过系统性诊断框架,评估检索和生成过程,揭示问答系统中的隐藏失败模式,提升医疗问答的准确性和可靠性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03367 2026-03-05 cs.CY cs.AI 62%

Bridging the Reproducibility Divide: Open Source Software's Role in Standardizing Healthcare AI

弥合可重复性鸿沟:开源软件在标准化医疗AI中的作用

John Wu, Zhenbang Wu, Jimeng Sun

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了开源软件在提升医疗AI可重复性中的作用,指出通过公开数据集和代码共享可显著提高论文影响力,并提出标准化数据预处理和开放科学实践的必要性。

Comments Old Preprint. Will update in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04033 2026-03-05 cs.CL 57%

Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA

谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。

Comments Accepted in HeaLing Workshop - EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03768 2026-03-05 cs.RO cs.AI 57%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 57%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03371 2026-03-05 cs.CR cs.AI 57%

Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs

睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型

Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22263 2026-03-05 cs.LG 57%

Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning

擦除或隐藏?抑制虚假的反向学习神经元以实现稳健的反向学习

Nakyeong Yang, Dong-Kyum Kim, Jea Kwon, Minsung Kim, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出Ssiuu方法,通过属性引导正则化有效抑制虚假反向学习神经元,提升反向学习的鲁棒性和准确性。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 50%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 安全训练 :alignment(abstract)

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏