arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2603.03192 2026-03-31 cs.CV cs.CL cs.LG 84%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 81%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27868 2026-03-31 econ.TH cs.AI cs.GT 79%

A Revealed Preference Framework for AI Alignment

为AI对齐的揭示偏好框架

Elchin Suleymanov

机构 * Department of Economics, Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院经济系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Luca对齐模型,通过揭示偏好技术研究AI是否实现人类偏好,证明在实验室和实地设置中可识别对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28123 2026-03-31 cs.CY cs.AI cs.CL 67%

Does Claude's Constitution Have a Culture?

克莱因的宪法有文化吗?

Parham Pourdavood

机构 * Independent Researcher(独立研究员)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究克莱因的宪法是否反映特定文化视角,通过评估其在跨文化调查中的表现,发现其价值观与北欧和盎格鲁国家相似,但多数项目超出所有被调查人群范围。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28197 2026-03-31 cs.AI 57%

EpiPersona: Persona Projection and Episode Coupling for Pluralistic Preference Modeling

EpiPersona:基于人格与事件耦合的多元偏好建模

Yujie Zhang, Weikang Yuan, Zhuoren Jiang, Pengwei Yan

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 EpiPersona通过显式人格-事件耦合方法,有效分离持久性人格特征与情境信号,提升大语言模型在多元偏好下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 57%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02368 2026-03-31 cs.IR 50%

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

NextQuill: 基于因果偏好建模的增强大语言模型个性化

Xiaoyan Zhao, Juntao You, Yang Zhang, Wenjie Wang, Hong Cheng, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract)

AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2408.15625 2026-03-31 eess.SY cs.AI cs.CL cs.SY 84%

CBF-LLM: Safe Control for LLM Alignment

CBF-LLM:安全控制用于大语言模型对齐

Yuya Miyaoka, Masaki Inoue

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的对齐框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器减少对齐任务的干预次数。

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 79%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15446 2026-03-31 cs.CL cs.AI 79%

NP-Hard Lower Bound Complexity for Semantic Self-Verification

语义自验证的NP难下界复杂度

Robin Young

机构 * University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文证明语义自验证问题在特定框架下为NP完全,通过将3SAT问题归约到SSV,揭示了即使简化形式的语义自验证也面临计算障碍,对AI安全和公平性方法有重要影响。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27912 2026-03-31 cs.RO cs.SY eess.SY 78%

Safety Guardrails in the Sky: Realizing Control Barrier Functions on the VISTA F-16 Jet

天空中的安全护栏:在VISTA F-16喷气式飞机上实现控制障碍函数

Andrew W. Singletary, Max H. Cohen, Tamas G. Molnar, Aaron D. Ames

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出Guardrails机制,通过结合人类或AI指令与安全控制动作,确保自主系统在边缘操作域安全运行,展示了其在F-16飞行测试中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22059 2026-03-31 hep-ph cs.LG hep-ex 70%

Stable and Interpretable Jet Physics with IRC-Safe Equivariant Feature Extraction

利用 IRC 安全等价特征提取实现稳定且可解释的喷注物理

Partha Konar, Vishal S. Ngairangbam, Michael Spannowsky, Deepanshu Srivastava

机构 * Physical Research Laboratory(物理研究实验室) Durham University(杜伦大学) Indian Institute of Technology(印度理工学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文通过图神经网络实现喷注分类,结合物理诱导偏置,设计 IRC 安全和等价性架构,提升模型稳定性与可解释性,建立学习表示与 QCD 观测的联系。

Comments 30 pages, 3 tables, 7 figures

Journal ref JHEP 03 (2026) 219

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27412 2026-03-31 cs.LG cs.AI cs.CL 67%

The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams

有害意图的几何学:通过残差流中的角度偏差实现无训练异常检测

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LatentBiopsy方法,通过分析大语言模型残差流激活的几何特性,无需训练即可检测有害提示。该方法基于残差流激活的主成分分析和角度偏差,实现高精度的异常检测,具有低延迟和强鲁棒性。

Comments 20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26679 2026-03-31 cs.CY cs.AI cs.HC 62%

AI Meets Mathematics Education: A Case Study on Supporting an Instructor in a Large Mathematics Class with Context-Aware AI

人工智能与数学教育的交汇:一个支持大班数学课程教师的案例研究

Jérémy Barghorn, Anna Sotnikova, Sacha Friedli, Antoine Bosselut

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了通过上下文感知AI支持大规模数学课程的教学挑战,通过细调轻量语言模型提高回答准确性,并强调了人机协作在课程支持中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27299 2026-03-31 cs.LG 57%

From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification

从推理路由到代理编排:基于跨层验证的声明性策略编译

Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu

机构 * McGill University(麦吉尔大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.LG

AI总结 本文扩展了非图灵完备的策略语言,从单请求路由到多步骤代理工作流,通过跨层验证确保策略一致性,提升可审计性和可验证性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27194 2026-03-31 cs.RO cs.AI 57%

Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence

基于场景自适应具身智能的多无人水下机器人自组网多目标跟踪

Kai Tian, Jialun Wang, Chuan Lin, Guangjie Han, Shengchao Zhu, Ying Liu, Qian Zhu

机构 * Software College, Northeastern University(东北大学软件学院) Key Laboratory of Maritime Intelligent Network Information Technology, Ministry of Education, Hohai University(河海大学教育部海事智能网络信息技术重点实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于场景自适应具身智能的多AUV自组网架构,通过整合感知、决策与物理执行,提升多目标跟踪的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27148 2026-03-31 cs.CR cs.AI 57%

SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do

SafetyDrift: 在实际发生之前预测AI代理跨过界限的时间

Aditya Dhodapkar, Farhaan Pishori

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Santa Clara University(圣克拉拉大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SafetyDrift模型,通过吸收马尔可夫链分析预测AI代理在有限时间内的安全违规概率,发现不同任务中违规风险差异显著,且轻量监控器在低计算成本下有效检测违规。

Comments 9 pages, 7 figures, sent to COLM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL 57%

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 57%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26697 2026-03-31 eess.SY cs.AI cs.SY 57%

Physicochemical-Neural Fusion for Semi-Closed-Circuit Respiratory Autonomy in Extreme Environments

物理化学-神经融合用于极端环境半闭环呼吸自主性

Phillip Kingston, Nicholas Johnston

机构 * Galactic Bioware

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种结合物理化学原理和人工智能的半闭环呼吸系统,通过融合传感器层级和强化学习策略,优化极端环境下的呼吸自主性,提升耐力性能。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 50%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27583 2026-03-31 cs.RO cs.SY eess.SY 50%

LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair

基于大语言模型的低空无人机自然语言导航:通过信号时序逻辑规范翻译与修复

Yuqi Ping, Huahao Ding, Tianhao Liang, Longyu Zhou, Guangyu Lei, Xinglin Chen, Junwei Wu, Jieyu Zhou, Tingting Zhang

机构 * Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing, Harbin Institute of Technology, Shenzhen(广东省空天网络与智能感知重点实验室,哈尔滨工业大学(深圳)) Peng Cheng Laboratory (PCL), Shenzhen(鹏城实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computer Science and Engineering, Central South University, Changsha(中南大学计算机科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种统一框架,通过将自然语言指令转换为信号时序逻辑规范并利用混合整数线性规划生成轨迹,提升低空无人机在复杂环境中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2603.12681 2026-03-31 cs.CR cs.LG 88%

Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment

协同LoRA:大语言模型安全对齐中的组合性漏洞

Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。

Comments Updated manuscript to better reflect the core contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 78%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 越狱攻击 :safety(title,abstract)

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 70%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 62%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20863 2026-03-31 cs.CR 50%

Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks

通过隐藏提示注入攻击误导用于科学同行评审的大型语言模型

Matteo Gioele Collu, Umberto Salviati, Roberto Confalonieri, Mauro Conti, Giovanni Apruzzese

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究探讨了通过隐藏提示注入攻击误导科学同行评审中使用的大型语言模型的潜力,设计了不可见于人类读者但能引导LLM输出的对抗性提示,并评估了其在不同系统和论文中的鲁棒性。

Comments Accepted to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2511.14043 2026-03-31 cs.AI cs.CL cs.MA 62%

AISAC: An Integrated multi-agent System for Transparent, Retrieval-Grounded Scientific Assistance

AISAC:一个集成的多智能体系统,用于透明、基于检索的科学协助

Chandrachur Bhattacharya, Sibendu Som

机构 * Transportation and Power Systems Division, Argonne National Laboratory, USA(美国阿贡国家实验室交通与动力系统部)

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI

AI总结 AISAC 提供了一个透明的多智能体运行环境,支持长期的证据支持科学推理,通过结构化保证实现角色语义、预算管理、可追溯执行和工具交互可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2603.27672 2026-03-31 stat.ML cs.LG 57%

Energy Score-Guided Neural Gaussian Mixture Model for Predictive Uncertainty Quantification

基于能量分数的神经高斯混合模型用于预测不确定性量化

Yang Yang, Chunlin Ji, Haoyang Li, Ke Deng

机构 * Kuang-Chi Institute of Advanced Technology(光启高等理工研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出NE-GMM模型,结合高斯混合模型与能量分数,提升预测不确定性量化能力,通过理论证明和实验验证其有效性。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏