arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-02 至 2026-03-02 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2602.24027 2026-03-02 cs.CV cs.MM 86%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(title)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24191 2026-03-02 cs.GT cs.AI cs.LO 57%

Resilient Strategies for Stochastic Systems: How Much Does It Take to Break a Winning Strategy?

随机系统中的稳健策略:打破获胜策略需要多大的代价?

Kush Grover, Markel Zubia, Debraj Chakraborty, Muqsit Azeem, Nils Jansen, Jan Kretinsky

机构 * Ruhr University Bochum Germany Nanyang Technological University, Singapore Technical University of Munich \& University of Konstanz Germany Ruhr University Bochum \& Radboud University Nijmegen Germany Masaryk University Czech Republic Ruhr University Bochum Technical University of Munich \& University of Konstanz Ruhr University Bochum \& Radboud University Nijmegen Masaryk University

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文研究了随机系统中稳健策略的定义与问题,探讨了马尔可夫决策过程和随机游戏中的可达性和安全目标,提出了一种基于干扰频率的稳健性度量方法。

Comments To appear in Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08448 2026-03-02 cs.LG 57%

Exploring Cross-model Neuronal Correlations in the Context of Predicting Model Performance and Generalizability

探索预测模型性能和泛化能力的跨模型神经元相关性

Haniyeh Ehsani Oskouie, Sajjad Ghiasvand, Lionel Levine, Majid Sarrafzadeh

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过跨模型神经元相关性评估模型性能和泛化能力,验证了表示对齐作为轻量级兼容性检查的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 50%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23109 2026-03-02 cs.RO 50%

Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios

迈向可解释的人机交互:一种主动推断方法用于遮挡行人场景

Kai Chen, Yuyao Huang, Guang Chen

机构 * Tongji University(同济大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出基于主动推断的方法,用于解决遮挡行人场景中的安全挑战,通过结合 RBPF 和 CEM 增强的 MPPI 控制器,实现可解释的人机交互。

Comments 14 pages, 6 figures, Proceedings of the 2026 ACM/IEEE International Conference on Human-Robot Interaction (HRI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏