arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-02 至 2026-03-02 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2402.08552 2026-03-02 cs.LG cs.CV 57%

Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy Biases

对抗扩散模型中的奖励过度优化:从归纳偏置和优先偏置的角度出发

Ziyi Zhang, Sen Zhang, Yibing Zhan, Yong Luo, Yonggang Wen, Dacheng Tao

机构 * Institute of Artificial Intelligence, School of Computer Science, Wuhan University, China Hubei Luojia Laboratory, Wuhan, China The University of Sydney, Australia JD Explore Academy, Beijing, China Nanyang Technological University, Singapore

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出TDPO-R算法,通过利用扩散模型的时间归纳偏置和抑制活跃神经元的优先偏置,有效缓解奖励过度优化问题。

Comments Accepted to ICML 2024

Journal ref International Conference on Machine Learning, pp. 60396-60413, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 11 篇

2602.23588 2026-03-02 cs.CV cs.AI cs.LG 81%

Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning

高维跨模态对齐冻结语言和图像模型以实现高效的图像描述生成

Abhishek Dalvi, Vasant Honavar

机构 * Artificial Intelligence Research Laboratory(人工智能研究实验室) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 HDFLIM通过冻结语言和图像模型的高维计算实现高效的图像描述生成,无需参数调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04398 2026-03-02 cs.CL 70%

Interpreting Transformers Through Attention Head Intervention

通过注意力头干预解读变换器

Mason Kadem, Rong Zheng

机构 * Computing and Software, Faculty of Engineering, McMaster University(工程学院计算机与软件系,麦斯特大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 通过注意力头干预方法,研究变换器的机理可解释性,实现对模型行为的定向控制,提升AI安全性和实用性。

Comments minor citation fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24174 2026-03-02 cs.CL cs.AI cs.IT math.IT 62%

Task-Centric Acceleration of Small-Language Models

面向任务的小型语言模型加速

Dor Tsur, Sharon Adar, Ran Levy

机构 * Amazon(亚马逊)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24081 2026-03-02 cs.LG cs.AI 62%

Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning

自适应相关加权内在奖励用于强化学习

Viet Bac Nguyen, Phuong Thai Nguyen

机构 * Institute for Artificial Intelligence(人工智能研究所) VNU-University of Engineering and Technology(越南工程与技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ACWI通过自适应相关加权内在奖励机制提升稀疏奖励强化学习中的探索效率和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23387 2026-03-02 cs.SD cs.AI cs.CL eess.AS 62%

Hello-Chat: Towards Realistic Social Audio Interactions

Hello-Chat: 向真实社交音频交互迈进

Yueran Hou, Peilei Jia, Zihan Sun, Qihang Lu, Wenbing Yang, Yingming Gao, Ya Li, Jun Gao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24183 2026-03-02 cs.CV cs.LG 57%

A multimodal slice discovery framework for systematic failure detection and explanation in medical image classification

一种用于医学图像分类中系统性故障检测和解释的多模态切片发现框架

Yixuan Liu, Kanwal K. Bhatia, Ahmed E. Fetit

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) Aival, London, UK(Aival,伦敦,英国)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 该研究提出了一种多模态切片发现框架,用于医学图像分类中的系统性故障检测与解释,展示了其在故障发现和解释生成方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24097 2026-03-02 cs.AI 57%

Bi-level RL-Heuristic Optimization for Real-world Winter Road Maintenance

双层强化学习启发式优化用于现实世界冬季道路维护

Yue Xie, Zizhen Xu, William Beazley, Fumiya Iida

机构 * School of Science, Loughborough University, UK(洛辛厄姆大学科学学院) Department of Engineering, University of Cambridge, UK(剑桥大学工程系) National Highways, 199 Wharfside St, Birmingham B1 1RN, UK(国家公路局)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究提出双层强化学习优化方法,用于高效解决现实世界冬季道路维护中的大规模路由问题,实现资源优化与排放降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06940 2026-03-02 cs.DB cs.AI 57%

VISTA: Knowledge-Driven Vessel Trajectory Imputation with Repair Provenance

VISTA: 基于知识的船舶轨迹补全与修复溯源

Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Tiancheng Zhang, Yushuai Li, Christian S. Jensen

机构 * Department of Computer Science, Aalborg University, Denmark(计算机科学系,奥胡斯大学,丹麦) School of Computer Science and Engineering, Northeastern University, Shenyang, China(计算机科学与工程学院,东北大学,沈阳,中国)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 VISTA通过基于知识的可解释方法实现船舶轨迹补全,生成修复溯源以提升下游决策的可信度和效率。

Comments 24 pages, 14 figures, 4 algorithms, 8 tables. Code available at https://github.com/hyLiu1994/VISTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23746 2026-03-02 cs.HC cs.CV 50%

Shape vs. Context: Examining Human--AI Gaps in Ambiguous Japanese Character Recognition

形状与上下文:考察人类与AI之间的模糊日文字符识别差距

Daichi Haraguchi

机构 * CyberAgent

专题命中 其他安全 :alignment(abstract)

AI总结 本研究通过比较人类与VLMs在模糊日文字符识别中的决策模式,揭示了形状上下文对人类与AI对齐的影响。

Comments Accepted to CHI 2026 Poster track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21778 2026-03-02 cs.CV 50%

From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors

从静态到动态:基于物理的图像编辑与潜在过渡先验

Liangbing Zhao, Le Zhuo, Sayak Paul, Hongsheng Li, Mohamed Elhoseiny

机构 * CUHK MMLab(香港中文大学多模态实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PhysicEdit,通过引入物理状态过渡和大规模数据集,提升图像编辑的物理真实性和知识引导能力,达到开源方法的新水平。

Comments All code, checkpoints, and datasets are available at https://liangbingzhao.github.io/statics2dynamics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV 50%

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏