arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 136 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2603.13301 2026-03-17 cs.IR cs.AI cs.LG 62%

Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval

并非所有查询都需要重写:当仅提示的LLM细化在密集检索中帮助和损害时

Varun Kotte

机构 * Adobe(Adobe公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了仅提示的LLM查询重写对密集检索的影响,发现其效果高度依赖领域,通过实验发现重写在不同数据集上产生不同效果,并指出领域适应性后训练比单纯重写更安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15518 2026-03-17 cs.CL 57%

Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models

超越协方差陷阱:在大型语言模型中解锁同一主体知识编辑的泛化能力

Xiyu Liu, Qingyi Si, Zhengxiao Liu, Chenxu Yang, Naibin Gu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文针对大型语言模型在同一主体知识编辑中泛化能力不足的问题,提出RoSE方法,通过几何对齐和知识整合提升指令遵循能力。

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00552 2026-03-17 cs.AI 57%

EMPA: Evaluating Persona-Aligned Empathy as a Process

EMPA:评估基于角色的共情作为过程

Shiya Zhang, Yuhan Zhan, Ruixi Su, Ruihan Sun, Ziyi Song, Zhaohan Chen, Xiaofan Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出EMPA框架,通过可控心理场景和多智能体沙盒评估持续干预而非孤立回复,以提升对话代理的共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 57%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13876 2026-03-17 cs.MA cs.CY 57%

How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation

角色榜样如何塑造集体道德?多智能体模拟中的范例驱动道德学习

Junjie Liao, Huacong Tang, Zhou Ziheng, Yizhou Wang, Fangwei Zhong

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文通过多智能体模拟研究角色榜样对集体道德的影响,发现身份驱动的从众行为能迅速改变初始倾向,推动价值观趋同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13344 2026-03-17 cs.AI 57%

DyACE: Dynamic Algorithm Co-evolution for Online Automated Heuristic Design with Large Language Model

DyACE:动态算法共进化用于大规模语言模型在线自动启发式设计

Guidong Lu, Yiping Liu, Xiangxiang Zeng

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出DyACE,通过动态算法共进化解决在线自动启发式设计中固定算法无法适应搜索动态的问题,利用大语言模型进行实时感知反馈,提升高维搜索空间的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 57%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 57%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15073 2026-03-17 math.DS 50%

The Evolution of Computer-Assisted Proof In Analysis

计算机辅助证明在分析中的演变

Marek Rychlik

专题命中 其他安全 :safety(abstract)

AI总结 本文研究了在神经ODEs和物理信息神经网络中,数值方法如何通过Heun方法导致拓扑分岔,从而产生虚假吸引子,并通过计算机辅助证明验证了稳定性的框架。

Comments 14 pages, 4 figures, 1 code listing, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14411 2026-03-17 eess.SY cs.SY 50%

A Comprehensive Survey of Redundancy Systems with a Focus on Triple Modular Redundancy (TMR)

一种冗余系统的全面综述:以三模冗余(TMR)为重点

Lukas Flad, Mark Leyer, Felix Sebastian Nitz, Tobias Krawutschke

专题命中 其他安全 :safety(abstract)

AI总结 本文综述了冗余系统,重点分析了三模冗余,提出统一的分类方法,并探讨了冗余策略的实用权衡及未来研究方向。

Comments 33 Pages, 7 Figures, under review in ACM Computing Survay

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13999 2026-03-17 cs.SE 50%

ReqToCode: Embedding Requirements Traceability as a Structural Property of the Codebase

ReqToCode:将需求可追溯性作为代码库的结构属性进行嵌入

Thorsten Schlathölter

专题命中 其他安全 :safety(abstract)

AI总结 本文提出ReqToCode方法,通过将可追溯性元素直接嵌入代码库,使可追溯性成为编译时可验证的系统属性,而非外部文档任务。

Comments 23 pages. Preprint. Not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09586 2026-03-17 cs.CV 50%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08741 2026-03-17 cs.CV 50%

HieraRS: A Hierarchical Segmentation Paradigm for Remote Sensing Enabling Multi-Granularity Interpretation and Cross-Domain Transfer

HieraRS: 一种用于遥感的分层分割范式,实现多粒度解释和跨领域迁移

Tianlong Ai, Tianzhu Liu, Haochen Jiang, Yanfeng Gu

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出HieraRS分层分割范式,解决现有方法在多粒度预测和跨领域迁移中的不足,引入BHCCM机制提升语义一致性,提出TransLU框架支持动态类别扩展,并构建MM-5B多模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 50%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 其他安全 :alignment(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13890 2026-03-17 cs.MA 50%

Beyond Self-Interest: Modeling Social-Oriented Motivation for Human-like Multi-Agent Interactions

超越自我利益:为类人多智能体交互建模社会导向动机

Jingzhe Lin, Ceyao Zhang, Yaodong Yang, Yizhou Wang, Song-Chun Zhu, Fangwei Zhong

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出ASVO智能体,通过整合欲望驱动自主性与社会价值导向理论,实现类人多智能体交互中的社会导向动机建模,提升行为自然性和人类拟真性。

Comments 9 pages, 6 figures. Accepted to AAMAS 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏