arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 31 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2603.14417 2026-03-17 cs.CY cs.AI cs.CL cs.LG 85%

Questionnaire Responses Do not Capture the Safety of AI Agents

问卷回复无法捕捉AI代理的安全性

Max Hellrigel-Holderbaum, Edward James Young

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文指出问卷式评估无法准确衡量AI代理的安全性,因LLM在情景中的表现与实际代理行为存在差异,导致评估方法缺乏有效性。

Comments 31 pages, 11 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15364 2026-03-17 cs.AI cs.CL 81%

CRASH: Cognitive Reasoning Agent for Safety Hazards in Autonomous Driving

CRASH:面向自动驾驶安全隐患的认知推理代理

Erick Silva, Rehana Yasmin, Ali Shoker

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科技大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRASH,一种基于大语言模型的自动驾驶安全隐患分析工具,通过自动化处理事故报告,识别事故原因并评估自动驾驶系统对事故的影响,验证其在事故分析中的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 81%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 81%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 78%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 78%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 78%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 其他安全 :alignment(title,abstract)

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21262 2026-03-17 cs.CL cs.LG cs.MA 73%

Under the Influence: Quantifying Persuasion and Vigilance in Large Language Models

受其影响:量化大型语言模型中的说服力与警觉性

Sasha Robinson, Katherine M. Collins, Ilia Sucholutsky, Kelsey R. Allen

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了大型语言模型在说服和警觉性方面的表现,发现其在任务执行中存在独立的能力差异,强调需单独监控这三个方面以保障AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 67%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 67%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 67%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15547 2026-03-17 cs.CL cs.AI cs.HC 62%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15183 2026-03-17 cs.DC cs.AI cs.LG cs.MA 62%

Token Coherence: Adapting MESI Cache Protocols to Minimize Synchronization Overhead in Multi-Agent LLM Systems

令牌一致性:适应MESI缓存协议以最小化多智能体大语言模型系统中的同步开销

Vladyslav Parakhin

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出令牌一致性理论,通过将MESI协议应用于多智能体系统,减少同步开销,验证了在多智能体大语言模型中同步成本与缓存一致性问题的对应关系,并通过形式化验证协议确保安全性与一致性。

Comments 25 pages. Code and reproduction scripts at https://github.com/hipvlady/agent-coherence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06107 2026-03-17 cs.CL cs.AI cs.CE 62%

Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models

分布语义追踪:一种解释大语言模型幻觉的框架

Gagan Bhatia, Somayajulu G Sripada, Kevin Allan, Jacobo Azcona

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分布语义追踪框架,通过解码残差流状态构建语义图谱,揭示大语言模型幻觉源于表征漂移,通过轻量因果追踪验证假设,实验显示其解释效果优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13301 2026-03-17 cs.IR cs.AI cs.LG 62%

Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval

并非所有查询都需要重写:当仅提示的LLM细化在密集检索中帮助和损害时

Varun Kotte

机构 * Adobe(Adobe公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了仅提示的LLM查询重写对密集检索的影响,发现其效果高度依赖领域,通过实验发现重写在不同数据集上产生不同效果,并指出领域适应性后训练比单纯重写更安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15518 2026-03-17 cs.CL 57%

Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models

超越协方差陷阱:在大型语言模型中解锁同一主体知识编辑的泛化能力

Xiyu Liu, Qingyi Si, Zhengxiao Liu, Chenxu Yang, Naibin Gu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文针对大型语言模型在同一主体知识编辑中泛化能力不足的问题,提出RoSE方法,通过几何对齐和知识整合提升指令遵循能力。

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00552 2026-03-17 cs.AI 57%

EMPA: Evaluating Persona-Aligned Empathy as a Process

EMPA:评估基于角色的共情作为过程

Shiya Zhang, Yuhan Zhan, Ruixi Su, Ruihan Sun, Ziyi Song, Zhaohan Chen, Xiaofan Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出EMPA框架,通过可控心理场景和多智能体沙盒评估持续干预而非孤立回复,以提升对话代理的共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 57%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13876 2026-03-17 cs.MA cs.CY 57%

How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation

角色榜样如何塑造集体道德?多智能体模拟中的范例驱动道德学习

Junjie Liao, Huacong Tang, Zhou Ziheng, Yizhou Wang, Fangwei Zhong

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文通过多智能体模拟研究角色榜样对集体道德的影响,发现身份驱动的从众行为能迅速改变初始倾向,推动价值观趋同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13344 2026-03-17 cs.AI 57%

DyACE: Dynamic Algorithm Co-evolution for Online Automated Heuristic Design with Large Language Model

DyACE:动态算法共进化用于大规模语言模型在线自动启发式设计

Guidong Lu, Yiping Liu, Xiangxiang Zeng

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出DyACE,通过动态算法共进化解决在线自动启发式设计中固定算法无法适应搜索动态的问题,利用大语言模型进行实时感知反馈,提升高维搜索空间的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 57%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 57%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15073 2026-03-17 math.DS 50%

The Evolution of Computer-Assisted Proof In Analysis

计算机辅助证明在分析中的演变

Marek Rychlik

专题命中 其他安全 :safety(abstract)

AI总结 本文研究了在神经ODEs和物理信息神经网络中,数值方法如何通过Heun方法导致拓扑分岔,从而产生虚假吸引子,并通过计算机辅助证明验证了稳定性的框架。

Comments 14 pages, 4 figures, 1 code listing, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14411 2026-03-17 eess.SY cs.SY 50%

A Comprehensive Survey of Redundancy Systems with a Focus on Triple Modular Redundancy (TMR)

一种冗余系统的全面综述:以三模冗余(TMR)为重点

Lukas Flad, Mark Leyer, Felix Sebastian Nitz, Tobias Krawutschke

专题命中 其他安全 :safety(abstract)

AI总结 本文综述了冗余系统,重点分析了三模冗余,提出统一的分类方法,并探讨了冗余策略的实用权衡及未来研究方向。

Comments 33 Pages, 7 Figures, under review in ACM Computing Survay

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13999 2026-03-17 cs.SE 50%

ReqToCode: Embedding Requirements Traceability as a Structural Property of the Codebase

ReqToCode:将需求可追溯性作为代码库的结构属性进行嵌入

Thorsten Schlathölter

专题命中 其他安全 :safety(abstract)

AI总结 本文提出ReqToCode方法,通过将可追溯性元素直接嵌入代码库,使可追溯性成为编译时可验证的系统属性,而非外部文档任务。

Comments 23 pages. Preprint. Not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09586 2026-03-17 cs.CV 50%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08741 2026-03-17 cs.CV 50%

HieraRS: A Hierarchical Segmentation Paradigm for Remote Sensing Enabling Multi-Granularity Interpretation and Cross-Domain Transfer

HieraRS: 一种用于遥感的分层分割范式,实现多粒度解释和跨领域迁移

Tianlong Ai, Tianzhu Liu, Haochen Jiang, Yanfeng Gu

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出HieraRS分层分割范式,解决现有方法在多粒度预测和跨领域迁移中的不足,引入BHCCM机制提升语义一致性,提出TransLU框架支持动态类别扩展,并构建MM-5B多模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 50%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 其他安全 :alignment(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏