arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-06 至 2026-03-06 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 9 篇

2509.05609 2026-03-06 cs.CL cs.LG 81%

New Insights into Optimal Alignment of Acoustic and Linguistic Representations for Knowledge Transfer in ASR

对ASR中知识转移的声学与语言表示最优对齐的新见解

Xugang Lu, Peng Shen, Hisashi Kawai

机构 * National Institute of Information and Communications Technology, Japan(日本信息与通信技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于不平衡最优传输的对齐模型,用于改进ASR中声学与语言表示的对齐,提升知识转移效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04647 2026-03-06 cs.CL 79%

Coordinated Semantic Alignment and Evidence Constraints for Retrieval-Augmented Generation with Large Language Models

协同语义对齐与证据约束在大型语言模型检索增强生成中的应用

Xin Chen, Saili Uday Gadgil, Jiarong Qiu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出一种通过协同语义对齐与证据约束提升检索增强生成效果的方法,增强事实可靠性和生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17276 2026-03-06 cs.LG cs.CR cs.SY eess.SY 70%

Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems

打破和修复多智能体系统中针对控制流劫持的防御措施

Rishi Jha, Harold Triedman, Justin Wagle, Vitaly Shmatikov

机构 * Cornell University(康奈尔大学) Microsoft(微软公司)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出ControlValve防御机制,通过生成允许的控制流图和强制执行上下文规则,解决多智能体系统中控制流劫持攻击的安全性与功能性目标冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04805 2026-03-06 cs.CL cs.AI 62%

Attention's Gravitational Field:A Power-Law Interpretation of Positional Correlation

注意力的引力场:位置相关性的幂律解释

Edward Zhang

机构 * Edward Zhang 1(Edward Zhang)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04516 2026-03-06 cs.LG astro-ph.IM cs.AI 62%

Augmenting representations with scientific papers

用科学论文增强表示

Nicolò Oreste Pinciroli Vago, Rocco Di Tella, Carolina Cuesta-Lázaro, Michael J. Smith, Cecilia Garraffo, Rafael Martínez-Galarza

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。

Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 50%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18643 2026-03-06 cs.RO 50%

Least Restrictive Hyperplane Control Barrier Functions

最不严格的超平面控制屏障函数

Mattias Trende, Petter Ögren

机构 * Robotics, Perception and Learning Lab., School of Electrical Engineering and Computer Science, Royal Institute of Technology (KTH)(机器人感知与学习实验室,电气工程与计算机科学学院,皇家理工学院(KTH))

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种基于超平面的控制屏障函数,通过优化超平面取向以获得更保守的控制策略,从而在保持安全性的前提下允许更接近期望的控制动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03067 2026-03-06 cs.CV 50%

EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models

编辑:用于文本到图像扩散模型的有效且可解释的提示倒置

Mingzhe Li, Kejing Xia, Gehao Zhang, Zhenting Wang, Guanhong Tao, Siqi Pan, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) University of Utah(犹他大学) Dolby Laboratories(杜比实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出\sys技术,通过预训练模型初始化、潜在空间反向工程和嵌入到文本转换,提升文本到图像扩散模型的提示倒置效果,实现更高的图像相似性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18864 2026-03-06 cs.CV 50%

Flatness Guided Test-Time Adaptation for Vision-Language Models

基于平坦度引导的视觉-语言模型测试时适应

Aodi Li, Liansheng Zhuang, Xiao Long, Houqiang Li, Shafei Wang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) National Engineering Laboratory for Brain-Inspired Intelligence Technology and Applications, University of Science and Technology of China(中国科学技术大学脑启发式智能技术与应用国家工程实验室) Peng Cheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于平坦度引导的视觉-语言模型测试时适应框架,通过训练时的平坦最小值与测试时损失景观的对齐,提升模型在分布偏移下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏