arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-06 至 2026-03-06 共收录 51 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2603.04405 2026-03-06 cs.CV cs.AI cs.LG 62%

Lost in Translation: How Language Re-Aligns Vision for Cross-Species Pathology

迷失在翻译中:语言如何重新对齐视觉以实现跨物种病理学

Ekansh Arora

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯·杰弗里斯高中科学与技术学校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入语义锚定机制,利用语言对齐解决跨物种病理学中的视觉-语言对齐问题,提升模型在跨物种任务中的性能。

Comments 27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 61%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05423 2026-03-06 cs.LG 57%

An interpretable prototype parts-based neural network for medical tabular data

可解释的原型部件基于神经网络用于医疗表格数据

Jacek Karolczak, Jerzy Stefanowski

机构 * Poznan University of Technology, Institute of Computing Science(波兹南技术大学计算科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种可解释的原型部件基于神经网络,用于医疗表格数据,通过可训练的特征片段学习有意义的原型部件,实现可解释的预测和临床决策支持。

Comments Proc. of EXPLIMED at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 57%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04815 2026-03-06 cs.AI 57%

EchoGuard: An Agentic Framework with Knowledge-Graph Memory for Detecting Manipulative Communication in Longitudinal Dialogue

EchoGuard: 一种基于知识图谱记忆的代理框架,用于检测纵向对话中的操纵性沟通

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir, Ananth Kandala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 EchoGuard通过知识图谱记忆和结构化循环检测纵向对话中的操纵性沟通,提升个体识别能力与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01919 2026-03-06 cs.CR cs.AI cs.SE 57%

Real Money, Fake Models: Deceptive Model Claims in Shadow APIs

真实的钱,假的模型:影子API中的欺骗性模型声明

Yage Zhang, Yukun Jiang, Zeyuan Chen, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文首次系统审计官方LLM API与影子API,揭示了影子API在性能、安全性和身份验证方面的欺骗行为,影响科研可重复性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05386 2026-03-06 cs.CV 50%

Fusion-CAM: Integrating Gradient and Region-Based Class Activation Maps for Robust Visual Explanations

融合-CAM:整合梯度和基于区域的类别激活图以实现稳健的视觉解释

Hajar Dekdegue, Moncef Garouani, Josiane Mothe, Jordan Bernigaud

机构 * IRIT, UMR5505 CNRS Université de Toulouse(IRIT,CNRS,Université de Toulouse) INRAE, Centre Occitanie-Toulouse Unité Expérimentale APC(INRAE,Centre Occitanie-Toulouse,Unité Expérimentale APC)

专题命中 安全评测 :trustworthy(abstract)

AI总结 Fusion-CAM通过整合梯度和基于区域的类别激活图,提供更稳健和判别的视觉解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03037 2026-03-06 cs.RO 50%

A Bi-directional Adaptive Framework for Agile UAV Landing

双向自适应框架用于敏捷无人机着陆

Chunhui Zhao, Xirui Kao, Yilin Lu, Yang Lyu

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出双向自适应框架,通过重新定义车辆与平台的角色,实现敏捷无人机着陆的高效、精确与鲁棒性提升。

Comments This work has been submitted to the IEEE Robotics and Automation Letters (RA-L) for possible publication

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 50%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2510.13900 2026-03-06 cs.CL cs.AI 73%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 57%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 9 篇

2509.05609 2026-03-06 cs.CL cs.LG 81%

New Insights into Optimal Alignment of Acoustic and Linguistic Representations for Knowledge Transfer in ASR

对ASR中知识转移的声学与语言表示最优对齐的新见解

Xugang Lu, Peng Shen, Hisashi Kawai

机构 * National Institute of Information and Communications Technology, Japan(日本信息与通信技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于不平衡最优传输的对齐模型,用于改进ASR中声学与语言表示的对齐,提升知识转移效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04647 2026-03-06 cs.CL 79%

Coordinated Semantic Alignment and Evidence Constraints for Retrieval-Augmented Generation with Large Language Models

协同语义对齐与证据约束在大型语言模型检索增强生成中的应用

Xin Chen, Saili Uday Gadgil, Jiarong Qiu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出一种通过协同语义对齐与证据约束提升检索增强生成效果的方法,增强事实可靠性和生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17276 2026-03-06 cs.LG cs.CR cs.SY eess.SY 70%

Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems

打破和修复多智能体系统中针对控制流劫持的防御措施

Rishi Jha, Harold Triedman, Justin Wagle, Vitaly Shmatikov

机构 * Cornell University(康奈尔大学) Microsoft(微软公司)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出ControlValve防御机制,通过生成允许的控制流图和强制执行上下文规则,解决多智能体系统中控制流劫持攻击的安全性与功能性目标冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04805 2026-03-06 cs.CL cs.AI 62%

Attention's Gravitational Field:A Power-Law Interpretation of Positional Correlation

注意力的引力场:位置相关性的幂律解释

Edward Zhang

机构 * Edward Zhang 1(Edward Zhang)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04516 2026-03-06 cs.LG astro-ph.IM cs.AI 62%

Augmenting representations with scientific papers

用科学论文增强表示

Nicolò Oreste Pinciroli Vago, Rocco Di Tella, Carolina Cuesta-Lázaro, Michael J. Smith, Cecilia Garraffo, Rafael Martínez-Galarza

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。

Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 50%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18643 2026-03-06 cs.RO 50%

Least Restrictive Hyperplane Control Barrier Functions

最不严格的超平面控制屏障函数

Mattias Trende, Petter Ögren

机构 * Robotics, Perception and Learning Lab., School of Electrical Engineering and Computer Science, Royal Institute of Technology (KTH)(机器人感知与学习实验室,电气工程与计算机科学学院,皇家理工学院(KTH))

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种基于超平面的控制屏障函数,通过优化超平面取向以获得更保守的控制策略,从而在保持安全性的前提下允许更接近期望的控制动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03067 2026-03-06 cs.CV 50%

EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models

编辑:用于文本到图像扩散模型的有效且可解释的提示倒置

Mingzhe Li, Kejing Xia, Gehao Zhang, Zhenting Wang, Guanhong Tao, Siqi Pan, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) University of Utah(犹他大学) Dolby Laboratories(杜比实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出\sys技术,通过预训练模型初始化、潜在空间反向工程和嵌入到文本转换,提升文本到图像扩散模型的提示倒置效果,实现更高的图像相似性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18864 2026-03-06 cs.CV 50%

Flatness Guided Test-Time Adaptation for Vision-Language Models

基于平坦度引导的视觉-语言模型测试时适应

Aodi Li, Liansheng Zhuang, Xiao Long, Houqiang Li, Shafei Wang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) National Engineering Laboratory for Brain-Inspired Intelligence Technology and Applications, University of Science and Technology of China(中国科学技术大学脑启发式智能技术与应用国家工程实验室) Peng Cheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于平坦度引导的视觉-语言模型测试时适应框架,通过训练时的平坦最小值与测试时损失景观的对齐,提升模型在分布偏移下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏