arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2603.21149 2026-03-27 cs.SE cs.AI cs.MA 83%

Emergent Formal Verification: How an Autonomous AI Ecosystem Independently Discovered SMT-Based Safety Across Six Domains

涌现形式验证:自主AI生态系统如何在六个领域独立发现基于SMT的安全性

Octavian Untila

机构 * Aisophical SRL

专题命中 其他安全 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 自主AI生态系统在无显式形式方法指令下,独立在六个AI安全领域发现SMT求解器的应用,提出统一框架实现100%准确验证。

Comments 10 pages, 3 figures, 5 tables. Code: https://github.com/octavuntila-prog/substrate-guard. Companion paper: https://doi.org/10.5281/zenodo.19157571

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25499 2026-03-27 cs.CV cs.LG 79%

Knowledge-Guided Failure Prediction: Detecting When Object Detectors Miss Safety-Critical Objects

基于知识的故障预测:检测对象检测器何时错过安全关键对象

Jakob Paul Zimmermann, Gerrit Holzbach, David Lerch

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Fraunhofer IOSB(弗劳恩霍夫光电、系统技术及图像处理研究所)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文提出KGFP框架,通过检测内部特征与视觉基础模型嵌入之间的语义偏差来识别对象检测器的故障,提升安全关键对象的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25460 2026-03-27 cs.SD 71%

CLAR: CIF-Localized Alignment for Retrieval-Augmented Speech LLM-Based Contextual ASR

CLAR:基于检索增强的语音大语言模型的上下文语音识别中的CIF局部对齐

Shangkun Huang, Huan Shen, Wei Zou, Yunzhang Chen

机构 * BRVoice Team, Bairong, Inc., China(BRVoice团队,百融云创,中国)

专题命中 其他安全 :alignment(title)

AI总结 CLAR通过CIF学习单调性token级对齐,提升语音识别中专有名词和长尾词的识别效果,减少表示稀释和注意力漂移,提高检索准确率。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24736 2026-03-27 cs.AI cs.LG 62%

AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation

AutoSAM:一种用于自动化生成SAM代码输入文件的代理框架,结合多模态检索增强生成

Zaid Abulawi, Zavier Ndum Ndum, Eric Cervi, Rui Hu, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University. Engineering Division, Argonne National Laboratory

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 AutoSAM通过多模态检索增强生成技术,自动化生成SAM代码输入文件,解决异构工程文档中提取设计数据并转换为求解器语法的难题,实现100%结构化输入利用和88%PDF文本提取。

Comments 34 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19102 2026-03-27 cs.LG 57%

OWLEYE: Zero-Shot Learner for Cross-Domain Graph Data Anomaly Detection

OWLEYE:跨域图数据异常检测的零样本学习者

Lecheng Zheng, Dongqi Fu, Zihao Li, Jingrui He

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 OWLEYE提出一种跨域图数据异常检测框架,通过跨域特征对齐模块、多域多模式字典学习和截断注意力重构模块,实现零样本学习和持续学习能力,提升异常检测性能与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05696 2026-03-27 cs.LG q-bio.QM 57%

SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型

Bohao Xu, Yingzhou Lu, Chenhao Li, Ling Yue, Xiao Wang, Tianfan Fu, Minjie Shen, Lulu Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25091 2026-03-27 cs.CV cs.AI 57%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 57%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08881 2026-03-27 cs.CV cs.AI 57%

TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

TAG-MoE:基于任务的门控用于统一的生成混合专家

Yu Xu, Hongbin Yan, Juan Cao, Yiji Cheng, Tiankai Hang, Runze He, Zijin Yin, Shiyi Zhang, Yuxin Zhang, Jintao Li, Chunyu Wang, Qinglin Lu, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文言) National Cheng-Kung University(国立成功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出TAG-MoE框架,通过引入层次化任务语义标注方案和预测对齐正则化,解决密集扩散变换器架构中任务干扰问题,提升生成质量和保真度。

Comments Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03983 2026-03-27 cs.SD eess.AS 50%

MiDashengLM: Efficient Audio Understanding with General Audio Captions

MiDashengLM:通过通用音频字幕实现高效的音频理解

Heinrich Dinkel, Gang Li, Jizhong Liu, Jian Luan, Yadong Niu, Xingwei Sun, Tianzi Wang, Qiyang Xiao, Junbo Zhang, Jiahao Zhou

机构 * MiLM Plus Xiaomi Inc.(小米公司)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MiDashengLM,一个基于通用音频字幕的开放音频语言模型,通过ACAVCaps数据集实现高效且全面的音频理解,提升透明度和可重复性,并提供更快的推理速度和更高的吞吐量。

Comments Added ACAVCaps reference (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏