arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-01 至 2026-05-01 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 3 篇

2604.27414 2026-05-01 cs.CV cs.CR cs.LG 86%

Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Mert D. Pese

机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。

Comments 9 pages, 2 figures. Accepted at SAE WCX 2026

Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02671 2026-05-01 cs.CV 84%

Test-Time Distillation for Continual Model Adaptation

测试时蒸馏用于持续模型适应

Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen Technology University(深圳技术大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoDiRe框架,通过动态融合VLM和目标模型预测构建鲁棒教师,利用MSP缓解熵偏见,通过最优传输对齐预测,实现稳定持续适应,优于现有方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26327 2026-05-01 eess.AS 50%

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

Dual-LoRA: 交叉语言说话人验证中的参数高效对抗解缠

Qituan Shangguan, Junhao Du, Kunyang Peng, Feng Xue, Hui Zhang, Xinsheng Wang, Kai Yu, Shuai Wang

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出Dual-LoRA,通过注入可训练任务因子化LoRA适配器解决交叉语言说话人验证中的语言-说话人纠缠问题,采用语言锚定对抗器提升说话人区分度。

Comments Submitted to Interspeech 2026; 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏