arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-16 至 2026-03-16 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2603.12799 2026-03-16 cs.CV 83%

What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models

什么使视觉语言模型具备鲁棒性?迈向视觉语言模型鲁棒性与准确性的协调

Sen Nie, Jie Zhang, Zhongqi Wang, Zhaoyang Wei, Shiguang Shan, Xilin Chen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型鲁棒性与准确性的平衡问题,通过分析对抗性微调模型,发现鲁棒性主要集中在浅层网络,提出Adversarial Robustness Adaptation框架以提升鲁棒性与准确性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03627 2026-03-16 cs.CL cs.AI 74%

Partially Recentralization Softmax Loss for Vision-Language Models Robustness

部分重校正softmax损失用于视觉-语言模型鲁棒性

Hao Wang, Jinzhe Jiang, Xin Zhang, Chen Li

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本文提出部分重校正softmax损失,通过限制top K softmax输出提升预训练多模态模型的对抗鲁棒性,实验显示细调后模型对主流攻击更具鲁棒性。

Comments The study described in Section 4 was conducted without required institutional review board approval. The paper is withdrawn pending completion of the approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14099 2026-03-16 cs.CV cs.AI 73%

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

FAPE-IR:面向全场景图像修复的频率感知规划与执行框架

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji

机构 * Tianjin University(天津大学) University of Macau(澳门大学) City University of Hong Kong(香港城市大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09217 2026-03-16 cs.CV 57%

TubeMLLM: A Foundation Model for Topology Knowledge Exploration in Vessel-like Anatomy

TubeMLLM:一种用于血管状解剖拓扑知识探索的基础模型

Yaoyu Liu, Minghui Zhang, Xin You, Hanxiao Zhang, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TubeMLLM,结合结构理解与可控生成,提升医学血管状解剖的拓扑感知能力,并通过TubeMData基准和自适应损失策略实现跨模态迁移。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏