arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-13 至 2026-07-13 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2607.09450 2026-07-13 cs.CV cs.LG 新提交 81%

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

通过测试时提示自适应增强视觉语言模型的鲁棒性

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

机构 * University of Science(科学大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science(香港科学大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究针对对抗扰动下视觉语言模型性能下降问题,提出RITA框架,通过最优传输实现分布级对齐,引入动态缓存积累线索,提升了模型对抗鲁棒性且不损干净准确率。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09349 2026-07-13 cs.CL cs.AI cs.LG 新提交 81%

Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation

欺骗性基础:临床检索增强生成中的实体归因失败

Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim

机构 * Lunit(鲁尼特)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究临床检索增强生成中的欺骗性基础问题,通过对13个模型测试发现DG率8%-87%,医学等微调模型高达86.7%。控制消融确定机制,实体归因验证可检测DG,现有框架未实施,为该领域研究提供新视角和方法。

Comments 24 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16515 2026-07-13 cs.CV cs.CR cs.LG 62%

Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations

精打细算,却愚弄像素:通过视觉对抗扰动在多模态智能体中绕过价格限制

Jiachen Qian, Zhaolu Kang

机构 * City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究发现多模态大语言模型在价格受限环境下易受视觉误导,提出PriceBlind攻击框架,通过语义解耦损失提升图像嵌入精度,实现80%的攻击成功率,并展示鲁棒编码和防御机制对攻击的抑制效果。

Comments 15 pages, 4 figures, 13 tables

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 16059-16073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19821 2026-07-13 cs.CV 版本更新 57%

LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition

LaCoVL-FER: 一种结合视觉-语言增强的地标引导对比学习网络用于面部表情识别

Jiaxin Wang, Muwei Jian, Hui Yu, Junyu Dong, Yifan Xia

机构 * School of Airspace and Engineering, Shandong University(山东大学航空航天与工程学院) School of Computer Science and Technology, Shandong University of Finance and Economics(山东财经大学计算机科学与技术学院) School of Psychology and Neuroscience, University of Glasgow(格拉斯哥大学心理学与神经科学学院) Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种结合视觉-语言增强的地标引导对比学习网络LaCoVL-FER,通过引入面部地标几何先验和视觉-语言模型语义先验,解决野生环境中面部表情识别的挑战,提升识别的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 6 篇

2607.09520 2026-07-13 cs.CV cs.AI 新提交 89%

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

眼见无需耗能,言语却要代价:揭示边缘视觉语言模型推理中的真正能量瓶颈

Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, Tengjiao He

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Jinan University(暨南大学)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究边缘VLM推理的能量瓶颈,通过系统能量分析发现平均推理功率恒定,输出令牌耗时多是关键,图像复杂度因输出长度影响能量,揭示视觉令牌修剪局限,控制输出长度能大幅节能。

Comments Accepted to ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08839 2026-07-13 cs.CV cs.LG 新提交 79%

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

混合探针:通过探针在多模态大语言模型中从特权模态学习

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。

Comments Preprint (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 73%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 73%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09365 2026-07-13 cs.RO 新提交 67%

PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation

PhysV2A:用于视频到机器人操作的可达性门控和语义掩码约束的可行性完成

Haohui Huang, Junda Duan, Tao Teng, Chenguang Yang

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 研究如何将视频衍生的6D对象运动转换为机器人可执行轨迹,提出PhysV2A框架,通过可达性门控选择和语义掩码约束细化可操作性,经真实机器人实验验证,该框架能提升任务成功率、减少运动可行性失败并产生更好轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21309 2026-07-13 cs.CV 版本更新 57%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 2 篇

2607.09029 2026-07-13 cs.CV 新提交 79%

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

MOSAIC:用于高效异构视觉语言模型的自适应层间组合

Yuncheng Yang, Feiyang Ye, Shixian Luo, Yinna Zhu, Lianlei Shan, Wangcai Zhao, Kuo Zhang, Yan Chen, Yong Wu, Yan Xie

机构 * LiAuto Inc.(理想汽车公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型中异构结构依赖手工静态混合模式的问题,提出硬件感知搜索方法MOSAIC,通过多目标混合整数规划确定最优配置,并引入两阶段参数恢复过程,提升了模型推理效率且降低训练成本。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 57%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏