arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-29 至 2026-04-29 共收录 44 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2603.14248 2026-04-29 cs.AI cs.CL 57%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 57%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 6 篇

2604.25102 2026-04-29 cs.CV 91%

One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations

一个扰动,两种失效模式:通过嵌入引导的字形扰动探测VLM安全性

Ravikumar Balakrishnan, Sanket Mendapara

机构 * Cisco Systems(思科系统)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV

AI总结 本文通过实证研究揭示多模态嵌入距离对VLM攻击成功率的预测作用,并提出基于嵌入引导的字形扰动方法,验证了可读性与安全对齐的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25884 2026-04-29 quant-ph cs.CV 85%

QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding

QCalEval:用于量子校准图理解的视觉-语言模型基准测试

Shuxiang Cao, Zijian Zhang, Abhishek Agarwal, Grace Bratrud, Niyaz R. Beysengulov, Daniel C. Cole, Alejandro Gómez Frieiro, Elena O. Glen, Hao Hsu, Gang Huang, Raymond Jow, Greshma Shaji, Tom Lubowe, Ligeng Zhu, Luis Mantilla Calderón, Nicola Pancotti, Joel Pendleton, Brandon Severin, Charles Etienne Staub, Sara Sussman, Antti Vepsäläinen, Neel Rajeshbhai Vora, Yilun Xu, Varinia Bernales, Daniel Bowring, Elica Kyoseva, Ivan Rungger, Giulia Semeghini, Sam Stanwyck, Timothy Costa, Alán Aspuru-Guzik, Krysta Svore

机构 * NVIDIA University of Toronto(多伦多大学) IQM Quantum Computers(IQM量子计算机) Lawrence Berkeley National Laboratory(伯克利国家实验室) Conductor Quantum(Conductor量子) National Physical Laboratory(国家物理实验室) Infleqtion Harvard University(哈佛大学) Fermi National Accelerator Laboratory(费米国家加速器实验室) Northwestern University(西北大学) EeroQ Corporation(EeroQ公司) Royal Holloway University of London(伦敦皇家霍洛威大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出QCalEval,首个用于评估视觉-语言模型理解量子校准图能力的基准测试,包含243个样本和87种场景类型,测试零样本和上下文学习下的六种问题类型,展示了不同模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25642 2026-04-29 cs.CV cs.AI 81%

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13302 2026-04-29 cs.CL 78%

Images Amplify Misinformation Sharing in Vision-Language Models

图像在视觉-语言模型中放大虚假信息的传播

Alice Plebe, Timothy Douglas, Diana Riazi, R. Maria del Rio-Chanona

机构 * Department of Industrial Engineering, University of Trento(特伦托大学工业工程系) Computer Science Department, University College London(伦敦大学学院计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了图像如何影响视觉-语言模型分享新闻内容的倾向,发现图像能提高虚假新闻的分享率,且不同模型对图像的反应存在差异。

Comments Accepted for oral presentation at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 62%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25110 2026-04-29 cs.LG cs.AI 62%

Knowledge Distillation Must Account for What It Loses

知识蒸馏必须考虑其失去的内容

Wenshuo Wang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文指出知识蒸馏需考虑其失去的内容,学生模型应不仅通过保留任务得分判断,还应保留教师能力以确保得分可靠性。提出蒸馏是教师行为的损失性投影,而非忠实复制,并提出场景特定的保留目标和蒸馏损失声明。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 4 篇

2604.20191 2026-04-29 cs.CV cs.AI cs.RO 82%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25255 2026-04-29 cs.CV 70%

Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

面向语音保留的面部表情操控的个性化跨模态情感相关学习

Tianshui Chen, Yujie Zhu, Jianman Lin, Zhijing Yang, Chunmei Qing, Feng Gao, Liang Lin

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Peking University(北京大学) Sun Yat-Sen University(中山大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出PCMECL算法,通过个性化提示和特征差分提升跨模态对齐,解决面部表情操控中情感操控的监督问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24921 2026-04-29 cs.RO cs.AI cs.CL cs.CV 62%

Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System

Libra-VLA:通过异步粗到细双系统实现学习平衡

Yifei Wei, Linqing Zhong, Yi Liu, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren

机构 * Beihang University(北航) AgiBot

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Libra-VLA通过粗到细双系统架构,解决视觉-语言-动作模型在机器人操作中语义与动作间的鸿沟问题,实现训练平衡与高效执行。

Comments Accepted to the Main Conference of ACL 2026. Project page: https://libra-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 57%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 2 篇

2502.02452 2026-04-29 cs.CV 79%

Personalization Toolkit: Training Free Personalization of Large Vision Language Models

个性化工具包:无需训练的大型视觉语言模型个性化

Soroush Seifi, Vaggelis Dorovatas, Matteo Cassinelli, Fabien Despinoy, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。

Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25361 2026-04-29 cs.CV 57%

HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation

HuM-Eval: 一种以人为中心的视频评估框架

Bingzi Zhang, Kaisi Guan, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出HuM-Eval框架,通过粗到细策略评估生成视频中的人体运动质量,实验显示其在人体相关性上达到58.2%的平均值,优于现有方法。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏