arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 49 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 50%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 50%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2604.06912 2026-04-09 cs.CV cs.AI 81%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 文档图表理解 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01972 2026-04-09 cs.CV 57%

SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions

SDesc3D:面向布局感知的短描述驱动的3D室内场景生成

Jie Feng, Jiawei Shen, Junjia Huang, Junpeng Zhang, Mingtao Feng, Weisheng Dong, Guanbin Li

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出SDesc3D框架,通过多视角结构先验和区域功能暗示实现短描述驱动的3D室内场景生成,提升物理合理性和细节丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2507.22025 2026-04-09 cs.AI cs.CL cs.CV 84%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05477 2026-04-09 cs.RO 78%

Trust Through Transparency: Explainable Social Navigation for Autonomous Mobile Robots via Vision-Language Models

通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航

Oluwadamilola Sotomi, Devika Kodi, Aliasghar Arab

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)

AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。

Comments Submitted to IEEE Conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13200 2026-04-09 cs.HC 67%

Navig-AI-tion: Navigation by Contextual AI and Spatial Audio

导航-AI:通过上下文AI和空间音频进行导航

Mathias N. Lystbæk, Haley Adams, Ranjith Kagathi Ananda, Eric J Gonzalez, Luca Ballan, Qiuxuan Wu, Andrea Colaço, Peter Tan, Mar Gonzalez-Franco

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract)

AI总结 本文提出结合视觉语言模型与空间音频的导航系统,通过环境地标锚定指令并提供方向性空间音频信号,提升导航准确性与用户体验。

Comments 5 pages, 2 figures, to be published in Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 8 篇

2604.07034 2026-04-09 cs.RO cs.AI cs.CV 84%

KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis

KITE:基于关键帧的令牌化证据用于基于视觉语言模型的机器人故障分析

Mehdi Hosseinzadeh, King Hang Wong, Feras Dayoub

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 KITE通过将长机器人执行视频转化为紧凑可解释的令牌化证据,提升基于VLM的机器人故障检测与分析能力,尤其在模拟故障检测中表现优异。

Comments ICRA 2026; Project page: https://m80hz.github.io/kite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 79%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22451 2026-04-09 cs.CV cs.AI 73%

Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework

对抗过度依赖陷阱:通过自验证框架缓解LVLMs中的物体幻觉

Shiyu Liu, Xinyi Wen, Zhibin Lan, Ante Wang, Jinsong Su

专题命中 幻觉与鲁棒性 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自验证框架,通过验证生成描述中物体存在的可信度,缓解LVLMs中的物体幻觉问题,在图像描述任务中取得显著改进。

Comments Code is available at https://github.com/Liushiyu-0709/SelfVal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14735 2026-04-09 q-fin.CP cs.AI cs.CV 73%

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

PyFi: 通过对抗代理实现金字塔式金融图像理解的愿景语言模型

Yuqun Zhang, Yuxuan Zhao, Sijia Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Yantai Research Institute, Harbin Engineering University(哈尔滨工程大学烟台研究院)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 PyFi通过对抗代理生成的金字塔结构数据集,提升VLM在金融图像理解中的推理能力,实验显示模型在复杂金融问题上的准确率提升19.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06714 2026-04-09 cs.AI cs.CL cs.CV cs.LG 67%

Steering the Verifiability of Multimodal AI Hallucinations

操控多模态AI幻觉的可验证性

Jianhong Pang, Ruoxi Cheng, Ziyi Ye, Xingjun Ma, Zuxuan Wu, Xuanjing Huang, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究多模态AI幻觉的可验证性差异,提出基于激活空间的干预方法,通过区分明显和隐秘幻觉,实现对模型可验证性的精细控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 62%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06277 2026-04-09 cs.AI cs.CL cs.LG 62%

Weakly Supervised Distillation of Hallucination Signals into Transformer Representations

弱监督蒸馏 hallucination 信号到 Transformer 表示

Shoaib Sadiq Salehmohamed, Jinal Prashant Thakkar, Hansika Aredla, Shaik Mohammed Omar, Shalmali Ayachit

机构 * LLM Lens

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱监督框架,通过子串匹配、句子嵌入相似性和LLM判官信号,无需人工标注即可标注生成响应是否 grounded 或 hallucinated,并通过五种探针分类器验证 hallucination 信号可被蒸馏到 Transformer 表示中。

Comments 20 pages, 6 figures, 6 tables. Introduces a 15k-sample representation-level hallucination dataset with full transformer hidden states and multi-signal weak supervision. Evaluates 5 probing architectures and demonstrates internal hallucination detection without external inference-time signals. Includes held-out test evaluation and deployment benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06846 2026-04-09 cs.CL cs.AI 57%

MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors

MedDialBench:在参数对抗患者行为下评估LLM诊断鲁棒性的基准测试

Xiaotian Luo, Xun Jiang, Jiangcheng Wu

机构 * Shanda Group(盛大集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 MedDialBench通过控制患者行为维度,评估LLM在不同行为下的诊断鲁棒性,发现信息污染对准确率的影响大于信息缺失,且模型存在不同的脆弱性特征。

Comments 9 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 2 篇

2604.04563 2026-04-09 cs.CV cs.AI 62%

Temporal Inversion for Learning Interval Change in Chest X-Rays

时间倒置用于学习胸部X光片的区间变化

Hanbin Ko, Kyungmin Jeon, Doowoong Choi, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(首尔大学研究生院生物工程跨学科项目) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(首尔大学研究生院创新医学科学综合专业) Dept. of Radiology, Seoul National University Hospital(首尔大学医院放射科) Seoul National University College of Medicine(首尔大学医学院) Inst. of Medical and Biological Engineering, Seoul National University Medical Research Center(首尔大学医学研究中心医学与生物工程研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TILA框架,通过时间倒置增强模型对时间变化的敏感性,改进了胸部X光片的区间变化检测与分类。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV 57%

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 62%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07128 2026-04-09 cs.CV 57%

A Utility-preserving De-identification Pipeline for Cross-hospital Radiology Data Sharing

一种保持效用的跨医院放射学数据共享脱敏流程

Chenhao Liu, Zelin Wen, Yan Tong, Junjie Zhu, Xinyu Tian, Yuchi Liu, Ashu Gupta, Syed M. S. Islam, Tom Gedeon, Yue Yao

机构 * Shandong University(山东大学) Australian National University(澳大利亚国立大学) Hong Kong University of Science and Technology(香港科技大学) Curtin University(科廷大学) Edith Cowan University(埃迪斯科文大学) University of Western Australia(西澳大利亚大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种保持效用的脱敏流程,用于跨医院放射学数据共享,通过黑名单和白名单过滤机制,在保护隐私的同时保留诊断相关病理信息,实验证明其在诊断准确性上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏