arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-19 至 2026-03-19 共收录 68 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 25 篇

2603.17746 2026-03-19 cs.CV 57%

Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation

概念到像素:无提示通用医学图像分割

Haoyun Chen, Fenghe Tang, Wenxin Ma, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China (USTC), Hefei, Anhui 230026, China Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu 215123, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China State Key Laboratory of Precision

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出C2P框架,通过分离解剖学知识为几何和语义表示,利用多模态大语言模型生成语义令牌,并引入几何令牌约束,实现无提示的通用医学图像分割,实验表明其在多种模态和数据集上表现优异。

Comments 32 pages, code is available at: https://github.com/Yundi218/Concept-to-Pixel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06313 2026-03-19 cs.CV 57%

WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection

WMoE-CLIP:小波增强的专家混合提示学习用于零样本异常检测

Peng Chen, Chao Huang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen(中山大学深圳校区计算机科学与技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出WMoE-CLIP方法,通过小波分解提取多频图像特征并结合变分自编码器提升提示适应性,引入语义感知的专家混合模块,有效提升零样本异常检测性能。

Journal ref ICASSP 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17540 2026-03-19 cs.IR cs.LG 57%

Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify

在Spotify上部署基于语义ID的生成检索用于大规模播客发现

Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett

机构 * Spotify

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出GLIDE模型,通过语义ID实现播客推荐,结合语义、上下文和用户状态,提升用户发现新播客和非习惯性流媒体体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 57%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17357 2026-03-19 cs.CR cs.AI 57%

WebPII: Benchmarking Visual PII Detection for Computer-Use Agents

WebPII:用于计算机使用代理的视觉个人身份信息检测基准测试

Nathan Zhao

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出WebPII基准测试,用于评估计算机使用代理中的视觉PII检测。该基准测试包含44,865个标注的电商UI图像,设计了三个关键特性:扩展的PII分类、前瞻性检测和可扩展的生成方法。实验表明,这些设计提高了在不同界面中的检测能力和对新页面类型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17063 2026-03-19 cs.AI 57%

Transformers are Bayesian Networks

Transformer 是贝叶斯网络

Gregory Coppola

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文证明Transformer本质上是贝叶斯网络,通过五种方式展示了其与信念传播的联系,并验证了其在概率估计和推理中的正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16875 2026-03-19 cs.HC cs.AI 57%

Attention Guidance through Video Script: A Case Study of Object Focusing on 360° VR Video Tours

通过视频脚本进行注意力引导:360°VR视频导览中物体聚焦的案例研究

Paulo Vitor Santana Silva, Arthur Ricardo Sousa Vitória, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * AKCIT Federal University of Goiás(戈亚斯联邦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过结合Grounding Dino和Segment Anything模型,利用视频脚本引导用户注意力,提升360°VR视频导览的用户体验。

Journal ref SVR 2024: Proceedings of the 26th Symposium on Virtual and Augmented Reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17806 2026-03-19 cs.HC 50%

Building a "-Sensitive Design" Methodology from Political Philosophies or Ideologies

从政治哲学或意识形态构建‘-敏感设计’方法论

Anthony Maocheia-Ricci, Edith Law

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出‘-敏感设计’方法论,结合政治或意识形态价值规范设计过程,通过依赖敏感设计实例展示其应用,并呼吁拓展哲学与设计结合的研究领域。

Comments Position paper for the CHIdeology workshop at CHI 2026, Barcelona. https://ideologies.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17659 2026-03-19 cs.SE 50%

From Symbol to Meaning: Ontological and Philosophical Reflections on Large Language Models in Information Systems Engineering

从符号到意义:关于大语言模型在信息系统工程中的本体论与哲学反思

José Palazzo Moreira de Oliveira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 大语言模型标志着信息系统工程理论基础的转折点,本文探讨其如何重构语言、意义与系统设计的关系,强调需建立透明且伦理一致的框架以尊重人类中心的知识过程。

Comments This paper constitutes a substantially extended version of a conference article to be published in the proceedings of the International Conference on Enterprise Information Systems ICEIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2603.18001 2026-03-19 cs.CV 57%

EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding

EchoGen:基于循环一致性的统一布局-图像生成与理解学习

Kai Zou, Hongbo Liu, Dian Zheng, Jianxiong Gao, Zhiwei Zhao, Bin Liu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Tongji University(同济大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出EchoGen框架,通过统一模型联合训练布局到图像生成和图像定位任务,提升生成图像的布局准确性与文本描述一致性,同时增强图像定位的鲁棒性。

Comments 9 pages, Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(16), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2603.17712 2026-03-19 cs.RO cs.CV 70%

AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation

AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略

Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出AERR-Nav框架,通过自适应探索-恢复-回忆策略和自适应探索状态,解决零样本物体导航中探索与利用的平衡问题,在HM3D和MP3D基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17850 2026-03-19 cs.RO 67%

ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models

ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型

Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国) School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 ProbeFlow通过动态调度积分步骤减少冗余网络计算,提升动作解码效率和系统延迟,保持动作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17670 2026-03-19 cs.RO 67%

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV 57%

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 8 篇

2603.17372 2026-03-19 cs.CV cs.AI 84%

Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift

通过与劫持相关的表示转移理解并防御VLM劫持

Zhihua Wei, Qiang Li, Jian Ruan, Zhenxin Qin, Leilei Wen, Dongrui Liu, Wen Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究VLM在视觉模态整合后安全对齐减弱的问题,发现劫持样本在表示空间中形成独特状态,提出通过移除劫持相关转移提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13293 2026-03-19 cs.CV eess.IV 83%

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17111 2026-03-19 cs.CV cs.AI 81%

Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles

隐藏克隆:揭示并修复视觉-语言模型集成中的家族偏见

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型集成中同家族模型的关联误差问题,提出三种家族感知方法,通过层级家族投票、QualRCCV和学得候选评分,提升了集成性能并验证了方法的泛化能力。

Comments 15 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25620 2026-03-19 cs.CV 79%

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

机构 * School of Medicine, Yale University(耶鲁大学医学院) School of Computing, Australian National University(澳大利亚国立大学计算机学院) School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。

Comments ACM Transactions on Computing for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 67%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17683 2026-03-19 cs.AI cs.LG 62%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 62%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04893 2026-03-19 cs.CV cs.AI 62%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 14 篇

2603.17809 2026-03-19 cs.CV cs.AI 84%

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16987 2026-03-19 cs.CV cs.AI 84%

Empirical Recipes for Efficient and Compact Vision-Language Models

高效紧凑视觉-语言模型的实证配方

Jiabo Huang, Zhizhong Li, Sina Sajadmanesh, Weiming Zhuang, Lingjuan Lyu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过实证分析识别了紧凑视觉-语言模型的瓶颈,提出优化配方显著降低延迟并保持精度,同时引入ArgusVLM模型家族在多种基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL 84%

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09262 2026-03-19 cs.CV 83%

MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models

MultiMedEval:用于评估医学视觉-语言模型的基准和工具包

Corentin Royer, Bjoern Menze, Anjany Sekuboyina

机构 * University of Zürich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 MultiMedEval通过23个数据集和11个医学领域,评估六种多模态任务,提供开源工具简化VLM评估,促进公平统一的基准测试。

Comments Accepted at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13728 2026-03-19 cs.CV cs.CR 83%

Bodhi VLM: Privacy-Alignment Modeling for Hierarchical Visual Representations in Vision Backbones and VLM Encoders via Bottom-Up and Top-Down Feature Search

Bodhi VLM:通过自上而下和自下而上的特征搜索实现视觉主干和VLM编码器中层次视觉表示的隐私对齐建模

Bo Ma, Wei Qi Yan, Jinsong Wu

机构 * Auckland University of Technology(奥克兰技术大学) Resideo Technologies, Inc.(Resideo技术公司) Guilin University of Electronic Technology(桂林电子科技大学) Universidad de Chile(智利大学)

专题命中 VLM训练与架构 :VLM(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出Bodhi VLM框架,通过NCP和MDAV聚类将敏感概念与分层神经表示的层间分组关联,并利用自上而下和自下而上的策略定位敏感特征区域,结合EMPA模块生成可解释的隐私预算对齐信号,验证了在目标检测和VLM视觉编码器中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 79%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 79%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏