arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 25 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 25 篇

2603.06578 2026-03-10 cs.CV 85%

Multimodal Large Language Models as Image Classifiers

多模态大语言模型作为图像分类器

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 85%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08572 2026-03-10 cs.RO cs.AI 83%

MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Experts for Humanoid Loco-Manipulation

MetaWorld-X: 通过VLM协调的专家实现人形机器人的分层世界建模

Yutong Shen, Hangxu Liu, Penghui Liu, Jiashuo Luo, Yongkang Zhang, Rex Morvley, Chen Jiang, Jianwei Zhang, Lei Zhang

机构 * University of Hamburg(汉堡大学) School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) School of Information Science and Engineering, Fudan University(信息科学与工程学院,复旦大学) University of Alberta(阿尔伯塔大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 MetaWorld-X通过VLM协调的专家实现人形机器人分层世界建模,解决loco-manipulation任务中的控制策略泛化问题。

Comments 8 figures, https://syt2004.github.io/metaworldX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01111 2026-03-10 cs.CV 83%

DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

DeAR: 通过分解注意力头角色实现细粒度VLM适应

Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng

机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究所) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 DeAR通过分解注意力头角色实现细粒度VLM适应,有效平衡任务适应与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 79%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08269 2026-03-10 cs.RO cs.AI 79%

SAIL: Test-Time Scaling for In-Context Imitation Learning with VLM

SAIL:基于VLM的上下文模仿学习的测试时扩展

Makoto Sato, Yusuke Iwasawa, Yujin Tang, So Kuroki

机构 * The University of Tokyo(东京大学) Sakana AI

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.AI

AI总结 SAIL通过测试时扩展提升上下文模仿学习的鲁棒性和通用性,利用蒙特卡洛树搜索和视觉语言模型实现轨迹优化。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07443 2026-03-10 cs.CV 79%

Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models

Med-Evo: 医疗多模态大语言模型的测试时自演化

Dunyuan Xu, Xikai Yang, Juzheng Miao, Yaoqian Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Med-Evo通过无标签强化学习和伪标签技术提升医疗多模态大语言模型性能,实验表明在医疗VQA任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05202 2026-03-10 cs.CV 79%

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型

Dongchen Si, Di Wang, Erzhong Gao, Xiaolei Qin, Liu Zhao, Jing Zhang, Minqiang Xu, Jianbo Zhan, Jianshe Wang, Lin Liu, Bo Du, Liangpei Zhang

机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) iFlytek Co., Ltd.(iFlytek公司) National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。

Comments Accepted to IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 79%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 75%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07989 2026-03-10 cs.CV 74%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07580 2026-03-10 cs.CV 70%

When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs

当令牌修剪不如随机:理解VLLMs中的视觉令牌信息

Yahong Wang, Juncheng Wu, Zhangkai Ni, Longzhen Yang, Yihang Liu, Chengmei Yang, Ying Wen, Lianghua He, Xianfeng Tang, Hui Liu, Yuyin Zhou

机构 * Tongji University(同济大学) University of California, Santa Cruz(加州大学圣克ruz分校) Amazon(亚马逊) East China Normal University(华东师范大学) Shanghai Eye Disease Prevention and Treatment Center(上海眼病预防与治疗中心)

专题命中 VLM训练与架构 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文研究了VLLMs中视觉令牌信息随网络深度变化的现象,发现信息消失地平线导致深度层随机修剪更有效,且与模型容量相关。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06263 2026-03-10 cs.CV 70%

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

iLLaVA: 图像的价值少于三分之一的输入标记在大型多模态模型中

Lianyu Hu, Liqing Gao, Fanhua Shang, Liang Wan, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Computer Science and Technology, Tiangong University(天津工大学计算机科学与技术学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析关键研究中心,国家文物局)

专题命中 VLM训练与架构 :vision-language model(abstract);InternVL(abstract);分类 cs.CV

AI总结 iLLaVA通过联合优化图像编码器和LLM,减少冗余标记并提升吞吐量,实现更高效的多模态模型性能。

Comments Accepted by ICLR2026,code is released at https://github.com/hulianyuyy/iLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07135 2026-03-10 cs.CV 70%

The Model Knows Which Tokens Matter: Automatic Token Selection via Noise Gating

模型知道哪些token重要:通过噪声门实现的自动token选择

Landi He, Xiaoyu Yang, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 AutoSelect通过噪声门实现自动token选择,提升视觉语言模型的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07023 2026-03-10 cs.CL cs.AI 70%

Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment

通过偏好对齐学习长上下文的推理

Junming Liu, Yuqi Li, Shiping Wen, Zhigang Zeng, Tingwen Huang

机构 * Tongji University(同济大学) The City University of New York(纽约城市大学) University of Technology Sydney(悉尼大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Hit-RAG通过多阶段偏好对齐框架解决长上下文推理中的注意力稀释和幻觉问题,提升模型在长上下文场景下的推理能力。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18570 2026-03-10 cs.LG 70%

VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis

VISTA:面向无训练股票时间序列分析的视觉-语言推理

Tina Khezresmaeilzadeh, Parsa Razmara, Seyedarmin Azizi, Mohammad Erfan Sadeghi, Erfan Baghaei Potraghloo

机构 * University of Southern California(南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。

Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08851 2026-03-10 cs.RO 67%

CDE: Concept-Driven Exploration for Reinforcement Learning

CDE:基于概念的强化学习探索

Le Mao, Andrew H. Liu, Renos Zabounidis, Yanan Niu, Zachary Kingston, Joseph Campbell

机构 * Department of Electrical and Computer Engineering, Purdue University(电子工程系,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学) Department of Management of Technology, EPFL(技术管理系,瑞士联邦理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 CDE通过利用预训练视觉-语言模型生成任务相关的视觉概念,提升强化学习中视觉任务的探索效率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11364 2026-03-10 cs.RO 67%

ActivePose: Active 6D Object Pose Estimation and Tracking for Robotic Manipulation

ActivePose: 用于机器人操作的主动6D物体姿态估计与跟踪

Sheng Liu, Zhe Li, Weiheng Wang, Han Sun, Heng Zhang, Hongpeng Chen, Yusen Qin, Arash Ajoudani, Yizhao Wang

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) Shanghai Jiao Tong University(上海交通大学) Istituto Italiano di Tecnologia(意大利理工学院) The Hong Kong Polytechnic University(香港理工大学) D-Robotics(D-机器人)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 ActivePose通过结合视觉-语言模型与机器人想象力,实现主动6D物体姿态估计与跟踪,提升机器人操作的可靠性。

Comments 6D Pose, Diffusion Policy, Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07295 2026-03-10 cs.AI 57%

A Cortically Inspired Architecture for Modular Perceptual AI

一种模块化感知人工智能的皮层启发架构

Prerna Luthra

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种受皮层启发的模块化感知人工智能架构,通过分解感知为专门模块,提升可解释性和推理透明度。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07163 2026-03-10 cs.CV 57%

PromptGate Client Adaptive Vision Language Gating for Open Set Federated Active Learning

PromptGate:面向开放集联邦主动学习的客户端自适应视觉语言门控

Adea Nesturi, David Dueñas Gaviria, Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科诊所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 PromptGate通过动态视觉语言模型门控框架提升开放集联邦主动学习的标注效率,实现高纯度和高召回率的样本筛选。

Comments 3 Figures, 2 Tables, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07039 2026-03-10 cs.AI 57%

Self-Supervised Multi-Modal World Model with 4D Space-Time Embedding

具有4D空间-时间嵌入的自监督多模态世界模型

Lance Legel, Qin Huang, Brandon Voelker, Daniel Neamati, Patrick Alan Johnson, Favyen Bastani, Jeff Rose, James Ryan Hennessy, Robert Guralnick, Douglas Soltis, Pamela Soltis, Shaowen Wang

机构 * Ecological Intelligence Lab(生态智能实验室) School of Complex Adaptive Systems(复杂适应系统学院) University of Houston(休斯顿大学) Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院) Spatial Intelligence Lab(空间智能实验室) Department of Computer Science(计算机科学系) Georgia Institute of Technology(佐治亚理工学院) Florida Museum of Natural History(佛罗里达自然历史博物馆) University of Florida(佛罗里达大学) NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。

Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 57%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 50%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏