arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-23 至 2026-06-23 共收录 160 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 39 篇

2511.22354 2026-06-23 cs.RO 版本更新 50%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 VLM训练与架构 :VLM(abstract_cn)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 9 篇

2606.20961 2026-06-23 cs.LG cs.AI 新提交 85%

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02370 2026-06-23 cs.CV 版本更新 79%

Cultural Counterfactuals: Evaluating Cultural Biases in Large Vision-Language Models with Counterfactual Examples

文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(Ottawa大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新 73%

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 67%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22352 2026-06-23 cs.LG cs.AI 新提交 62%

On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning

稀疏性-存储-精度权衡在简约激活字典学习中的研究

Zihui Zhao, Yuanbo Tang, Yang Li

机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 62%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22645 2026-06-23 cs.CV cs.AI 版本更新 62%

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN: 基于CLIP的类增量学习中的层次表示匹配

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21657 2026-06-23 cs.CV cs.CL 新提交 57%

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Chehre: 一个用于感知多样面部表情识别的表情符号提示视频数据集

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出Chehre数据集,通过表情符号提示收集动态面部表情视频,并转移至合成人脸以保护隐私,定义主导和分布表情识别任务,基准测试显示现有模型表现有限。

Comments 16 pages, 8 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21877 2026-06-23 cs.CV 57%

How to Take a Memorable Picture? Empowering Users with Actionable Feedback

如何拍摄令人难忘的照片?通过可操作反馈赋能用户

Francesco Laiti, Davide Talon, Jacopo Staiano, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Travelbrain srl(Travelbrain公司) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MemFeed任务,通过MemCoach利用多模态大语言模型提供自然语言建议,提升图像回忆性,展示其在多个模型上的有效性。

Comments Accepted @ CVPR 2026. Project page: https://laitifranz.github.io/MemCoach/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 29738-29749

详情

展开后加载摘要…

URL PDF HTML 收藏