arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-02 至 2026-03-02 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2509.25249 2026-03-02 cs.RO cs.AI 83%

BEV-VLM: Trajectory Planning via Unified BEV Abstraction

BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划

Guancheng Chen, Sheng Yang, Tong Zhan, Jian Wang

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24059 2026-03-02 cs.CV cs.AI 81%

Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization

量化专家:基于专家混合的令牌感知自适应误差重建用于大视觉-语言模型量化

Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Quant Experts,通过令牌感知的专家混合方法,提升大视觉-语言模型在量化过程中的任务准确性,保持与全精度模型相当的性能。

Comments 13 pages, 6 figures, including appendix, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05394 2026-03-02 cs.CV cs.LG 81%

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

pFedMMA: 为视觉-语言模型设计的个性化联邦微调多模态适配器

Sajjad Ghiasvand, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 pFedMMA通过多模态适配器实现视觉-语言模型的个性化联邦微调,平衡个性化与泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23746 2026-03-02 cs.HC cs.CV 70%

Shape vs. Context: Examining Human--AI Gaps in Ambiguous Japanese Character Recognition

形状与上下文:考察人类与AI之间的模糊日文字符识别差距

Daichi Haraguchi

机构 * CyberAgent

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究通过比较人类与VLMs在模糊日文字符识别中的决策模式,揭示了形状上下文对人类与AI对齐的影响。

Comments Accepted to CHI 2026 Poster track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL 70%

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23061 2026-03-02 cs.CV 70%

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

赋能小型视觉语言模型进行动态记忆与探索

Jiazhen Liu, Yuchuan Deng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23817 2026-03-02 cs.CV 57%

Footprint-Guided Exemplar-Free Continual Histopathology Report Generation

足迹引导的无示例持续病理报告生成

Pratibha Kumari, Daniel Reisenbüchler, Afshin Bozorgpour, yousef Sadegheih, Priyankar Choudhary, Dorit Merhof

机构 * Faculty of Informatics and Data Science, University of Regensburg, Germany(信息学与数据科学学院,雷根萨大学) Indian Institute of Information Technology Bhopal, India(比哈尔信息学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无示例的持续学习框架,通过构建紧凑的领域足迹实现WSI到报告的生成,支持生成性重放并适应变化的临床报告规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 57%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22745 2026-03-02 cs.CV 57%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 57%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18579 2026-03-02 cs.LG 57%

Sparsity Forcing: Reinforcing Token Sparsity of MLLMs

稀疏性强制:强化多模态大语言模型的token稀疏性

Feng Chen, Yefei He, Lequan Lin, Chenhui Gou, Jing Liu, Bohan Zhuang, Qi Wu

机构 * AIML, University of Adelaide, Australia(AIML,澳大利亚阿德莱德大学) ZIP Lab, Zhejiang University, China(浙江工业大学ZIP实验室) University of Sydney, Australia(悉尼大学) Monash University, Australia(墨尔本大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出Sparsity Forcing方法,通过强化学习框架在多模态大语言模型中提升token稀疏性,实现75%的token减少与极小的精度损失。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23648 2026-03-02 cs.RO 50%

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作

Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University(西安交通大学) Central South University(中南大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏