arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-06 至 2026-03-06 共收录 44 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2603.04908 2026-03-06 cs.CV 70%

AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM

AdaIAT: 适应性增加对生成文本的关注以减轻大型视觉-语言模型中的幻觉

Li'an Zhong, Ziqiang He, Jibin Zheng, Jin Li, Z. Jane Wang, Xiangui Kang

机构 * Sun Yat-Sen University(中山大学) Foshan University(佛山大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 AdaIAT通过自适应增加对生成文本的关注,有效减轻大型视觉-语言模型中的幻觉问题,同时保持语言连贯性和预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 62%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 9 篇

2512.22695 2026-03-06 cs.DC 82%

Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference

模态膨胀:MLLM推理的能量特性与优化机会

Mona Moghadampanah, Adib Rezaei Shahmirzadi, Farhana Amin, Dimitrios S. Nikolopoulos

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 本文研究了多模态大语言模型推理中的能量特性与优化机会,发现模态膨胀导致额外能耗,并提出阶段级DVFS优化方法以提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 79%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18864 2026-03-06 cs.CV 79%

Flatness Guided Test-Time Adaptation for Vision-Language Models

基于平坦度引导的视觉-语言模型测试时适应

Aodi Li, Liansheng Zhuang, Xiao Long, Houqiang Li, Shafei Wang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) National Engineering Laboratory for Brain-Inspired Intelligence Technology and Applications, University of Science and Technology of China(中国科学技术大学脑启发式智能技术与应用国家工程实验室) Peng Cheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出基于平坦度引导的视觉-语言模型测试时适应框架,通过训练时的平坦最小值与测试时损失景观的对齐,提升模型在分布偏移下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04957 2026-03-06 cs.CV cs.CL 70%

VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters

VisionPangu:一个紧凑且细粒度的多模态助手,参数为17亿

Jiaxin Fan, Wenpo Song

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);分类 cs.CV

AI总结 VisionPangu通过高效多模态对齐和高质量监督,实现17亿参数紧凑多模态模型,在无需激进扩展的情况下提升图像描述的结构和细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04894 2026-03-06 cs.AI 70%

Differentially Private Multimodal In-Context Learning

差分隐私多模态上下文学习

Ivoline C. Ngong, Zarreen Reza, Joseph P. Near

机构 * University of Vermont, Burlington, VT, USA(佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DP-MTV是首个实现多样本多模态上下文学习的差分隐私框架,通过激活空间中的任务向量聚合,在保持隐私的前提下提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05185 2026-03-06 cs.RO 67%

Critic in the Loop: A Tri-System VLA Framework for Robust Long-Horizon Manipulation

循环批评者:一种三系统VLA框架用于鲁棒的长周期操控

Pengfei Yi, Yingjie Ma, Wenjiang Xu, Yanan Hao, Shuai Gan, Wanting Li, Shanlin Zhong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 循环批评者提出了一种三系统VLA框架,通过动态调度VLM和VLA实现鲁棒的长周期操控,提升系统在分布外场景的自主性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04851 2026-03-06 cs.LG cs.CL 57%

Why Is RLHF Alignment Shallow? A Gradient Analysis

为什么RLHF对齐是浅层的?一种梯度分析

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 57%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 3 篇

2603.04800 2026-03-06 cs.CV 79%

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

MASQuant: 多模态大语言模型的模态感知平滑量化

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

机构 * Alibaba Cloud Computing, Alibaba Group(阿里巴巴云 computing,阿里巴巴集团)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 MASQuant通过模态感知平滑和跨模态补偿技术,解决多模态大语言模型的量化问题,实现稳定且高效的量化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16786 2026-03-06 cs.LG cs.AI cs.CV 67%

Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

重新审视多模态KV缓存压缩:一种基于频域的异常KV感知方法

Yaoxin Yang, Peng Ye, Xudong Tan, Chongjun Tu, Maosen Zhao, Jia Hao, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhangjiang Laboratory(张江实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出FlashCache,一种基于频域的异常KV感知KV缓存压缩框架,通过保留关键KV对提升解码效率并降低内存使用。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05384 2026-03-06 cs.CV 57%

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

ORMOT: 一个用于全方位参照多目标跟踪的数据集和框架

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(多谱信息智能处理技术国家重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出ORMOT任务,构建ORSet数据集和ORTrack框架,解决传统数据集视野限制问题,提升模型对长周期语言描述的理解能力。

Comments https://github.com/chen-si-jia/ORMOT

详情

展开后加载摘要…

URL PDF HTML 收藏