arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 12 篇

2604.08541 2026-04-10 cs.CV cs.AI cs.CL 85%

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08322 2026-04-10 cs.CV 83%

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM

Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li

机构 * Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08395 2026-04-10 cs.CV cs.AI 62%

Phantasia: Context-Adaptive Backdoors in Vision Language Models

幻象:面向视觉语言模型的上下文自适应后门

Nam Duong Tran, Phi Le Nguyen

机构 * Institute for AI Innovation and Societal Impact, Hanoi University of Science and Technology(河内科技大学人工智能创新与社会影响研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Phantasia,一种能根据输入语义动态调整恶意输出的后门攻击方法,提升了攻击隐蔽性和适应性,实验显示其在多种防御设置下均保持良好性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26036 2026-04-10 cs.CV cs.AI cs.LG 62%

SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP

SeMoBridge:用于CLIP高效少样本适应的语义模态桥

Christoph Timmermann, Hyunse Lee, Woojin Lee

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SeMoBridge通过语义模态桥技术解决CLIP在少样本分类中的模态对齐问题,通过轻量级方法提升低数据场景下的性能,训练时间显著减少。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07914 2026-04-10 cs.CV cs.AI 62%

Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction

缓解大型视觉-语言模型中的纠缠引导以减少幻觉

Yuanhong Zhang, Zhaoyang Wang, Xin Zhang, Weizhan Zhang, Joey Tianyi Zhou

机构 * Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(前沿人工智能研究中心,高性能计算研究所,科技研究局)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MESA框架,通过可控的潜在空间干预减少视觉-语言模型中的幻觉,同时保持生成行为,实验表明其在多个模型家族中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07740 2026-04-10 cs.CV cs.AI 62%

Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification

超越行人:基于描述的CLIP框架用于高难度视频基的人重识别

Shogo Hamano, Shunya Wakasugi, Tatsuhito Sato, Sayaka Nakamura

机构 * Sony Group Corporation(索尼集团公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CG-CLIP框架,通过文本描述和可学习令牌提升视频中高难度行人重识别性能,实验表明其在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 62%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07997 2026-04-10 cs.CV 57%

Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

少样本增量式动态室内环境3D物体检测

Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FI3Det框架,利用视觉语言模型学习未见类别知识,通过VLM引导模块和多模态原型模块实现高效3D感知,在ScanNet V2和SUN RGB-D数据集上取得显著提升。

Comments Accepted by CVPR 2026

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07814 2026-04-10 cs.CV 57%

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型

Hazza Mahmood, Yongqiang Yu, Rao Anwer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。

Comments 9 pages

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 57%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 57%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏