arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2511.17910 2026-03-23 cs.CL 79%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17246 2026-03-23 cs.LG 67%

On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings

关于医学视觉-语言嵌入中的锥效应与模态间隙

David Restrepo, Miguel L Martins, Chenwei Wu, Luis Filipe Nakayama, Diego M Lopez, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

机构 * CentraleSupélec, Université Paris-Saclay, France(中央理工巴黎高等学院,巴黎萨克雷大学,法国) University of Porto, Portugal(葡萄牙波尔图大学) University of Michigan, USA(美国密歇根大学) Federal University of São Paulo, Brazil(巴西圣保罗联邦大学) Universidad del Cauca, Colombia(哥伦比亚考卡大学) Universidad de Buenos Aires, Argentina(阿根廷布宜诺斯艾利斯大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文研究了视觉语言模型中的锥效应及其对多模态性能的影响,通过轻量级机制调控模态间隙,发现医学数据集对间隙调节更敏感,但过度消除间隙并非最优,任务相关分离更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20116 2026-03-23 cs.CV cs.AI 62%

Chain-of-Adaptation: Surgical Vision-Language Adaptation with Reinforcement Learning

链式适应:基于强化学习的手术视觉-语言适应

Jiajie Li, Chenhui Xu, Meihuan Liu, Jinjun Xiong

机构 * University at Buffalo(布法罗大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出链式适应框架,通过强化学习整合领域知识,保持模型推理和感知能力,在手术基准测试中实现更高的准确性和更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV 57%

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 57%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24837 2026-03-23 cs.CV 57%

ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

ZOO-Prune:基于零阶梯度估计的训练自由token剪枝方法用于视觉-语言模型

Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong

机构 * Amazon(亚马逊公司) Sungkyunkwan University(成均馆大学) Inha University(inha大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ZOO-Prune方法,通过零阶梯度估计在视觉-语言模型中实现无需训练的token剪枝,实验表明其在剪枝94.4%token的同时保持精度,并提升推理效率2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏