arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2603.02329 2026-03-04 cs.CV 89%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :MLLM(title,abstract);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02695 2026-03-04 cs.LG 78%

Addressing Missing and Noisy Modalities in One Solution: Unified Modality-Quality Framework for Low-quality Multimodal Data

解决缺失和噪声模态:统一的模态质量框架用于低质量多模态数据

Sijie Mai, Shiqin Han, Haifeng Hu

机构 * Department of Computer Science(计算机科学系) South China Normal University(华南师范大学) School of Electronics and Information Technology(电子与信息学院) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出统一的模态质量框架,通过联合处理缺失和噪声模态,提升低质量多模态数据的模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02434 2026-03-04 cs.CV cs.AI 73%

MIRAGE: Knowledge Graph-Guided Cross-Cohort MRI Synthesis for Alzheimer's Disease Prediction

MIRAGE:基于知识图谱的跨群体MRI合成用于阿尔茨海默病预测

Guanchen Wu, Zhe Huang, Yuzhang Xie, Runze Yan, Akul Chopra, Deqiang Qiu, Xiao Hu, Fei Wang, Carl Yang

机构 * Emory University, Atlanta, USA(埃默里大学) Cornell University, New York, USA(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MIRAGE通过知识图谱引导的跨群体MRI合成,提升无真实MRI群体中阿尔茨海默病的诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG 67%

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17558 2026-03-04 cs.CL 57%

A Survey of Query Optimization in Large Language Models

大型语言模型中查询优化的综述

Mingyang Song, Mao Zheng

机构 * Large Language Model Department(大语言模型部门)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型中查询优化的技术,提出查询优化生命周期框架、查询复杂度分类法及四个基本操作,分析了优化方法和挑战,为研究和实践提供指导。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏