arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2603.02663 2026-03-04 cs.CL cs.CV 90%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02609 2026-03-04 cs.CV cs.RO 79%

VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction

VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18362 2026-03-04 cs.SE cs.CL cs.CV 76%

WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development

WAFFLE:针对自动化前端开发的多模态模型微调

Shanchao Liang, Nan Jiang, Shangshu Qian, Lin Tan

机构 * Purdue University(普渡大学)

专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 WAFFLE通过结构感知注意力机制和对比微调方法,提升多模态模型在UI到HTML代码生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02557 2026-03-04 cs.CV cs.AI 62%

CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

CAPT:基于混淆的提示微调以减少视觉-语言不一致

Maoyuan Shao, Yutong Gao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13315 2026-03-04 cs.CV cs.AI 62%

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

Self-Aug: 用于大视觉-语言模型的查询和熵自适应解码

Eun Woo Im, Muhammad Kashif Ali, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Self-Aug,一种无需训练的解码策略,通过自增强提示和自适应阈值算法提升大视觉-语言模型的事实一致性。

Comments 10 pages, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02959 2026-03-04 cs.CV 57%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏