arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-12 至 2026-03-12 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2603.10335 2026-03-12 cs.CV 79%

Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models

Fuel Gauge: 在大型多模态模型中提前估计链式推理长度

Yuedong Yang, Xiwen Wei, Mustafa Munir, Radu Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电气与计算机工程系)

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV

AI总结 Fuel Gauge通过提取隐藏信号提前预测链式推理长度,有效解决LMMs中的内存碎片化和推理效率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10549 2026-03-12 cs.CV cs.AI eess.SP 62%

Towards Cognitive Defect Analysis in Active Infrared Thermography with Vision-Text Cues

面向主动红外热成像的认知缺陷分析:结合视觉-文本线索

Mohammed Salah, Eman Ouda, Giuseppe Dell'Avvocato, Fabrizio Sarasini, Ester D'Accardi, Jorge Dias, Davor Svetinovic, Stefano Sfarra, Yusra Abdulrahman

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结合视觉-文本线索的主动红外热成像认知缺陷分析框架,利用预训练多模态模型实现零样本缺陷检测,实验显示其信噪比提升超过10dB,交并比达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI 62%

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI 62%

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10436 2026-03-12 cs.RO cs.DC 50%

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理

Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

专题命中 图文多模态 :multimodal(abstract)

AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。

Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10158 2026-03-12 cs.RO 50%

Cross-Hand Latent Representation for Vision-Language-Action Models

跨手的潜在表示用于视觉-语言-动作模型

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

专题命中 图文多模态 :multimodal(abstract)

AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。

Comments Website: https://xl-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏