arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2603.18462 2026-03-20 cs.AI 85%

AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba

AlignMamba-2:通过模态感知Mamba增强多模态融合与情感分析

Yan Li, Yifei Xing, Xiangyuan Lan, Xin Li, Haifeng Chen, Dongmei Jiang

机构 * Pengcheng Laboratory(鹏城实验室) Shaanxi University of Science & Technology(陕西科技大学) School of Computer Science(计算机科学学院) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出AlignMamba-2框架,通过双对齐策略和模态感知Mamba层,提升多模态融合与情感分析的效率与效果,实验表明其在动态时间序列和静态图像任务中均达到新水平。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19026 2026-03-20 cs.CV 83%

Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

重新思考MLLM本身作为分割器:仅用一个分割标记

Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei

机构 * Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学) Beijing Jiaotong University(北京交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI 81%

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 79%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV 79%

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM 62%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG 62%

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 57%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17944 2026-03-20 cs.CV 57%

TransText: Alpha-as-RGB Representation for Transparent Text Animation

TransText: Alpha-as-RGB表示法用于透明文本动画

Fei Zhang, Zijian Zhou, Bohao Tang, Sen He, Hang Li, Zhe Wang, Soubhik Sanyal, Pengfei Liu, Viktar Atliha, Tao Xiang, Frost Xu, Semih Gunel

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute (SII)(上海创新研究院) Meta AI

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TransText通过Alpha-as-RGB方法联合建模外观与透明度,避免修改预训练生成流形,生成高质量透明动画。

Comments 19 pages, publication review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18541 2026-03-20 cs.CV 57%

Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

矫正目标域色散以提升跨域少样本目标检测

Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06679 2026-03-20 cs.CL 57%

CMV-Fuse: Cross Modal-View Fusion of AMR, Syntax, and Knowledge Representations for Aspect Based Sentiment Analysis

CMV-Fuse:跨模态视图融合AMR、语法和知识表示以进行基于方面的情感分析

Smitha Muthya Sudheendra, Mani Deep Cherukuri, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 CMV-Fuse通过融合语法、语义和知识表示,提升基于方面的情感分析的鲁棒性,采用层次门控注意力机制和多视图对比学习,实现结构和语义的双重建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV 57%

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏