arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 18 篇

2604.05522 2026-04-08 cs.CL 87%

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

跨模态指代对齐:在全模态大语言模型中实现可靠信息传输

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract);omni-modal(abstract)

AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 84%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01831 2026-04-08 cs.LG cs.AI 83%

Routing-Based Continual Learning for Multimodal Large Language Models

基于路由的多模态大语言模型持续学习

Jay Mohta, Kenan Emir Ak, Gwang Lee, Dimitrios Dimitriadis, Yan Xu, Mingwei Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 81%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 81%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV 79%

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05632 2026-04-08 cs.CV 79%

SGANet: Semantic and Geometric Alignment for Multimodal Multi-view Anomaly Detection

SGANet:语义与几何对齐用于多模态多视角异常检测

Letian Bai, Chengyu Tao, Juan Du

机构 * Smart Manufacturing Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)智能制造学域) College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SGANet通过语义与几何对齐方法,提升多模态多视角异常检测的性能,实验表明其在SiM3D和Eyecandies数据集上达到最先进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05629 2026-04-08 cs.CV 79%

A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting

一种统一的多模态遥感图像修复与融合的全功能基础模型 with语言提示

Yongchuan Cui, Peng Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出LLaRS模型,通过最优传输和混合专家层实现多模态遥感图像修复与融合,结合大规模数据集提升模型性能与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04999 2026-04-08 cs.LG cs.AI 79%

PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities

PRIME:面向癌症预后分析的原型驱动多模态预训练方法,适用于缺失模态

Kai Yu, Shuang Zhou, Yiran Song, Zaifu Zhan, Jie Peng, Kaixiong Zhou, Tianlong Chen, Feng Xie, Meng Wang, Huazhu Fu, Mingquan Lin, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学) National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,新加坡科技研究局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 PRIME通过原型记忆银行实现缺失模态下的多模态自监督预训练,提升在碎片化临床数据中的预测性能,实现结构对齐和鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07833 2026-04-08 cs.CV 79%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05668 2026-04-08 eess.SP 78%

A BEV-Fusion Based Framework for Sequential Multi-Modal Beam Prediction in mmWave Systems

基于BEV融合的毫米波系统中顺序多模束预测框架

Jiaming Zeng, Cunhua Pan, Haoyang Weng, Ruijing Liu, Hong Ren, Jiangzhou Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于BEV融合的框架,通过统一相机、激光雷达、雷达和GPS模态,在共享鸟瞰图表示中实现空间一致的多模融合,提升毫米波系统中束预测的准确性。

Comments 13pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV 70%

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

专题命中 多模态训练与对齐 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05931 2026-04-08 cs.CV cs.AI 62%

Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

基于一致性策略学习的显著性引导表示用于视觉无监督强化学习

Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SRCP框架,通过显著性引导动态任务和一致性策略提升视觉无监督强化学习的零样本泛化能力,改进了传统SR方法在高维视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03054 2026-04-08 cs.CV cs.AI 62%

IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

IBISAgent: 通过MLLMs增强像素级视觉推理以实现通用生物医学对象指称与分割

Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IBISAgent,通过多步决策过程增强MLLMs的像素级视觉推理能力,解决现有分割方法在隐式分割标记和迭代优化方面的不足,提升生物医学分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05863 2026-04-08 cs.CL 57%

LoRM: Learning the Language of Rotating Machinery for Self-Supervised Condition Monitoring

LoRM:学习旋转机械的语言以实现自监督的条件监测

Xiao Qin, Xingyi Song, Tong Liu, Hatim Laalej, Zepeng Liu, Yunpeng Zhu, Ligang He

机构 * University of Warwick(华威大学) Queen Mary University of London(伦敦玛丽女王大学) University of Sheffield(谢菲尔德大学) Advanced Manufacturing Research Centre, University of Sheffield(谢菲尔德大学先进制造研究中心) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 LoRM通过将旋转机械信号视为机器语言,利用预训练语言模型进行多模态信号分析,实现实时条件监测,展示了在工具状态监测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05581 2026-04-08 cs.CV 57%

High-Resolution Single-Shot Polarimetric Imaging Made Easy

高分辨率单次拍摄偏振成像的实现

Shuangfan Zhou, Chu Zhou, Heng Guo, Youwei Lyu, Boxin Shi, Zhanyu Ma, Imari Sato

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Institute of Informatics(国立信息学研究所) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Key Laboratory of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出EasyPolar框架,通过三相机系统和置信度引导网络实现高分辨率偏振成像,解决多视角融合中的对齐问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05405 2026-04-08 cs.CV 57%

Weather-Conditioned Branch Routing for Robust LiDAR-Radar 3D Object Detection

针对恶劣天气的分支路由用于鲁棒的激光雷达-雷达3D目标检测

Hongsheng Li, Lingfeng Zhang, Zexian Yang, Liang Li, Rong Yin, Xiaoshuai Hao, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于天气条件的分支路由方法,通过动态调整模态偏好提升恶劣天气下3D目标检测的鲁棒性,实验表明其在K-Radar基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 50%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏