arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 23 篇

2603.08592 2026-04-28 cs.CV 89%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 85%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12890 2026-04-28 cs.CV cs.AI 84%

Towards Long-horizon Agentic Multimodal Search

面向长视界代理多模态搜索

Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 polled 智能学院) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMM-Searcher框架,通过文件化视觉表示和定制化图像加载工具,解决长视界多模态搜索中的信息管理与成本问题,实验证明其在长视界基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00829 2026-04-28 cs.CV cs.CL 84%

LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24125 2026-04-28 cs.CV 83%

Open-Vocabulary Semantic Segmentation Network Integrating Object-Level Label and Scene-Level Semantic Features for Multimodal Remote Sensing Images

开放词汇语义分割网络:整合对象级标签与场景级语义特征用于多模态遥感图像

Jinkun Dai, Yuanxin Ye, Peng Tang, Tengfeng Tang, Xianping Ma, Jing Xiao, Mi Wang

机构 * Faculty of Geosciences and Engineering, Southwest Jiaotong University, Chengdu 611756, China(西南交通大学地质工程学院,成都 611756,中国) State-Province Joint Engineering Laboratory of Spatial Information Technology for High-Speed Railway Safety, Southwest Jiaotong University, Chengdu 611756, China(高速铁路安全空间信息技术省部共建工程实验室,西南交通大学,成都 611756,中国) School of Artificial Intelligence, Wuhan University, Wuhan 430072, China(武汉大学人工智能学院,武汉 430072,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan 430072, China(武汉大学测绘遥感信息工程国家重点实验室,武汉 430072,中国)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TSMNet,通过整合文本监督与视觉表示,实现开放词汇语义分割,利用双分支文本编码器提取场景级语义和对象级标签信息,提升遥感图像分割的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22899 2026-04-28 cs.CV 83%

Text-Guided Multimodal Unified Industrial Anomaly Detection

基于文本引导的多模态统一工业异常检测

Zewen Li, Shuo Ye, Zitong Yu, Weicheng Xie, Linlin Shen

机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(海湾大学计算机与信息学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于文本语义的多模态统一工业异常检测框架,解决跨模态对齐和几何建模不足问题,通过几何感知跨模态映射和对象条件文本特征适配器实现多模态特征对齐,实现跨类别的准确异常检测。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06883 2026-04-28 cs.IR 82%

Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation

大型视觉语言模型的结构和解耦适应用于多模态推荐

Zhongtao Rao, Peilin Zhou, Dading Chong, Zhiwei Chen, Shoujin Wang, Nan Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。

Comments Accepted to SIGIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23753 2026-04-28 cs.AI cs.HC cs.LG 79%

Modeling Induced Pleasure through Cognitive Appraisal Prediction via Multimodal Fusion

通过多模态融合进行诱导愉悦的认知评估预测建模

Nastaran Dab, Raziyeh Zall, Mohammadreza Kangavari

机构 * Iran University of Science and Technology(伊朗科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态融合模型,通过认知评估变量预测视频诱导的愉悦,解决标签噪声、语义鸿沟、数据稀缺和解释性不足等问题,实验验证了模型在检测视频诱导愉悦方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23112 2026-04-28 cs.LG 78%

Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning

多模态联邦学习中模态内缺失的条件补全

Wugeng Zheng, Ziwen Kan, Katie Wang, Chen Chen, Song Wang

机构 * University of Central Florida(佛罗里达大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。

Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22763 2026-04-28 cs.HC 78%

A learning health system in Neurorehabilitation as a foundation for multimodal patient representation

神经康复中的学习健康系统作为多模态患者表示的基础

Thomas Weikert, Eljas Roellin, Lukas Heumos, Fabian J. Theis, Diego Paez-Granados, Chris Easthope Awai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出通过整合多模态数据采集、模型计算和临床可视化,构建神经康复中的学习健康系统,以促进临床与机器学习的合作,解决数据碎片化、互操作性差和临床人员参与度低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12938 2026-04-28 cs.LG physics.ao-ph 78%

Local Off-Grid Weather Forecasting with Multi-Modal Earth Observation Data

本地非网格天气预报与多模态地球观测数据

Qidong Yang, Jonathan Giezendanner, Daniel Salles Civitarese, Johannes Jakubik, Eric Schmitt, Anirban Chandra, Jeremy Vila, Detlef Hohl, Chris Hill, Campbell Watson, Sherrie Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) Shell Information Technology International Inc.(壳牌信息技术国际公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 73%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18576 2026-04-28 cs.RO 71%

DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment

DriVerse:通过多模态轨迹提示和运动对齐实现驾驶模拟的导航世界模型

Xiaofan Li, Chenming Wu, Zhao Yang, Zhihao Xu, Dingkang Liang, Yumeng Zhang, Ji Wan, Jun Wang

机构 * Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 DriVerse通过多模态轨迹提示和运动对齐技术,实现从单张图像和未来轨迹生成导航驱动的驾驶场景,提升了动态对象的生成精度和时间一致性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 70%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22903 2026-04-28 cs.CV cs.AI 62%

On the Complementarity of Quantum and Classical Features: Adaptive Hybrid Quantum-Classical Feature Fusion for Breast Cancer Classification

量子与经典特征的互补性:面向乳腺癌分类的自适应混合量子-经典特征融合

Yasmin Rodrigues Sobrinho, João Renato Ribeiro Manesco, João Paulo Papa

机构 * Department of Computing, São Paulo State University(圣保罗州大学计算机系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种混合量子-经典架构,通过双分支特征提取管道融合经典模型和量子电路的互补表示,引入三种特征融合策略提升乳腺癌分类性能。

Comments 41 pages, 16 figures. This manuscript is a preprint under review at Artificial Intelligence in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG 62%

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24543 2026-04-28 cs.CV 57%

RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting

RACANet:面向RGB-T人群计数的可靠性感知人群锚网络

Jinghao Shi, Mengqi Lei, Kunliang He, Yun Li, Wei Bao, Siqi Li

机构 * School of Computer Science, China University of Geosciences, Wuhan(中国地质大学(武汉)计算机科学学院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RACANet,通过两阶段融合框架解决RGB-T人群计数中跨模态融合的可靠性建模问题,引入轻量级预训练和局部锚点融合模块,提升计数精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24380 2026-04-28 cs.CL 57%

Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。

Comments Accepted at International Journal of Computer Vision (IJCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10334 2026-04-28 cs.CV 57%

SIMPLER: H&E-Informed Representation Learning for Structured Illumination Microscopy

SIMPLER: 基于H&E的结构光照明显微镜表示学习

Abu Zahid Bin Aziz, Syed Fahim Ahmed, Gnanesh Rasineni, Mei Wang, Olcaytu Hatipoglu, Marisa Ricci, Malaiyah Shaw, Guang Li, J. Quincy Brown, Valerio Pascucci, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah, Salt Lake City, UT 84112, USA Scientific Computing \& Imaging Institute, University of Utah, Salt Lake City, UT 84112, USA Instapath Inc., Houston, TX 77021 Tulane University, Department of Biomedical Engineering, New Orleans, Louisiana, United States

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SIMPLER框架,利用H&E作为语义锚点学习可重用的SIM表示,通过对抗、对比和重建目标逐步对齐SIM和H&E,提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23977 2026-04-28 cs.CV 57%

Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification

多视图协同学习与视觉-语言适应用于低资源生物医学图像分类

Xiaoliu Luo, Minxue Xiao, Ting Xie, Mengzhu Wang, Huiqing Qi, Joey Tianyi Zhou, Taiping Zhang, Xu Wang

机构 * Chongqing University of Technology(重庆理工大学) Collge of Computer Science, Sichuan University(四川大学计算机学院) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多视图协同学习框架,通过视觉-语言适应提升低资源下生物医学图像分类性能,采用多粒度对比学习和结构监督增强跨模态对齐与细粒度区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23467 2026-04-28 cs.LG cs.AI cs.AR 57%

Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

混合JIT-CUDA图优化用于低延迟大语言模型推理

Divakar Kumar Yadav, Tian Zhao

机构 * Department of Computer Science(计算机科学系) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) Milwaukee, WI, USA(美国威斯康星州密尔沃基)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23125 2026-04-28 cs.CV cs.LG 57%

Learning from Imperfect Text Guidance: Robust Long-Tail Visual Recognition with High-Noise Label

从不完美文本指导中学习:在高噪声标签下的鲁棒长尾视觉识别

Mengke Li, Haiquan Ling, Yiqun Zhang, Yang Lu, Hui Huang

机构 * CSSE, Shenzhen University(软件学院,深圳大学) SCST, Guangdong University of Technology(软件学院,广东技术大学) INFORMATICS, Xiamen University(信息学院,厦门大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用预训练视觉-语言模型的跨模态对齐能力,通过弱教师监督纠正长尾噪声数据中的标签-图像不一致问题,提升模型在高噪声环境下的识别性能。

Comments Accepted by CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00978 2026-04-28 cs.CL 57%

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

AWQ:基于激活的权重量化用于LLM压缩与加速

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han

机构 * MIT(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达) Tsinghua University(清华大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。

Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq

详情

展开后加载摘要…

URL PDF HTML 收藏