arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2603.15818 2026-03-18 cs.CV 83%

Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition

具有冲突意识的多模态融合用于矛盾与犹豫识别

Salah Eddine Bekhouche, Hichem Telli, Azeddine Benlamoudi, Salah Eddine Herrouz, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Laboratory of LESIA, University of Biskra(贝斯克拉大学LESIA实验室) Lab. de Génie Electrique (LAGE), University Kasdi Merbah Ouargla(奥尔加拉大学LAGE实验室) Institute of Electronics, Microelectronics and Nanotechnology (IEMN), Polytechnic University of Hauts-de-France, University of Lille(电子、微电子与纳米技术研究所(IEMN),法国 Hauts-de-France 工业大学,里尔大学) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE(索邦人工智能中心,索邦大学阿布扎比校区,阿联酋)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ConflictAwareAH框架,通过多模态融合识别矛盾与犹豫状态,提升F1指标,采用冲突特征作为双向线索,改进模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16259 2026-03-18 cs.MM 79%

Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction

双曲多模态生成表示学习用于广义零样本多模态信息提取

Baohang Zhou, Kehui Song, Rize Jin, Yu Zhao, Xuhui Sui, Xinying Qian, Xingyue Guo, Ying Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出双曲多模态生成表示学习框架HMGRL,解决零样本多模态信息提取中见与不见类别共存的问题,通过双曲空间建模多级语义关联,提升模型泛化能力。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 79%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19596 2026-03-18 eess.SP cs.LG 78%

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16482 2026-03-18 cs.CV cs.AI 62%

DST-Net: A Dual-Stream Transformer with Illumination-Independent Feature Guidance and Multi-Scale Spatial Convolution for Low-Light Image Enhancement

DST-Net:一种双流Transformer,具有光照无关特征引导和多尺度空间卷积的低光照图像增强

Yicui Shi, Yuhan Chen, Xiangfei Huang, Zhenguo Wang, Wenxuan Yu, Ying Fang

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Shanghai Zhenhua Heavy Industries Co.,Ltd.(上海震华重工有限公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DST-Net,通过光照无关特征引导和多尺度空间卷积提升低光照图像增强效果,解决传统方法在信号先验丢失的问题,实验表明其在主观和客观指标上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16245 2026-03-18 cs.CV cs.CL 62%

How to Utilize Complementary Vision-Text Information for 2D Structure Understanding

如何利用互补的视觉-文本信息进行2D结构理解

Jiancheng Dong, Pengyue Jia, Derong Xu, Jiawei Cheng, Jingyu Peng, Chao Zhang, Bowen Liu, Xin Sun, Lixin Su, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出DiVA-Former架构,通过动态查询视觉标记将长文本序列压缩为摘要向量,有效整合视觉与文本信息,在13个表格基准测试中提升23.9%。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15965 2026-03-18 cs.CL cs.AI 62%

MoLoRA: Composable Specialization via Per-Token Adapter Routing

MoLoRA:通过每token适配器路由实现可组合的专精

Shrey Shah, Justin Wagle

机构 * Microsoft(微软)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MoLoRA通过每token适配器路由实现可组合专精,优于规模扩展:MoLoRA使Qwen3-1.7B在四个推理基准上超越Qwen3-8B,且小4.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13000 2026-03-18 cs.CV 61%

Omni Survey for Multimodality Analysis in Visual Object Tracking

多模态分析在视觉目标跟踪中的全方位调研

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Hui Li, Shaochuan Zhao, Tao Zhou, Chunyang Cheng, Xiaojun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Technology, China University of Mining and Technology(中国矿业大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey 大学视觉、语音与信号处理中心)

专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV

AI总结 本文从多模态分析角度调研了多模态视觉目标跟踪(MMVOT)的关键问题,涵盖数据收集、模态对齐、标注、模型设计与评估,分析了现有方法的分类及挑战,并首次探讨了多模态跟踪的适用性及数据集中的类别分布。

Comments The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV 57%

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21637 2026-03-18 cs.CV 57%

CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

CARE:一种具有自适应区域建模的分子引导基础模型用于全切片图像分析

Di Zhang, Zhangpeng Gong, Xiaobo Pang, Jiashuai Liu, Junbo Lu, Hao Cui, Jiusong Ge, Zhi Zeng, Kai Yi, Yinghua Li, Si Liu, Tingsong Yu, Haoran Wang, Mireia Crispin-Ortuzar, Weimiao Yu, Chen Li, Zeyu Gao

机构 * Xi’an Jiaotong University(西安交通大学) University of Cambridge(剑桥大学) KingMed(康方生物) BGI Research(贝登基因研究院) A ⋆ STAR

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CARE通过自适应区域建模和分子引导,提升全切片图像分析的性能,实现对病理区域的精准识别与分类,优于现有基础模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18444 2026-03-18 cs.CV 57%

SineProject: Machine Unlearning for Stable Vision Language Alignment

SineProject:用于稳定视觉语言对齐的机器反遗忘

Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21524 2026-03-18 cs.AI cs.IT math.IT 57%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏