arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2505.23752 2026-04-03 cs.CV 57%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 9 篇

2604.01667 2026-04-03 cs.AI cs.CV 81%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01924 2026-04-03 cs.CL 79%

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

临床文本足够吗?关于心力衰竭患者死亡预测的多模态研究

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究比较了文本、结构化数据和多模态方法在心力衰竭患者短期死亡预测中的表现,发现实体层面的表示能提升预测性能,而监督多模态融合表现最佳。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02108 2026-04-03 cs.RO cs.LG 78%

Cross-Modal Visuo-Tactile Object Perception

跨模态视觉-触觉物体感知

Anirvan Dutta, Simone Tasciotti, Claudia Cusseddu, Ang Li, Panayiota Poirazi, Julijana Gjorgjieva, Etienne Burdet, Patrick van der Smagt, Mohsen Kaboli

机构 * BMW Group AG(宝马集团) Imperial College of Science, Technology and Medicine(帝国理工学院) University of Crete(克里特大学) Institute of Molecular Biology and Biotechnology, Foundation for Research and Technology-Hellas(分子生物学与生物技术研究所,研究与技术基金会-希腊) Technical University of Munich(慕尼黑工业大学) Eötvös Loránd University(罗兰大学) Foundation Robotics Labs(基础机器人实验室) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态潜在滤波器(CMLF),通过贝叶斯推断实现视觉与触觉信息的双向传递,提升机器人在不确定性下的物理属性估计效率与鲁棒性,同时展现类人感知耦合现象。

Comments 23 pages, 8 figures, 1 table. Submitted for review to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01579 2026-04-03 cs.CV cs.AI 73%

Harmonized Tabular-Image Fusion via Gradient-Aligned Alternating Learning

通过梯度对齐交替学习实现表-图像融合

Longfei Huang, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAAL方法,通过对齐模态梯度解决多模态表-图像融合中的梯度冲突问题,提升融合性能。

Comments ICME 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02206 2026-04-03 cs.LG cs.AI 57%

LEO: Graph Attention Network based Hybrid Multi Sensor Extended Object Fusion and Tracking for Autonomous Driving Applications

LEO:基于图注意力网络的混合多传感器扩展物体融合与跟踪用于自动驾驶应用

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiss

机构 * Research and Development, Mercedes-Benz AG, Germany(德国梅赛德斯-奔驰集团研发部)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 LEO结合图注意力网络融合多模态传感器数据,实现动态物体形状和轨迹的准确估计,具备自适应融合权重和跨传感器类型的一致性跟踪能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01893 2026-04-03 cs.CV 57%

ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery

ProVG:通过语言解耦实现遥感图像的渐进式视觉定位

Ke Li, Ting Wang, Di Wang, Yongshan Zhu, Yiming Zhang, Tao Lei, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 ProVG通过解耦语言表达为全局上下文、空间关系和对象属性,提出一种改进遥感图像定位精度的新框架,采用渐进式跨模态调节器和跨尺度融合模块,实现更精确的视觉语言对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01498 2026-04-03 cs.MM 57%

Semantic Compensation via Adversarial Removal for Robust Zero-Shot ECG Diagnosis

通过对抗性移除实现语义补偿的鲁棒零样本ECG诊断

Hongjun Liu, Rujun Han, Leyu Zhou, Chao Yao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出SCAR框架,通过对抗性移除提升ECG与语言预训练的鲁棒性,解决部分缺失情况下语义对齐问题,并引入CMRS评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI 57%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01526 2026-04-03 cs.LG 50%

Learning ECG Image Representations via Dual Physiological-Aware Alignments

通过双生理感知对齐学习ECG图像表示

Hung Manh Pham, Jialu Tang, Aaqib Saeed, Dong Ma, Bin Zhu, Pan Zhou

机构 * University of Cambridge(剑桥大学) Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ECG-Scan框架,通过多模态对比对齐和软导联约束,提升ECG图像表示学习效果,验证了图像模型在心血管诊断中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 6 篇

2604.02221 2026-04-03 cs.HC cs.AI 79%

Impact of Multimodal and Conversational AI on Learning Outcomes and Experience

多模态和对话式AI对学习成果和体验的影响

Karan Taneja, Anjali Singh, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究比较了三种生物学学习方法,发现多模态对话式AI在学习成果和体验上表现最佳,但文本仅对话式AI虽易用但效果最差,揭示了认知负荷理论下的学习效果与感知之间的差异。

Comments 16 pages, 3 figures, Accepted to AIED 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01921 2026-04-03 cs.CV cs.LG cs.RO 79%

Learning Spatial Structure from Pre-Beamforming Per-Antenna Range-Doppler Radar Data via Visibility-Aware Cross-Modal Supervision

通过可见性感知的跨模态监督学习从预波束成形每根天线范围-多普勒雷达数据中学习空间结构

George Sebastian, Philipp Berthold, Bianca Forkel, Leon Pohl, Mirko Maehlisch

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文探讨了能否直接从预波束成形的每根天线范围-多普勒测量中学习有意义的空间结构,通过可见性感知的跨模态监督学习方法,评估了不同发射配置对几何恢复能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01390 2026-04-03 cs.RO 78%

A soft and lightweight fabric-based pneumatic interface for multimodal fingertip tactile feedback

一种柔软且轻量的基于织物的气动接口用于多模态指尖触觉反馈

Rui Chen, Daniele Leonardis, Antonio Frisoli

机构 * Institute of Mechanical Intelligence, School of Advanced Studies Sant’Anna (SSSA)(机械智能研究所,圣安娜高等研究学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种基于织物的气动接口,实现轻量、低成本的多模态指尖触觉反馈,通过实验验证其在触觉渲染中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 62%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02299 2026-04-03 cs.CR 50%

PARD-SSM: Probabilistic Cyber-Attack Regime Detection via Variational Switching State-Space Models

PARD-SSM:通过变分切换状态空间模型进行概率性网络攻击检测

Prakul Sunil Hiremath, PeerAhammad M Bagawan, Sahil Bhekane

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出PARD-SSM模型,通过变分方法建模网络流量为依赖于四个隐藏状态的切换线性动态系统,实现对网络攻击阶段的实时检测,并在CICIDS2017和UNSW-NB15数据集上取得高F1分数和低延迟的检测性能。

Comments 18 pages, 3 figures, 3 tables, code available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10600 2026-04-03 stat.ML cs.LG cs.NA math.NA 50%

Weighted quantization using MMD: From mean field to mean shift via gradient flows

基于MMD的加权量化:从均场到均移流通过梯度流

Ayoub Belhadji, Daniel Sharp, Youssef Marzouk

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出基于MMD的加权量化方法,结合梯度流和均移算法,提升高维多模态数据的鲁棒性。

Journal ref AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏