arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-01 至 2026-04-01 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2603.29828 2026-04-01 cs.AI cs.CL 62%

Owl-AuraID 1.0: An Intelligent System for Autonomous Scientific Instrumentation and Scientific Data Analysis

Owl-AuraID 1.0:自主科学仪器与科学数据分析的智能系统

Han Deng, Anqi Zou, Hanling Zhang, Ben Fei, Chengyu Zhang, Haobo Wang, Xinru Guo, Zhenyu Li, Xuzhu Wang, Peng Yang, Fujian Zhang, Weiyu Guo, Xiaohong Shao, Zhaoyang Liu, Shixiang Tang, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Suzhou Laboratory(苏州实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Owl-AuraID 1.0通过GUI原生范式实现科学仪器自动化,整合类型1(仪器操作)和类型2(数据分析)技能,支持FTIR、NMR等多种分析模态,为自主实验室提供可扩展的基础框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29163 2026-04-01 cs.CV 57%

SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving

SparseDriveV2:仅需评分即可实现端到端自动驾驶

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Xiang Li, Yining Shi, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Continental Technology(地平线大陆科技) Horizon(地平线)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SparseDriveV2,通过可扩展的词汇表示和评分策略提升端到端自动驾驶性能,实现在NAVSIM和Bench2Drive上的高评分和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 57%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 57%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28952 2026-04-01 cs.RO 50%

World2Rules: A Neuro-Symbolic Framework for Learning World-Governing Safety Rules for Aviation

World2Rules: 一种用于航空领域学习世界治理安全规则的神经符号框架

Haichuan Wang, Jay Patrikar, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 World2Rules通过结合神经网络和符号方法,从航空多模态数据中学习安全规则,提升规则的准确性和可解释性,实验显示其在F1得分上优于纯神经和单步神经符号基线。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28889 2026-04-01 cs.DB 50%

DeepEye: A Steerable Self-driving Data Agent System

DeepEye:一种可调节的自动驾驶数据代理系统

Boyan Li, Yiran Peng, Yupeng Xie, Sirong Lu, Yizhang Zhu, Xing Mu, Xinyu Liu, Yuyu Luo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。

Comments SIGMOD Demo (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 13 篇

2603.29211 2026-04-01 cs.AI cs.CL cs.CV 82%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29450 2026-04-01 cs.CV cs.AI 81%

Few-shot Writer Adaptation via Multimodal In-Context Learning

基于多模态上下文学习的少样本作家适应

Tom Simon, Stephane Nicolas, Pierrick Tranouez, Clement Chatelain, Thierry Paquet

机构 * LITIS EA4108, University of Rouen Normandy(LITIS EA4108,鲁昂诺曼底大学) LITIS EA4108, INSA of Rouen Normandy(LITIS EA4108,鲁昂诺曼底国立应用科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于多模态上下文学习的少样本手写体识别框架,通过少量目标作家样本实现推理时的作家适应,无需参数更新,实验在IAM和RIMES数据集上取得优于现有模型的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 79%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG 79%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 79%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29968 2026-04-01 cs.CV cs.AI 62%

Trimodal Deep Learning for Glioma Survival Prediction: A Feasibility Study Integrating Histopathology, Gene Expression, and MRI

三模态深度学习在胶质瘤生存预测中的应用:整合组织病理学、基因表达和MRI的可行性研究

Iain Swift, JingHua Ye

机构 * Munster Technological University(芒斯特理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了三模态深度学习在胶质瘤生存预测中的可行性,通过整合组织病理学、基因表达和MRI数据,评估了不同融合策略的效果,发现三模态早期融合在小样本下有初步的预测价值。

Comments 6 pages, 1 figure, submitted to the IEEE CBMS 2026 conference, still waiting for notification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 62%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL 62%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29784 2026-04-01 cs.CV 57%

MAPLE: Multi-Path Adaptive Propagation with Level-Aware Embeddings for Hierarchical Multi-Label Image Classification

MAPLE:多路径自适应传播与层次感知嵌入用于层次多标签图像分类

Boshko Koloski, Marjan Stoimchev, Jurica Levatić, Dragi Kocev, Sašo Džeroski

机构 * Jožef Stefan Institute(约热夫·斯特凡研究所) Jožef Stefan International Postgraduate School(约热夫·斯特凡国际研究生院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 MAPLE通过结合层次语义初始化、图结构编码和自适应多模态融合,有效提升遥感图像的层次多标签分类性能,在少样本场景下提升42%,参数开销仅增加2.6%。

Comments REO: Advances in Representation Learning for Earth Observation, accepted workshow paper at EurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29414 2026-04-01 cs.CV cs.RO 57%

Native-Domain Cross-Attention for Camera-LiDAR Extrinsic Calibration Under Large Initial Perturbations

本域交叉注意机制用于大初始扰动下的相机-激光雷达外校准

Ni Ou, Zhuo Chen, Xinru Zhang, Junzheng Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种本域交叉注意机制,通过直接对齐图像块和激光雷达点云实现可靠的跨模态交互,提升在大初始扰动下的外校准精度和鲁棒性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29478 2026-04-01 physics.ao-ph 50%

30-meter Land Surface Temperature from Landsat via Progressive Self-Training Downscaling

基于Landsat的30米地表温度降尺度方法

Huanfeng Shen, Chan Li, Menghui Jiang, Penghai Wu, Guanhao Zhang, Tian Xie

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一种渐进自训练框架,通过交叉模态融合网络在无需高精度地面数据的情况下,将Landsat地表温度降尺度至30米分辨率,提升了空间分辨率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29354 2026-04-01 eess.SP cs.SY eess.SY stat.ME 50%

ARC: Alignment-based RPM Estimation with Curvature-adaptive Tracking

基于对齐的无转速计转速估计与曲率自适应跟踪

Weiheng Hua, Changyu Hao

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出ARC方法,通过统一观测表示融合多个估计器,利用曲率感知的状态依赖运动先验,实现稳定且物理合理的轨迹估计,验证了不确定性感知的时间传播的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29205 2026-04-01 cs.HC 50%

BiMoE: Brain-Inspired Experts for EEG-Dominant Affective State Recognition

BiMoE:受脑启发的专家用于EEG主导的情感状态识别

Hongyu Zhu, Lin Chen, Mingsheng Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 BiMoE通过脑拓扑感知划分EEG信号,利用双流编码器提取局部和全局时空特征,结合多尺度大核卷积处理PPS,动态融合专家并通过联合损失函数提升多模态情感分类性能。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 4 篇

2603.29422 2026-04-01 cs.CV 79%

Multimodal Models Meet Presentation Attack Detection on ID Documents

多模态模型在身份证文档呈现攻击检测中的应用

Marina Villanueva, Juan M. Espin, Juan E. Tapia

机构 * Security Research Group Hochschule Darmstadt, Germany

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨了将视觉和文本模态结合,利用预训练多模态模型提升身份证文档呈现攻击检测性能,但实验表明这些模型在该任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04923 2026-04-01 cs.CV cs.AI 62%

REN: Anatomically-Informed Mixture-of-Experts for Interstitial Lung Disease Diagnosis

REN:基于解剖学的专家混合模型用于间质性肺病诊断

Alec K. Peltekian, Halil Ertugrul Aktas, Gorkem Durak, Kevin Grudzinski, Bradford C. Bemiss, Carrie Richardson, Jane E. Dematte, G. R. Scott Budinger, Anthony J. Esposito, Alexander Misharin, Alok Choudhary, Ankit Agrawal, Ulas Bagci

机构 * Department of Computer Science, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院计算机科学系) Division of Pulmonary and Critical Care Medicine, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院肺与危重症医学科) Division of Rheumatology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院风湿病科) Simpson Querrey Lung Institute for Translational Science, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院辛普森·奎雷转化科学肺研究所) Department of Electrical and Computer Engineering, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院电气与计算机工程系) Machine & Hybrid Intelligence Lab, Department of Radiology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院放射科机器与混合智能实验室)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出REN模型,通过解剖学指导的专家混合框架提升间质性肺病诊断性能,结合多模态门控机制和深度学习特征,实现更精确的病理变化建模。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24956 2026-04-01 cs.RO cs.AI cs.LG 57%

MSG: Multi-Stream Generative Policies for Sample-Efficient Robotic Manipulation

MSG:多流生成策略用于样本高效的机器人操作

Jan Ole von Hartz, Lukas Schweizer, Joschka Boedecker, Abhinav Valada

机构 * University of Freiburg(弗莱堡大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出MSG多流生成策略,通过结合多个对象中心策略提升泛化能力和样本效率,实现在五次演示下学习高质量生成策略,性能提升89%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29096 2026-04-01 stat.ME 50%

Efficient and Fast Sampling from Arbitrary Probability Kernels using Sliced Gibbs Sampler

通过切片吉布斯采样器高效快速地从任意概率核中采样

Prithwish Ghosh, Sujit K Ghosh

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出自动切片吉布斯框架,实现对任意有限维概率核的自动马尔可夫链蒙特卡洛采样,无需用户指定截断界、提议尺度、步长调优或条件优化,适用于非标准化、非光滑、重尾和高多模态密度。

Comments 27 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏