arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 80 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2604.12102 2026-04-16 cs.AI cs.CV cs.LG 62%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09581 2026-04-16 cs.AI cs.CY cs.HC 57%

Avenir-UX: Automated UX Evaluation via Simulated Human Web Interaction with GUI Grounding

Avenir-UX:通过模拟人类网络交互进行自动用户体验评估

Wee Joe Tan, Zi Rui Lucas Lim, Shashank Durgad, Karim Obegi, Aiden Yiliu Li

机构 * University College London(伦敦大学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Avenir-UX通过模拟人类交互行为,提供标准化的可用性评估,结合GUI接地技术,提升用户体验评估的效率和准确性,支持持续、可扩展的数据驱动测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14234 2026-04-16 cs.CV 57%

ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

ViBES:一个具有行为智能的3D虚拟身体对话代理

Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。

Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06477 2026-04-16 cs.AI 57%

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents

MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试

Pengxiang Zhao, Guangyi Liu, YaoZhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室) Peking University(北京大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.AI

AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.02249 2026-04-16 math.OC stat.ME 50%

Clustering sequence data with mixture Markov chains with covariates using multiple simplex constrained optimization routine (MSiCOR)

利用多重简单形约束优化程序(MSiCOR)对带有协变量的混合马尔可夫链进行序列数据聚类

Priyam Das, Deborshee Sen, Debsurya De, Jue Hou, Zahra S. H. Abad, Nicole Kim, Zongqi Xia, Tianxi Cai

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种基于模式搜索的全局优化方法,用于在简单形集合上优化目标函数,从而改进混合马尔可夫模型(MMM)参数估计。该方法在MS患者治疗序列聚类中表现出色,并结合协变量进行患者分群。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13128 2026-04-16 cs.MA cs.LG cs.RO cs.SY eess.SY 50%

Learning Probabilistic Responsibility Allocations for Multi-Agent Interactions

多智能体交互中的概率责任分配学习

Isaac Remy, Caleb Chang, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) NVIDIA

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种学习多智能体交互中概率责任分配模型的方法,通过条件变分自动编码器的潜在空间和多智能体轨迹预测技术,实现基于场景和智能体上下文的责任分配分布学习,展示了在INTERACTION驾驶数据集上的强预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07464 2026-04-16 cs.RO cs.SY eess.SY 50%

Safe and Nonconservative Contingency Planning for Autonomous Vehicles via Online Learning-Based Reachable Set Barriers

通过基于在线学习的可达集屏障实现自主车辆的安全非保守应急规划

Rui Yang, Lei Zheng, Shuzhi Sam Ge, Jun Ma

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于在线学习的实时应急轨迹优化框架,通过动态量化多模态HV不确定性并逐步细化其可达集,确保安全性和效率,在不确定环境下提升驾驶效率和乘客舒适度。

Comments 16 pages, 13 figures

Journal ref IEEE Trans. Control Syst. Technol., 2026, pp.1-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10703 2026-04-16 cs.LG eess.SP 50%

Hybrid Attention Model Using Feature Decomposition and Knowledge Distillation for Glucose Forecasting

基于特征分解和知识蒸馏的混合注意力模型用于血糖预测

Ebrahim Farahmand, Shovito Barua Soumma, Nooshin Taheri Chatrudi, Hassan Ghasemzadeh

机构 * College of Health Solutions at Arizona State University(亚利桑那州立大学健康解决方案学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出GlucoNet系统,通过特征分解和知识蒸馏提升血糖预测精度与效率,实现更准确的实时预测与干预。

Comments Final accepted version. IEEE TMC Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 8 篇

2604.14016 2026-04-16 cs.LG cs.AI 83%

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 83%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12319 2026-04-16 cs.CV 83%

RSGMamba: Reliability-Aware Self-Gated State Space Model for Multimodal Semantic Segmentation

RSGMamba:面向多模态语义分割的可靠性感知自门控状态空间模型

Guoan Xu, Yang Xiao, Guangwei Gao, Dongchen Zhu, Guo-Jun Qi, Wenjing Jia

机构 * Faculty of Engineering and Information Technology, University of Technology Sydney(工程与信息技术学院,悉尼技术大学) PCA Lab, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(教育部高维信息智能感知与系统重点实验室,南京理工大学计算机科学与工程学院) Bionic Vision Systems Laboratory, Shanghai Institute of Microsystem and Information Technology, Chinese Academy of Sciences(中国科学院上海微系统与信息技术研究所生物视觉系统实验室) Research Center for Industries of the Future and the School of Engineering, Westlake University(未来产业研究中心和工程学院,西湖大学) OPPO Research, Seattle, WA 98101 USA(OPPO研究,美国华盛顿州西雅图98101)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出RSGMamba框架,通过可靠性感知自门控机制提升多模态语义分割性能,实验表明其在RGB-D和RGB-T基准上取得最优结果,参数量仅48.6M。

Comments 7tables,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13247 2026-04-16 cs.CE 78%

Cross-Platform Domain Adaptation for Multi-Modal MOOC Learner Satisfaction Prediction

跨平台领域适应用于多模态MOOC学习者满意度预测

Jakub Kowalski, Magdalena Piotrowska

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文研究了在缺乏目标平台标签的情况下,利用跨平台领域适应技术进行多模态MOOC学习者满意度预测,提出ADAPT-MS框架,通过文本编码、跨平台表征对齐、评分偏差校正和缺失行为模态处理,提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06687 2026-04-16 cs.CV cs.AI 73%

Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation

面向几何的多模态对齐用于光场-激光雷达语义分割

Jie Luo, Yuxuan Jiang, Xin Jin, Mingyu Liu, Yihui Fan

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出融合光场数据和点云数据的多模态语义分割网络,通过特征补全和深度感知模块提升复杂场景下的分割性能,优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08486 2026-04-16 cs.CV cs.AI 62%

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images

视觉自我实现对齐:通过威胁相关图像塑造安全导向的人设

Qishun Yang, Shu Yang, Lijie Hu, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Provable Responsible AI and Data Analytics Lab(可证责任AI与数据分析实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) China University of Petroleum-Beijing at Karamay(北京石油大学克拉玛依校区)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉自我实现对齐方法,通过威胁相关图像训练视觉语言模型,塑造安全导向的人设,减少攻击成功率并提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 57%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13560 2026-04-16 cs.LG cs.ET quant-ph 50%

Parameter-efficient Quantum Multi-task Learning

参数高效的量子多任务学习

Hevish Cowlessur, Chandra Thapa, Tansu Alpcan, Seyit Camtepe

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出参数高效的量子多任务学习框架,通过量子预测头替代传统任务特定线性头,实现任务专一性与参数效率的平衡,实验表明在自然语言处理、医学影像和多模态讽刺检测等任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 4 篇

2602.05574 2026-04-16 cs.CV 79%

A Hybrid CNN and ML Framework for Multi-modal Classification of Movement Disorders Using MRI and Brain Structural Features

一种结合CNN和ML的混合框架用于利用MRI和脑结构性质进行运动障碍多模态分类

Mengyu Li, Ingibjörg Kristjánsdóttir, Thilo van Eimeren, Kathrin Giehl, Lotta M. Ellingsen, the ASAP Neuroimaging Initiative

机构 * University of Iceland, Faculty of Electrical and Computer Engineering(冰岛大学电气与计算机工程学院) University of Iceland, Faculty of Medicine(冰岛大学医学院) University of Cologne, Faculty of Medicine(科隆大学医学院) University Hospital Cologne, Dept. of Nuclear Medicine and Dept. of Neurology(科隆大学医院核医学科和神经内科) the ASAP Neuroimaging Initiative(ASAP神经影像倡议)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出结合CNN与ML的混合框架,用于区分APD亚型与PD及亚型间差异,利用MRI和脑结构性质数据实现高分类精度。

Comments To be published in Proceedings of SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14069 2026-04-16 cs.CV 57%

Towards Unconstrained Human-Object Interaction

迈向无约束的人-物交互

Francesco Tonini, Alessandro Conti, Lorenzo Vaquero, Cigdem Beyan, Elisa Ricci

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Fondazione Bruno Kessler(布鲁诺·克塞勒基金会) Department of Computer Science, University of Verona(威尼斯大学计算机科学系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过多模态大语言模型探索无约束人-物交互检测,提出无需预定义交互词汇的新任务,并展示MLLMs在该任务中的潜力。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05957 2026-04-16 cs.DC cs.AI 57%

Domain-Adaptive Model Merging Across Disconnected Modes

跨断开模式的领域适应性模型合并

Junming Liu, Yusen Zhang, Rongchao Zhang, Wenkai Zhu, Tian Wu

机构 * Tongji University(同济大学) Peking University(北京大学) Southeast University(东南大学) Nanchang University(南昌大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DMM框架,通过独立训练领域模型、合并相似模型及生成伪数据精炼知识,实现无需数据的模型合并,提升性能。

Comments 5 pages, 1 figure, 3 tables; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.04024 2026-04-16 stat.ME stat.CO 50%

Estimating the Optimal Linear Combination of Biomarkers using Spherically Constrained Optimization

利用球面约束优化估计生物标志物的最佳线性组合

Priyam Das, Debsurya De, Raju Maiti, Mona Kamal, Katherine A. Hutcheson, Clifton D. Fuller, Bibhas Chakraborty, Christine B. Peterson

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出基于模式搜索的无导数黑箱优化方法,用于估计多类响应中生物标志物的最佳线性组合,通过模拟研究验证其优于现有方法,应用于预测头颈癌放疗后吞咽困难。

详情

展开后加载摘要…

URL PDF HTML 收藏