arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 196 篇

2607.09261 2026-07-13 cs.RO 新提交 78%

Validating Virtual Reality for Studying Multimodal Human-Robot Interaction in Socially Aware Robot Navigation

验证虚拟现实技术在社交感知机器人导航中研究多模态人机交互的有效性

Hariharan Arunachalam, Phani Teja Singamaneni, Rachid Alami

机构 * LAAS-CNRS, Universite de Toulouse(法国国家科学研究中心图卢兹分部,图卢兹大学) Inria Nancy(法国国家信息与自动化研究所南锡分部)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究VR在社交感知机器人导航中研究多模态人机交互的适用性,通过受试者内研究,让参与者在现实与VR环境中与机器人交互,结果显示VR能捕捉交互行为,可成为研究多模态行为的可靠灵活平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06651 2026-07-09 cs.LG 新提交 78%

Entropy-Guided Tensor Compression for Multimodal Federated Learning on Edge Devices

用于边缘设备上多模态联邦学习的熵引导张量压缩

Quoc Bao Phan, Tuy Tan Nguyen

机构 * FAMU-FSU College of Engineering, Florida State University(佛罗里达农工大学-佛罗里达州立大学工程学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对边缘设备上多模态联邦学习中客户端能力差异问题,提出熵引导的MESH-FL框架,通过截断奇异值分解估计频谱熵,自适应分配MPS压缩秩,实验表明该框架能高效压缩并提升准确率,减少传输数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07152 2026-07-09 math.OC physics.soc-ph 新提交 78%

Link-Based Multimodal Traffic Dynamics Model in Continuous-Time Framework

连续时间框架下基于链路的多模式交通动力学模型

Ning Xie, Lei Wei, Nikola Bešinović, Meng Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究提出连续时间框架下基于链路的多模式交通动力学模型M-LTM,通过移动瓶颈理论捕捉多模式交互,开发节点模型描述流量转移等,经案例研究验证其在网络交通分析管理中的预测能力与适用性,误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03263 2026-07-07 eess.SY cs.SY 新提交 78%

Multimodal Nonblocking Supervisory Control Synthesis

多模态非阻塞监督控制综合

Marijn Minkenberg, Michel Reniers, Martijn Goorden, Asia van de Mortel-Fronczak, Wan Fokkink

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究针对含故障行为等复杂系统模型,引入模态和多模态非阻塞特性,给出合成算法构建监督器,并通过实例说明新特性,与已有特性比较并给出蕴含条件。

Comments Submitted to CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25188 2026-06-25 cs.LG 新提交 78%

Efficient Analytic Uncertainty Quantification for Multi-Modal Regression

多模态回归的高效解析不确定性量化

Kun Jin, James Harrison, Jiawei Li, Sihan Liu, Jiayi Liu, Randolph Linderman, Yuening Li, Arnab Bhadury, Sourabh Prakash Bansod, Liang Liu, Jasper Snoek

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对多模态回归中现有不确定性量化方法效率低或假设过强的问题,提出基于变分贝叶斯推断的统一框架,将分位数回归和分类恢复模型转化为解析ELBO和闭式预测密度,实现高效准确的不确定性量化,在三个大规模基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 78%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24350 2026-06-24 cs.RO 新提交 78%

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

SlipSense: 用于足式机器人在线滑移检测的多模态传感

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Institute for Infocomm Research, Agency for Science Technology and Research(资讯通信研究院,科技研究局)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出SlipSense框架,通过定制轻量化传感器足和LSTM模型,实现四足机器人基于力的在线滑移检测,早期滑移检测精度达24.1mm,准确率85.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20172 2026-06-19 cs.LG 新提交 78%

Predicting gestational age at birth in the context of preterm birth from multi-modal fetal MRI

基于多模态胎儿MRI预测早产背景下的出生胎龄

Diego Fajardo-Rojas, Megan Hall, Daniel Cromb, Mary A. Rutherford, Lisa Story, Emma C. Robinson, Jana Hutter

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出结合多模态胎儿MRI和机器学习流程预测出生胎龄,包括数据插补、特征选择和回归模型,在333例对照和93例早产数据上评估,R²=0.13,MAE=2.74周,准确率0.77。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:013

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19413 2026-06-19 cs.LG 新提交 78%

Does Text Actually Help? Uncovering and Resolving Text Collapse in Multimodal Time Series Forecasting

文本真的有用吗?揭示并解决多模态时间序列预测中的文本坍缩问题

Huu Hiep Nguyen, Minh Hoang Nguyen, Dung Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态时间序列预测中文本分支被忽视导致“文本坍缩”的问题,提出REST-TS方法,通过让文本分支专门预测数值主干无法解释的残差,强制其提取真实内容,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18287 2026-06-18 cs.LG 新提交 78%

Artemis: Anatomy-Resolved inTervention for Eliminating Multimodal NeuroImage confounderS

Artemis: 解剖分辨的干预方法用于消除多模态神经影像混杂因素

Siyuan Dai, Yang Du, Kun Zhao, Zhusuyi Chen, Heng Huang, Paul Thompson, Chao Shi, Haoteng Tang, Liang Zhan

机构 * University of Pittsburgh(匹兹堡大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) Binghamton University(宾汉姆顿大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出Artemis框架,通过区域级因果干预学习特定脑区的混杂因素表示,消除fMRI和DTI多模态神经影像中人口统计学混杂因素对GNN的影响,在三个基准上提升性能。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14358 2026-06-15 cs.CY 新提交 78%

Observing Teachers' Instrumental Pedagogical Orchestration in Synchronous Online Learning: A Multimodal Grid Based on Videoconferencing Traces

观察同步在线学习中教师的工具性教学编排:基于视频会议轨迹的多模态网格

Intissar Bamou, Christine Michel, Hassina El Kechai

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种基于视频会议轨迹的多模态观察网格,用于分析同步在线教学中教师的工具性教学编排,识别沟通手势、姿势、眼神和数字工具管理中的可观察指标。

Journal ref 18th International Conference on Computer Supported Education, May 2026, Benidorm, France. pp.1774-1781

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13699 2026-06-15 cs.DB 新提交 78%

A Multimodal Machine Learning Framework for Enterprise Database Workload-Aware Root Cause Analysis

一种面向企业数据库工作负载感知根因分析的多模态机器学习框架

Ruchi Pakhle, Siddhant Pawar

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出多模态机器学习框架,结合工作负载特征、系统遥测和操作信号,利用LightGBM等模型实现数据库根因分析,提升可解释性和自动化水平。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16709 2026-08-18 cs.CV cs.AI cs.LG 新提交 76%

MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

MIRROR:多模态智能放射学推理与观察报告生成器

Vignesh Nagarajan, Sriram Venkatapathy

机构 * Texas A&M University(德克萨斯农工大学) Capital One(第一资本金融公司) IIT Hyderabad(印度理工学院海得拉巴分校)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 MIRROR是一款多模态智能放射学报告生成原型,通过分离分类、定位与文本生成环节实现可审计的放射学发现,在ChestMNIST数据集上达到0.729的宏平均AUROC,但受类别不平衡影响存在决策弃权问题。

Comments 8 pages, 5 figures, 5 tables, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09482 2026-08-11 cs.CV cs.AI 新提交 76%

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance

超越统一恢复:利用像素级多模态引导赋能全场景恢复

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 针对全场景图像恢复现有方法采用统一策略忽略区域退化差异的问题,提出MGN-AIR框架,通过像素级多模态引导实现更精细恢复,在多任务基准上性能显著优于现有方法。

Comments Accepted by ACMMM2026 as Oral Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04154 2026-08-06 cs.CV cs.AI 新提交 76%

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation

TRNet:用于多模态水稻分割的地形引导频率校正与结构感知解码

Kaiwen Xiao, Chunlong Fu, Liping Zheng, Yanfeng Su

机构 * School of Computer Science, Sichuan University Jinjiang College(四川大学锦江学院计算机学院)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 TRNet模型针对山区丘陵水稻分割难题,采用双编码器与地形引导解码,在A、B区域水稻IoU较双编码器U-Net显著提升,验证了地形作为上下文先验的有效性。

Comments 16 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 76%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.MM

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 74%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他多模态 :multimodal(title);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22046 2026-06-23 cs.RO 新提交 71%

A Multimodal Tiltwing Framework for Bioinspired Aerial Robots

一种用于仿生空中机器人的多模态倾转机翼框架

Krispin C. V. Broers, Sophie F. Armanini

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 其他多模态 :multimodal(title)

AI总结 提出一种可切换悬停、高速前飞和高效滑翔的多模态倾转机翼框架,通过双独立扑翼推力矢量控制增强机动性,并采用混合苏格兰轭扑动机构实现宽扑动角度以利用拍合效应。

Comments 18 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17151 2026-08-19 cs.CV cs.LG 新提交 70%

Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport

基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正

Xiang Li, Yuqi Wang, Casey C. Heirman, Jihye Heo, Kyle J. Lafata

机构 * Duke University(杜克大学)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。

Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06919 2026-08-10 cs.CV cs.RO 新提交 70%

Vernata: Self-Supervised Learning of LiDAR Point Representations

Vernata:激光雷达点表示的自监督学习

Oliver Lemke, Alexander Liniger, Abel Gawel, Marco Hutter

机构 * Robotics and AI Institute(机器人与人工智能研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出基于Sonata架构的Vernata自监督学习框架,通过三项扩展优化激光雷达点云表示,在多数据集上相比基线取得显著性能提升,模态减少场景下仍保持竞争力

Comments IROS 2026. Implementation: https://github.com/rai-opensource/vernata

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24187 2026-07-28 cs.AI 新提交 70%

Myopia Prevention and Control 3.0: Artificial Intelligence--Driven Risk Stratification, Proactive Monitoring, and Personalized Intervention

近视防控3.0:人工智能驱动的风险分层、主动监测和个性化干预

Tieniu Wang, Cangzhu Huang, Qianhui Li

机构 * Shanghai Nile Intelligent Technology Co., Ltd.(上海尼罗智能科技有限公司) Beijing Tanyuan Academy of Intelligent Sensing(北京潭渊智能传感研究院)

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究借助人工智能、数字传感等技术推动近视防控从被动变主动精准模式。通过多模态数据机器学习预测风险、可穿戴等监测及个性化干预形成闭环。评估各阶段证据,讨论相关挑战并给出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23356 2026-06-23 cs.CV cs.LG 新提交 70%

Changing Modalities: Adapting Remote Sensing Models to New Satellites and Sensors

改变模态:将遥感模型适应新卫星和传感器

Tim G. Zhou, Anthony Fuller, Geoff Pleiss, Evan Shelhamer

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Carleton University(卡尔顿大学)

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 针对遥感模型在新卫星和传感器上的部署问题,提出DeluluNet架构,通过模态幻觉实现模态迁移、添加和子集三种场景下的模型适应,无需重新标注。

Comments 17 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17953 2026-06-17 cs.CV 新提交 70%

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

MLLMs 先正确后错误:追踪并纠正后层文本偏见

Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Intelligent Game and Decision Lab(智能博弈与决策实验室)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 发现多模态大语言模型在中间层形成正确视觉预测,但最终输出时被文本覆盖,通过检测预测方向变化(85%失败转向文本,89%成功转向视觉)提出无训练方法CALRD,在冲突基准上提升高达9.4%。

Comments Accepted at IJCAI 2026. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04033 2026-08-06 cs.CR 新提交 67%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29404 2026-08-03 math.DS 新提交 67%

Decomposition-based Energy-based Dual-Phase Dynamics Identification for Nonlinear MDOF Systems

基于分解的非线性多自由度系统能量双相动力学辨识方法

Sayantan Ghosh, Cristian López, Aryan Singh, Keegan J. Moore

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 本研究将能量双相动力学辨识(EDDI)扩展至多自由度系统,提出基于分解的EDDI方法,经两层塔结构实验验证,可有效辨识复杂多模态非线性结构动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交 67%

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14377 2026-08-17 cs.CL cs.CV 新提交 62%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25324 2026-07-29 cs.CV cs.AI 新提交 62%

Balanced Soft mixture-of-expert model for Glaucoma Detection

用于青光眼检测的平衡软专家混合模型

Sai Venkatesh Chilukoti, Krishna Rauniyar, Min Shi, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) School of Computing and Informatics(计算与信息学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对青光眼检测,提出含三个专家及负载平衡损失的平衡软专家混合模型,解决多模态学习问题,其性能通过AUC衡量,超越多种基线和模型,还可推广至其他疾病检测。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 62%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14769 2026-07-17 cs.CL cs.AI cs.MA 新提交 62%

Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition

使用以主题和参与者为中心的分解方法进行具有情感动态的对话摘要

Linyun Xiang, Mark Neerincx, Stephanie Tan

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话摘要问题,提出基于改进分层智能体链方法的框架,从主题和参与者两个视角分解对话,结合自动推断情感生成摘要,并引入情感轨迹指标评估,实验表明其框架能生成含语义和情感内容的摘要,凸显方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏