arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4874 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4874 篇

2607.13764 2026-07-16 cs.NE 新提交 78%

S-CARD-CMSA: A Score-Aware Candidate Archive with Density-Filtered Reporting for Multimodal Optimization

S-CARD-CMSA:一种用于多模态优化的具有密度过滤报告的分数感知候选存档

Dikshit Chauhan

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态优化,S-CARD-CMSA基于RS-CMSA-ESII构建,保留其核心机制并引入两个扩展。通过分数感知密度过滤报告规则平衡指标构建解集,开发实验显示其能减少冗余报告并提升相关指标,优化时不依赖真实全局最小位置信息。

Comments 11 pages, 2 figures with 7 subfigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10945 2026-07-14 cs.HC 新提交 78%

When Context Dominates: Multimodal Signatures of Takeover Readiness Under Varying Hazard and Cognitive Load Conditions

当情境占主导时:不同危险和认知负荷条件下接管准备的多模态特征

Shiva Azimi, Yasaman Hakiminejad, Luis Gomero, Elizabeth Pantesco, Irene P. Kan, Meltem Izzetoglu, Arash Tavakoli

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究在驾驶模拟器实验中探究危险类型、次要任务等因素对驾驶员接管行为的影响,采用多模态传感框架评估,发现危险情境是主要决定因素,为半自动车辆人机协作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09261 2026-07-13 cs.RO 新提交 78%

Validating Virtual Reality for Studying Multimodal Human-Robot Interaction in Socially Aware Robot Navigation

验证虚拟现实技术在社交感知机器人导航中研究多模态人机交互的有效性

Hariharan Arunachalam, Phani Teja Singamaneni, Rachid Alami

机构 * LAAS-CNRS, Universite de Toulouse(法国国家科学研究中心图卢兹分部,图卢兹大学) Inria Nancy(法国国家信息与自动化研究所南锡分部)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究VR在社交感知机器人导航中研究多模态人机交互的适用性,通过受试者内研究,让参与者在现实与VR环境中与机器人交互,结果显示VR能捕捉交互行为,可成为研究多模态行为的可靠灵活平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06651 2026-07-09 cs.LG 新提交 78%

Entropy-Guided Tensor Compression for Multimodal Federated Learning on Edge Devices

用于边缘设备上多模态联邦学习的熵引导张量压缩

Quoc Bao Phan, Tuy Tan Nguyen

机构 * FAMU-FSU College of Engineering, Florida State University(佛罗里达农工大学-佛罗里达州立大学工程学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对边缘设备上多模态联邦学习中客户端能力差异问题,提出熵引导的MESH-FL框架,通过截断奇异值分解估计频谱熵,自适应分配MPS压缩秩,实验表明该框架能高效压缩并提升准确率,减少传输数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07152 2026-07-09 math.OC physics.soc-ph 新提交 78%

Link-Based Multimodal Traffic Dynamics Model in Continuous-Time Framework

连续时间框架下基于链路的多模式交通动力学模型

Ning Xie, Lei Wei, Nikola Bešinović, Meng Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究提出连续时间框架下基于链路的多模式交通动力学模型M-LTM,通过移动瓶颈理论捕捉多模式交互,开发节点模型描述流量转移等,经案例研究验证其在网络交通分析管理中的预测能力与适用性,误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03263 2026-07-07 eess.SY cs.SY 新提交 78%

Multimodal Nonblocking Supervisory Control Synthesis

多模态非阻塞监督控制综合

Marijn Minkenberg, Michel Reniers, Martijn Goorden, Asia van de Mortel-Fronczak, Wan Fokkink

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究针对含故障行为等复杂系统模型,引入模态和多模态非阻塞特性,给出合成算法构建监督器,并通过实例说明新特性,与已有特性比较并给出蕴含条件。

Comments Submitted to CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04136 2026-07-03 eess.SP 版本更新 78%

FLAME: A Federated Learning Approach for Multi-Modal RF Fingerprinting

FLAME:一种用于多模态射频指纹识别的联邦学习方法

Kasra Borazjani, Kiarash Kianfar, Seyyedali Hosseinalipour, Rajeev Sahay

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出FLAME框架,通过多模态表示(超越I/Q样本)加速联邦学习在射频指纹识别中的训练,理论证明收敛更快且精度更高,实验验证其优越性。

Comments 21 pages, 16 figures. Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29629 2026-07-01 cs.DC 版本更新 78%

Energy-Efficient Multimodal Inference Serving with Tri-serve

能效多模态推理服务:Tri-serve

Ziyang Jia, Sara Rashidi Golrouye, Laxmi Bhuyan, Benjamin Kubwimana, Devashree Tripathy, Zexin Li, Cong Liu, Daniel Wong

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态推理服务中GPU硬件频率管理导致的三种能效问题,提出软件DVFS控制器Tri-serve,联合优化依赖停顿、算术强度影响和热节流,实现22%能效提升且无延迟或吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-06-29 q-bio.QM 版本更新 78%

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw, Brendan Honick, Bill Shirey, Lisa Choy, Nikolay Akhmetov, Shaokun An, David Betancur, Dominic Bordelon, Karl Burke, Ivan Cao-Berg, John Conroy, Chris Csonka, Penny Cuda, Sean Donahue, Stephen Fisher, Derek Furst, Ed Hanna, Josef Hardi, Tabassum Kakar, Mark S. Keller, Devin Lange, Xiang Li, Yan Ma, Alison McWilliams, Austen Money, Richard Morgan, Eric Moerth, Juan Muerto, Mark A. Musen, Emily Nic, Martin J. O'Connor, Gesina Phillips, Alexander J. Ropelewski, Ryan Sablosky, Sravani Saripalli, Max Sibilla, Derek Simmel, Alan Simmons, Xu Tang, Joel Welling, Zhou Yuan, Martin Hemberg, HuBMAP Consortium, Matthew Ruffalo, Jonathan Silverstein, Philip Blood, Nils Gehlenborg

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 43 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25188 2026-06-25 cs.LG 新提交 78%

Efficient Analytic Uncertainty Quantification for Multi-Modal Regression

多模态回归的高效解析不确定性量化

Kun Jin, James Harrison, Jiawei Li, Sihan Liu, Jiayi Liu, Randolph Linderman, Yuening Li, Arnab Bhadury, Sourabh Prakash Bansod, Liang Liu, Jasper Snoek

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对多模态回归中现有不确定性量化方法效率低或假设过强的问题,提出基于变分贝叶斯推断的统一框架,将分位数回归和分类恢复模型转化为解析ELBO和闭式预测密度,实现高效准确的不确定性量化,在三个大规模基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 78%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24350 2026-06-24 cs.RO 新提交 78%

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

SlipSense: 用于足式机器人在线滑移检测的多模态传感

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Institute for Infocomm Research, Agency for Science Technology and Research(资讯通信研究院,科技研究局)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出SlipSense框架,通过定制轻量化传感器足和LSTM模型,实现四足机器人基于力的在线滑移检测,早期滑移检测精度达24.1mm,准确率85.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20172 2026-06-19 cs.LG 新提交 78%

Predicting gestational age at birth in the context of preterm birth from multi-modal fetal MRI

基于多模态胎儿MRI预测早产背景下的出生胎龄

Diego Fajardo-Rojas, Megan Hall, Daniel Cromb, Mary A. Rutherford, Lisa Story, Emma C. Robinson, Jana Hutter

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出结合多模态胎儿MRI和机器学习流程预测出生胎龄,包括数据插补、特征选择和回归模型,在333例对照和93例早产数据上评估,R²=0.13,MAE=2.74周,准确率0.77。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:013

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19413 2026-06-19 cs.LG 新提交 78%

Does Text Actually Help? Uncovering and Resolving Text Collapse in Multimodal Time Series Forecasting

文本真的有用吗?揭示并解决多模态时间序列预测中的文本坍缩问题

Huu Hiep Nguyen, Minh Hoang Nguyen, Dung Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态时间序列预测中文本分支被忽视导致“文本坍缩”的问题,提出REST-TS方法,通过让文本分支专门预测数值主干无法解释的残差,强制其提取真实内容,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18287 2026-06-18 cs.LG 新提交 78%

Artemis: Anatomy-Resolved inTervention for Eliminating Multimodal NeuroImage confounderS

Artemis: 解剖分辨的干预方法用于消除多模态神经影像混杂因素

Siyuan Dai, Yang Du, Kun Zhao, Zhusuyi Chen, Heng Huang, Paul Thompson, Chao Shi, Haoteng Tang, Liang Zhan

机构 * University of Pittsburgh(匹兹堡大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) Binghamton University(宾汉姆顿大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出Artemis框架,通过区域级因果干预学习特定脑区的混杂因素表示,消除fMRI和DTI多模态神经影像中人口统计学混杂因素对GNN的影响,在三个基准上提升性能。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14358 2026-06-15 cs.CY 新提交 78%

Observing Teachers' Instrumental Pedagogical Orchestration in Synchronous Online Learning: A Multimodal Grid Based on Videoconferencing Traces

观察同步在线学习中教师的工具性教学编排:基于视频会议轨迹的多模态网格

Intissar Bamou, Christine Michel, Hassina El Kechai

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种基于视频会议轨迹的多模态观察网格,用于分析同步在线教学中教师的工具性教学编排,识别沟通手势、姿势、眼神和数字工具管理中的可观察指标。

Journal ref 18th International Conference on Computer Supported Education, May 2026, Benidorm, France. pp.1774-1781

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13699 2026-06-15 cs.DB 新提交 78%

A Multimodal Machine Learning Framework for Enterprise Database Workload-Aware Root Cause Analysis

一种面向企业数据库工作负载感知根因分析的多模态机器学习框架

Ruchi Pakhle, Siddhant Pawar

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出多模态机器学习框架,结合工作负载特征、系统遥测和操作信号,利用LightGBM等模型实现数据库根因分析,提升可解释性和自动化水平。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01880 2026-06-09 cs.RO 78%

Multimodal Large Language Models for Real-Time Situated Reasoning

多模态大语言模型用于实时情境推理

Giulio Antonio Abbo, Senne Lenaerts, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文探讨多模态大语言模型如何支持实时情境和价值感知决策,结合GPT-4o与模拟智能扫地机器人平台,展示其在家庭活动、社会规范和用户偏好推理中的能力,以及在清洁、舒适和安全等价值上的细致决策。

Comments Submitted to the interactivity track of the 21st ACM/IEEE International Conference on Human-Robot Interaction on December 2025, accepted January 2026

Journal ref HRI Companion 2026: Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05898 2026-06-05 stat.CO math.ST nlin.AO stat.TH 78%

Designing Zero-Mean Feature Functions for Multimodal Distributions

为多峰分布设计零均值特征函数

Hiroshi Yamashita, Hideyuki Suzuki

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多峰分布下控制变量法估计期望方差大的问题,提出基于分布近似和密度比的零均值特征函数构造方法,有效降低双峰分布的估计方差。

Comments 6 pages, 4 figures, 7 subfigures, submitted to the 2026 International Symposium on Nonlinear Theory and Its Applications (NOLTA2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12581 2026-06-04 cs.LG 78%

LMM-IR: Large-Scale Netlist-Aware Multimodal Framework for Static IR-Drop Prediction

LMM-IR:面向静态IR压降预测的大规模网表感知多模态框架

Kai Ma, Zhen Wang, Hongquan He, Qi Xu, Tinghuan Chen, Hao Geng

机构 * Tsinghua University(清华大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种基于大规模网表变换器和3D点云表示的多模态框架,用于快速准确地预测芯片静态IR压降,在ICCAD 2023竞赛中取得最佳F1分数和最低MAE。

Comments Accepted by DAC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.3267 2026-06-04 math.NA cs.NA 78%

Reconstruction of Multimodal Distributions for Hybrid Moment-based Chemical Kinetics, Supporting Information

多模态分布的重构用于混合矩基化学动力学,补充信息

Alexander Andreychenko, Linar Mikeev, Verena Wolf

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文比较了两种矩基分析方法(矩法和条件矩法)在重构多模态分布时的性能,发现条件矩法更适用于描述多模态分布并提高重构精度。

Comments 10 pages, 5 figures, supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.0077 2026-06-04 eess.SY cs.SY 78%

Multi-modal filtering for non-linear estimation

多模态过滤用于非线性估计

Sanket Kamthe, Jan Peters, Marc P Deisenroth

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出一种非线性滤波算法,利用高斯混合模型表示多模态密度,通过闭式估计参数提升时间序列和实际应用中的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03596 2026-06-03 astro-ph.HE stat.ML 78%

Multimodal Transformer Based Generic Mixture Density Network for Scattering Timescale Estimation of Fast Radio Bursts

基于多模态Transformer的通用混合密度网络用于快速射电暴散射时标估计

Bikash Kharel, Emmanuel Fonseca, Srinjoy Das, Mason Ng, Paul Scholz, Mawson W. Simmons, Lordrick Kahinga, Afrokk Khan

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出多模态Transformer通用混合密度网络(MT-GMDN),通过并行编码器融合FRB动态谱和时间序列特征,利用混合密度公式估计散射时标τ及其分布,在CHIME/FRB数据上达到94%的决定系数和90%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31337 2026-06-01 cs.CR 78%

When Entropy Is Not Enough: Multi-Modal Classification of Encrypted and Compressed Data Fragments

当熵不够时:加密和压缩数据片段的多模态分类

Fabio De Gaspari, Dorjan Hitaj, Samuele Salaris, Luigi V. Mancini

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对短数据片段(512-2048字节)中加密与压缩数据难以区分的问题,提出多模态集成架构Triumvir,融合统计、序列和空间表示,在二分类和多分类任务上分别提升高达4.5和6.4个百分点。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31050 2026-06-01 cs.LG 78%

Best-Arm Identification-Based Trust Region Selection for Bayesian Optimization on Multimodal Functions

基于最佳臂识别的多模态函数贝叶斯优化信任区域选择

Nobuo Namura, Sho Takemori

机构 * Fujitsu Limited(富士通有限公司)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种结合最佳臂识别与信任区域贝叶斯优化的轨迹感知框架,通过预测局部优化器最终性能并逐步淘汰次优候选,加速多模态函数全局优化。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17971 2026-05-29 cs.HC cs.ET 78%

Generating Multimodal Textures with a Soft Hydro-Pneumatic Haptic Ring

使用软水气动触觉环生成多模态纹理

Ana Sanz Cozcolluela, Koen Wosten, Yasemin Vardar

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种软触觉环,结合气动和液压驱动,通过数据驱动渲染方法在近端指骨上生成粗糙度、热感和软度等多模态纹理,用户研究显示平均纹理匹配精度为68%。

Comments 29 pages, 19 figures, journal

Journal ref International Journal of Human-Computer Studies. volume 212, pages 103814, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25894 2026-05-26 cs.LG q-fin.ST 78%

Predicting Stock Price Direction on Earnings Announcement Days using Multi-modal Deep Learning

使用多模态深度学习预测盈利公告日的股价方向

Manuel Noseda, Nathan Soldati, Marco Paina

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本研究结合基本面指标、技术指标和新闻情感,利用LSTM和Transformer模型预测盈利公告日的股价方向,发现Transformer在识别波动方面更敏感,且新闻情感有助于提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25734 2026-05-26 stat.AP stat.ME stat.ML 78%

Stein-Encoder: A White-Box Supervised Encoder via Stein Identities in Multi-Modal Studies

Stein-Encoder: 多模态研究中基于Stein恒等式的白盒监督编码器

Jiarui Zhang, Shuoxun Xu, Jiasheng Shi, Xinzhou Guo

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对多模态生物医学数据中基因与临床特征混杂的问题,提出Stein-Encoder白盒监督框架,利用Stein方法和残差化技术构建可解释的单指标,实现结构解耦并提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏