arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4721 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4721 篇

2606.09907 2026-06-10 cs.LG cs.AI 新提交 79%

LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

Maxx Richard Rahman, Prakhar Kumar, Wolfgang Maass

机构 * German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出LongMoE框架,通过上下文感知插补、注意力标记化、轨迹感知编码和稀疏MoE路由,联合解决临床多模态学习中模态缺失和纵向动态两大挑战,在ADNI等数据集上验证了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20850 2026-06-10 cs.CV cs.RO 版本更新 79%

Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

Glove2Hand:从多模态传感手套合成自然的手-物体交互

Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan

机构 * Meta Reality Labs(Meta现实实验室) Rutgers University(罗格斯大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出Glove2Hand框架,将多模态传感手套视频转化为逼真的裸手,并保留物理交互动态;引入3D高斯手模型和扩散手恢复器,创建HandSense数据集,提升下游任务性能。

Comments CVPR 2026 Highlight. This version includes the motion retarget process in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新 79%

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02246 2026-06-02 cs.CV 79%

Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark

Ego-METAS:面向自我中心的在线多模态节能时间动作分割基准

Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus, Giovanni Maria Farinella, Antonino Furnari

机构 * University of Zaragoza - I3A(萨拉戈塔大学 - I3A) Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 为解决资源受限设备上的能耗感知问题,提出了首个自我中心在线多模态节能时间动作分割基准Ego-METAS,包含超过100小时未裁剪视频和5种模态,要求模型动态选择传感器并遵守能量预算,评估显示最优路由高度依赖场景,现有方法难以适应连续环境。

Comments Project Page: https://maria-sanvil.github.io/Ego-METAS-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02105 2026-06-02 cs.CV 79%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01224 2026-06-02 cs.AI 79%

Advanced Mathematics Learning Behavior Prediction and Academic Early Warning Model Based on Multimodal Data Analysis

基于多模态数据分析的高等数学学习行为预测与学业预警模型

Liu Qiong, Li Zhengbo

机构 * Moutai Institute(莫 tai 院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对高等数学教育中高风险学生早期识别与干预的挑战,提出一种融合知识图谱与多模态时序建模的动态预测框架,通过异构注意力机制和自适应边权重实现精准预警与个性化干预。

Comments 12 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12263 2026-06-02 cs.AI cs.LG 79%

InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning

InPhyRe 发现:大型多模态模型在归纳物理推理中表现不佳

Gautam Sreekumar, Vishnu Naresh Boddeti

机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出 InPhyRe 基准测试,通过合成视频中的碰撞事件预测任务,评估大型多模态模型在未见物理定律下的归纳物理推理能力,发现其依赖有限参数知识、受语言偏差影响且忽略视觉输入。

Comments Accepted to TMLR. 53 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11326 2026-06-02 cs.CV 79%

SCL: Towards Domain Generalization via Single-Temporal Multimodal Contrastive Learning for Remote Sensing Change Detection

SCL:面向遥感变化检测的单时相多模态对比学习域泛化方法

Qiangang Du, Jinlong Peng, Xu Chen, Qingdong He, Liren He, Qiang Nie, Mingmin Chi

机构 * Fudan University(复旦大学) Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出基于视觉-语言预训练模型的单时相多模态对比学习(SCL)基础模型,结合动态文本-视觉上下文优化(DTCO)和可控生成与单时相训练策略(SAIN),无需目标数据集训练即可实现遥感变化检测的跨数据集泛化。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30742 2026-06-01 cs.CV 79%

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

注释并非全部所需:面向无监督时间语句定位的跨模态知识迁移网络

Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Yu Cheng, Keke Tang, Kai Zou

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全学院) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Henan University(河南大学) The Chinese University of Hong Kong(香港中文大学) Guangzhou University(广州大学) Protagolabs Inc.(Protagolabs公司)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出跨模态知识迁移网络,通过从图像-名词和视频-动词任务中迁移实体感知和事件感知知识,实现无监督时间语句定位,无需配对视频-查询标注。

Comments Published in Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27737 2026-05-28 cs.CV 79%

Bounded-Compute Multimodal Regression for Product-Rating Prediction

有界计算多模态回归用于产品评分预测

William Leach, Ru He, Sizhuo Ma, Yizhen Jia, Min Cao, Jian Wang, Rick Cao

机构 * Snap Inc.

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对严格延迟预算下的标量回归任务,提出一种有界计算适配方法,通过替换语言模型头为轻量MLP并固定输入,在LoViF 2026挑战赛中实现高效多模态回归。

Comments Accepted to the LoViF Workshop at CVPR 2026. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27451 2026-05-28 cs.CV 79%

From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition

从情感到复杂行为:第十届ABAW研讨会与竞赛推进多模态以人为中心的人工智能

Dimitrios Kollias, Panagiotis Tzirakis, Alan Cowen, Stefanos Zafeiriou, Irene Kotsia, Eric Granger, Marco Pedersoli, Simon Bacon, Jens Madsen, Soufiane Belharbi, Muhammad Haseeb Aslam, Chunchang Shao, Guanyu Hu

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Hume AI Google Deepmind(谷歌DeepMind) Imperial College London(伦敦帝国理工学院) Cogitat LIVIA ILLS ETS Montreal(蒙特利尔ETS) Concordia University(Concordia大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文介绍了第十届ABAW研讨会与竞赛,通过多模态挑战和论文,推动真实环境下人类情感与行为的建模、分析和理解。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14862 2026-05-26 cs.CV cs.DC 79%

Multi-modal video data-pipelines for machine learning with minimal human supervision

最小人工监督的机器学习多模态视频数据管道

Mihai-Cristian Pîrvu, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy "Simion Stoilow"(罗马尼亚科学院数学研究所 "Simion Stoilow") Faculty of Automatic Control and Computer Science, National University of Science and Technology POLITEHNICA(自动控制与计算机科学系,波兰技术大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一种全自动数据管道,利用预训练专家模型和程序化组合,在无需人工监督下融合多种视觉模态,并基于PHG-MAE模型实现高效蒸馏,以低参数(<1M)达到与300M参数模型竞争的性能,部署于实时语义分割和深度估计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24691 2026-05-26 cs.CV 79%

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

AdaFuse-Det: 自适应跨模态融合事件相机用于低光照RGB图像中的鲁棒目标检测

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N

机构 * SRM University AP, India(印度SRM大学AP分校) Aptiv, Bengaluru, India(印度Aptiv公司,班加罗尔) Arizona State University, USA(美国亚利桑那州立大学) Sejong University, South Korea(韩国世宗大学) Indian Institute of Information Technology Sri City, India(印度Sri City信息学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出AdaFuse-Det双流框架,通过基于最小方差线性估计的自适应跨模态融合模块融合CLAHE增强RGB与事件数据,在低光照下实现鲁棒目标检测,在LLE-VOS基准上召回率65.54%、精确率53.85%、F1分数59.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17468 2026-05-25 cs.HC cs.AI 79%

An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training

一种可解释的闭环智能辅导系统,用于异步演讲训练中的多模态情感反馈

Hung-Yue Suen, Kuo-En Hung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于XGBoost的可解释闭环智能辅导系统,通过三层可解释反馈架构将多模态输入映射为可追溯的反馈,在MOOC视频上训练并验证了其提升演讲技能的有效性。

Comments 12 pages, 8 figures, IEEE Transactions on Learning Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19995 2026-05-25 cs.CV 79%

A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

短视频多模态特征中信息感知价值的计算模型预测感官与行为参与

Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song

机构 * Department of Communication, University of Utah(犹他大学通讯系) Department of Communication, University of California, Davis(加州大学戴维斯分校通讯系) Department of Media and Communication, City University of Hong Kong(香港城市大学媒体与传播系) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域 division)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 基于信息感知价值理论,通过多模态特征分析和人工评估构建计算模型,预测短视频的感官与行为参与,发现MSV与感官参与正相关,与行为参与呈倒U型关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22629 2026-05-22 cs.CV 79%

H-Flow: Self-supervised Human Scene Flow via Physics-inspired Joint Multi-modal Learning

H-Flow:通过物理启发的联合多模态学习实现自监督的人体场景流

Zhanbo Huang, Xiaoming Liu, Yu Kong

机构 * Michigan State University(密歇根州立大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出H-Flow,一种能够同时捕捉骨骼运动学和表面变形的密集人体场景流方法,通过物理启发的联合多模态学习实现自监督,引入高保真合成基准DynAct4D,并在标准基准和零样本场景中优于现有方法。

Comments 19 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22493 2026-05-22 cs.LG cs.AI cs.RO 79%

Understanding Multimodal Failure in Action-Chunking Behavioral Cloning

理解动作分块行为克隆中的多模态失败

Lorenzo Mazza, Massimiliano Datres, Ariel Rodriguez, Sebastian Bodenstedt, Gitta Kutyniok, Stefanie Speidel

机构 * NCT-Dresden(NCT-德累斯顿)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究行为克隆在多模态情况下失败的机制,分析不同多模态参数化在动作分块策略中的不同失效方式,并提出通过调整正则化程度和改进生成策略来提升鲁棒性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19794 2026-05-20 cs.HC cs.AI cs.DB 79%

AffectAI-Capture: A Reproducible Multimodal Protocol for Small-Group Meeting Research

AffectAI-Capture:一种可重复的多模态协议用于小型小组会议研究

Meisam Jamshidi Seikavandi, Alice Modica, Anna Obara, Fabricio Batista Narcizo, Tanya Ignatenko, Ted Vucurevich, Jesper Bünsow Boldt, Paolo Burelli, Andrew Burke Dittberner

机构 * GN Advanced Science, GN Group, Ballerup, Denmark(GN先进科学,GN集团,丹麦Ballerup) IT University of Copenhagen, brAIn lab, Copenhagen, Denmark(哥本哈根IT大学,brAIn实验室,丹麦哥本哈根) Copenhagen Business School, Copenhagen, Denmark(哥本哈根商学院,丹麦哥本哈根) Aalborg University, Denmark(奥尔堡大学,丹麦)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种可重复的多模态协议AffectAI-Capture,用于收集四人会议类互动的同步多模态数据,结合眼动追踪、可穿戴生理、近距离和房间音频、多视角视频、事件日志和结构化自我报告。通过固定任务块和已建立的小组互动范式,结合权威事件时间线和标准化输出进行数据采集和后期处理。本文贡献在于建立了可重复的协议架构,将任务设计、仪器化、时间溯源和数据封装连接起来,用于情绪、行为和会议分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13080 2026-05-14 cs.CV 79%

Learning to See What You Need: Gaze Attention for Multimodal Large Language Models

学习你需要看到的东西:多模态大语言模型的注视注意力

Junha Song, Byeongho Heo, Geonmo Gu, Jaegul Choo, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Gaze Attention机制,使多模态大语言模型在生成过程中选择性关注任务相关的视觉区域,减少冗余计算并提升聚焦效果,实验表明其在图像和视频理解任务中性能优于密集注意力基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22455 2026-05-14 cs.CV 79%

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

探索多模态大语言模型用于边缘端在线事件记忆问答

Giuseppe Lando, Rosario Forte, Antonino Furnari

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(数学与计算机科学系,卡塔尼亚大学,意大利)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在边缘端实时在线事件记忆问答中的可行性,通过双线程架构实现视频转文本记忆与问答推理,实验显示边缘端方案在隐私保护方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11760 2026-05-13 cs.CV 79%

M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection

M$^4$-SAM:基于内存增强的SAM多模态混合专家用于RGB-D视频显著目标检测

Jiyuan Liu, Jia Lin, Xiaofei Zhou, Runmin Cong, Deyang Liu, Zhi Liu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shandong University(山东大学) Anqing Normal University(安庆师范学院) Shanghai University(上海大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 M$^4$-SAM通过引入模态感知MoE-LORA、分层特征融合和伪引导初始化,提升SAM2在RGB-D视频显著目标检测中的性能,实现零样本检测。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09343 2026-05-12 cs.AI 79%

SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making

SKG-VLA:用于结构化场景语义和决策制定多模态推理的场景知识图谱先验

Zeyu Li, Lei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SKG-VLA通过构建场景知识图谱,提升多模态投诉决策的推理能力与准确性,采用三阶段训练策略注入结构化场景先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 79%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08084 2026-05-11 cs.RO cs.CV 79%

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07232 2026-05-11 cs.CV 79%

Towards multi-modal forgery representation learning for AI-generated video detection and localization

迈向多模态伪造表示学习的AI生成视频检测与定位

Dat Le, Khoa Nguyen, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态融合框架,结合语义、时空视觉与多尺度音频分支,实现AI生成视频的检测与细粒度时间定位,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV 79%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01116 2026-05-04 cs.CV 79%

Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis

多模态癌症生存分析中的结构预后事件建模

Yilan Zhang, Li Nanbo, Changchun Yang, Jürgen Schmidhuber, Xin Gao

机构 * King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SlotSPE框架,通过槽注意力机制压缩多模态数据为结构化槽,有效建模癌症生存分析中的复杂交互,提升预后相关性与可解释性。

Comments 37 pages, 14 Figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00351 2026-05-04 cs.LG cs.AI 79%

Hypergraph and Latent ODE Learning for Multimodal Root Cause Localization in Microservices

超图与潜在ODE学习用于微服务多模态根本原因定位

Xin Liu, Yuhang He, Sichen Zhao, Kejian Tong, Xingyu Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyperODE RCA框架,结合超图注意力学习、潜在ODE和多模态交叉注意力融合,用于微服务系统中精细的根本原因分析,通过可微超边构建学习高阶服务交互,利用ODE RNN编码捕捉异常演变,采用上下文感知模态路由融合多种数据,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26379 2026-04-30 cs.CV 79%

A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection

一种用于整合EEG-视频癫痫发作检测的多模态预训练网络

Tong Lu, Ke Xu, Zimo Zhang, Zitong Zhao, Danwei Weng, Ruiyu Wang, Miao Liu, Zizuo Zhang, Jingyi Yao, Yixuan Zhao, Wenchao Zhang, Min Wang, Guoming Luan, Minmin Luo, Zhifeng Yue

机构 * organization= Beijing Institute for Brain Research, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 102206 , country= China organization= Chinese Institute for Brain Research, Beijing , city= Beijing , postcode= 102206 , country= China organization= Department of Neurosurgery, SanBo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= GenAns Biotechnology Co., Ltd , city= Beijing , postcode= 102206 , country= China organization= Laboratory for Clinical Medicine, Capital Medical University , city= Beijing , postcode= 100069 , country= China organization= Center of Epilepsy, Beijing Institute for Brain Disorders, Sanbo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= Beijing Key Laboratory of Brain Science

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EEGVFusion框架,结合自监督EEG学习、时空视频编码、最优传输对齐和双向交叉注意力,整合神经和行为证据,实现高准确率的癫痫发作检测,同时降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏