arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 14 篇

2604.01002 2026-04-02 cs.CV cs.AI cs.LG 81%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00994 2026-04-02 cs.CL cs.AI cs.SI 81%

Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shorts

对以色列-哈马斯战争中YouTube Shorts上国家资助新闻报道的多模态分析

Daniel Miehling, Sandra Kuebler

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态管道,结合自动转录、基于方面的情感分析和语义场景分类,分析国家资助机构对以色列-哈马斯战争的短视频报道,发现不同来源和时间的情感表达差异及视觉线索的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 79%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11797 2026-04-02 cs.HC cs.ET 78%

MURMR: A Multimodal Sensing Framework for Automated Group Behavior Analysis in Mixed Reality

MURMR:一种用于混合现实环境中自动化群体行为分析的多模态传感框架

Diana Romero, Yasra Chandio, Fatima Anwar, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MURMR框架,通过头显原生数据自动分析团队协作动态,无需外部设备或人工标注,揭示了会话内结构分析和时间模块在捕捉群体行为中的互补作用。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24212 2026-04-02 cs.RO cs.CV 70%

RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation

RANGER:通过视觉上下文适应的单目零样本语义导航框架

Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 RANGER通过视觉上下文学习实现零样本语义导航,无需依赖深度和姿态信息,利用3D基础模型和视觉语言模型提升任务效率与环境适应性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01181 2026-04-02 cs.HC cs.CL cs.CV 62%

True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Lies

真正的(视觉)谎言:分析生成式AI如何识别意图性、修辞和误导性在可视化谎言中

Graziano Blasilli, Marco Angelini

机构 * Sapienza University of Rome(罗马大学) Link Campus University(Link Campus大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究多模态大语言模型识别和解释误导性可视化的能力,并通过2336条新冠相关推文数据集分析其识别原因和潜在意图性,评估16种前沿模型并对比人类专家行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00416 2026-04-02 cs.RO cs.AI cs.CV cs.LG 62%

Learning Humanoid Navigation from Human Data

从人类数据学习人形导航

Weizhuo Wang, Yanjie Ze, C. Karen Liu, Monroe Kennedy

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoNav系统,通过5小时人类行走数据训练人形机器人自主导航,无需机器人数据或微调。采用扩散模型预测未来轨迹分布,结合360度视觉记忆与DINOv3骨干网络,实现实时推理与路径选择,验证了在未知环境中避障和多模态覆盖的优越性。

Comments 8 pages 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14702 2026-04-02 cs.CV cs.AI 62%

Seeing Beyond the Image: ECG and Anatomical Knowledge-Guided Myocardial Scar Segmentation from Late Gadolinium-Enhanced Images

超越图像:结合心电图与解剖知识的晚期钆增强图像心肌瘢痕分割

Farheen Ramzan, Yusuf Kiberu, Nikesh Jathanna, Meryem Jabrane, Vicente Grau, Shahnaz Jamil-Copley, Richard H. Clayton, Chen, Chen

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Cardiology, Trent Cardiac Centre, Nottingham City Hospital, Nottingham University Hospitals NHS Trust(诺丁汉大学医院NHS信托基金诺丁汉市医院特伦特心脏中心心脏病科) School of Medicine, University of Nottingham(诺丁汉大学医学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种融合心电图电生理信息与AHA-17解剖先验的多模态框架,通过时间感知特征融合机制提升晚期钆增强图像中心肌瘢痕分割的准确性与鲁棒性。

Comments oral presentation at International Symposium on Biomedical Imaging (ISBI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00696 2026-04-02 cs.CV 57%

TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning

TTA-Vid: 视频推理的通用测试时间适应

Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen(蒂宾根大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center(蒂宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TTA-Vid方法,通过测试时间强化学习实现视频推理模型的适应,无需标注数据即可在测试时泛化至新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV 57%

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV 57%

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV 57%

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00832 2026-04-02 cs.HC 50%

Steering through Time: Blending Longitudinal Data with Simulation to Rethink Human-Autonomous Vehicle Interaction

穿越时间:将纵向数据与模拟结合以重新思考人-自动驾驶车辆交互

Yasaman Hakiminejad, Shiva Azimi, Luis Gomero, Elizabeth Pantesco, Irene P. Kan, Meltem Izzetoglu, Arash Tavakoli

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过结合纵向移动传感与高保真驾驶模拟,研究半自动化情境下驾驶员准备状态,揭示基线与任务测量中的个体差异,为个性化驾驶员监控提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏