arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 95 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2604.27389 2026-05-14 cs.CV cs.AI 91%

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试

Bingli Wang, Huanze Tang, Haijun Lv, Zhishan Lin, Lixin Gu, Lei Feng, Qipeng Guo, Kai Chen

机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12872 2026-05-14 cs.LG 87%

SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

SMA:用于数据高效多模态学习的子模ularity模态对齐器

Truong Pham, Anay Majee, Rishabh Iyer

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)

AI总结 本文提出SMA,通过子模ularity目标提升多模态对齐效率,利用集合形式学习更丰富的跨模态结构,在低数据场景下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12789 2026-05-14 cs.RO 82%

Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention

视觉-语言模型的终身学习:增强的EWC与跨模态知识保留

Hamza Ahmed Durrani, Rafay Suleman Durrani

机构 * Sejong University, Computer Science Engineering(世宗大学,计算机科学工程) Technische Universität Ilmenau, Computer Engineering(伊门瑙技术大学,计算机工程)

专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 本文提出一种结合增强EWC与参数高效微调的框架,有效减少视觉-语言模型在连续学习中的遗忘,通过多模态Fisher信息矩阵计算和跨模态一致性保留,实现78%的遗忘率降低,并在动态环境中提升多模态AI系统的适应能力。

Comments 8 pages, 5 figures, 1 table. Applications in autonomous driving, intelligent robotic assistants, and adaptive robotics systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04692 2026-05-14 cs.CL cs.AI cs.CV 82%

Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity

图片胜过千言吗?基于视觉证据必要性的自适应多模态事实核查

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(顺斯利大学人工智能融合学院) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(顺斯利大学智能半导体系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文挑战了多模态证据普遍提升性能的假设,提出AMuFC框架,通过分析和验证器模型自适应使用视觉证据,提升事实核查准确性。

Comments preprint, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02977 2026-05-14 cs.CV cs.AI cs.LG 62%

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

对图像与长描述中的森林和树木进行对齐以实现视觉基础理解

Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

机构 * Agency for Defense Development(国防发展局) University of Michigan(密歇根大学) POSTECH

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAFT模型,通过分层视觉语言学习原理,解决长描述中细节丰富的场景理解问题,实现图像与文本的细粒度对齐,取得六个长文本检索基准的最优性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 62%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12574 2026-05-14 cs.CV cs.AI 62%

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

DistractMIA: 通过语义干扰在视觉语言模型上进行黑盒成员推断

Hongyi Tang, Zhihao Zhu, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对部署的视觉语言模型成员推断难题,提出DistractMIA框架,通过语义干扰技术在仅观察生成文本响应的情况下,有效区分成员与非成员样本,优于现有基线方法。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV 57%

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13831 2026-05-14 cs.CV 57%

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

通过超越128K上下文的泛化有效训练长上下文视觉-语言模型

Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yuan, Chaoyi Huang, Yi Lin, Yangqiu Song

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02753 2026-05-14 cs.CV 57%

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

DeCo-DETR:解耦认知DETR用于高效的开放词汇目标检测

Siheng Wang, Yanshu Li, Bohan Hu, Zhengdao Li, Haibo Zhan, Linshan Li, Weiming Liu, Ruizhi Qian, Guangxin Wu, Hao Zhang, Jifeng Shen, Piotr Koniusz, Zhengtao Yao, Junhao Dong, Qiang Sun

机构 * Jiangsu University(江苏大学) Brown University(布朗大学) Nanyang Technological University(南洋理工大学) MBZUAI University of New South Wales(新南威尔士大学) USC University of Toronto(多伦多大学) Data61 CSIRO

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 DeCo-DETR通过统一解耦范式解决开放词汇目标检测中的计算开销与训练目标冲突问题,构建层次化语义原型空间并解耦语义推理与定位,提升推理效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13156 2026-05-14 cs.CV 57%

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

视觉语言模型中物体幻觉的双路径电路

Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

机构 * UIUC(伊利诺伊大学香槟分校) UMich(密歇根大学) Stanford(斯坦福大学) HKUST(香港科技大学) PKU(北京大学) NUS(新加坡国立大学) Marquette(马quette大学) Southampton(南安普顿大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 57%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12325 2026-05-14 cs.CV 57%

VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference

VIP:基于视觉引导的提示进化用于高效的密集视觉-语言推理

Hao Zhu, Shuo Jin, Wenbin Liao, Jiayu Xiao, Yan Zhu, Siyue Yu, Feng Dai

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Liverpool(利物浦大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VIP方法,通过视觉引导的提示进化提升密集视觉-语言推理的效率与质量,实现更准确的细粒度物体感知。

Comments Accepted by ICML2026. Code is available at https://github.com/MiSsU-HH/VIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 50%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 图文多模态 :image-text(abstract)

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2605.11572 2026-05-14 cs.CV 83%

TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning

TB-AVA:文本作为语义桥梁用于音频-视觉参数高效微调

Seongah Kim, Dinh Phu Tran, Hyeontaek Hwang, Saad Wazir, Duc Do Minh, Daeyoung Kim

机构 * AI2 Lab, KAIST(AI2实验室,韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用文本作为语义桥梁,通过冻结音频和视觉编码器构建参数高效微调框架,实现音频与视觉流的文本介导交互,实验表明其在多个基准上取得最佳性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15280 2026-05-14 cs.HC cs.AI 79%

LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback

基于大语言模型的多模态反馈在学习效果和学生感知上与教师反馈相当且更优

Chloe Qianhui Zhao, Jie Cao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种实时AI辅助的多模态反馈系统,通过整合结构化文本解释与动态多媒体资源,实现学习效果与学生感知的提升,证明AI反馈在清晰度、具体性等方面优于传统教师反馈。

Comments 11 pages, to be published at the 16th International Learning Analytics & Knowledge Conference (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 14 篇

2605.13248 2026-05-14 eess.SP cs.AI 83%

Compact Latent Manifold Translation: A Parameter-Efficient Foundation Model for Cross-Modal and Cross-Frequency Physiological Signal Synthesis

紧凑的潜在流形翻译:一种参数高效的基础模型用于跨模态和跨频率生理信号合成

Bo Cui, Xiaowen Song, Yaowen Zhang, Shunzhe Zhang, B. J. F. van Beijnum, Monique Tabak, Ying Wang

机构 * Department of Biomedical Signals and Systems(生物医学信号与系统系) University of Twente(埃因霍温理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出CLMT模型,通过双阶段离散翻译范式解决生理信号跨模态和跨频率合成问题,显著提升临床检测精度和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12145 2026-05-14 cs.CV 83%

Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations

通过语义对齐的离散表示实现跨模态领域泛化

Souptik Sen, Raneen Younis, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics(汉诺威医学院彼得·L·里赫茨医学信息学研究所) Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森医学人工智能与因果方法中心(CAIMed))

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CoDAAR框架,通过语义对齐解决跨模态泛化与模态特异性之间的平衡问题,结合离散时间对齐和语义对齐机制,在统一离散空间中实现通用跨模态表示。

Comments Added missing affiliation for co-author R. Younis and Z. Ahmadi

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13080 2026-05-14 cs.CV 79%

Learning to See What You Need: Gaze Attention for Multimodal Large Language Models

学习你需要看到的东西:多模态大语言模型的注视注意力

Junha Song, Byeongho Heo, Geonmo Gu, Jaegul Choo, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Gaze Attention机制,使多模态大语言模型在生成过程中选择性关注任务相关的视觉区域,减少冗余计算并提升聚焦效果,实验表明其在图像和视频理解任务中性能优于密集注意力基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22455 2026-05-14 cs.CV 79%

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

探索多模态大语言模型用于边缘端在线事件记忆问答

Giuseppe Lando, Rosario Forte, Antonino Furnari

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(数学与计算机科学系,卡塔尼亚大学,意大利)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在边缘端实时在线事件记忆问答中的可行性,通过双线程架构实现视频转文本记忆与问答推理,实验显示边缘端方案在隐私保护方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13623 2026-05-14 cs.LG 78%

Multimodal Graph-based Classification of Esophageal Motility Disorders

基于多模态图的食管动力障碍分类

Alexander Geiger, Lars Wagner, Daniel Rueckert, Alois Knoll, Dirk Wilhelm, Alissa Jell

机构 * Technical University of Munich, School of Medicine and Health, TUM University Hospital Rechts der Isar(慕尼黑技术大学医学院与健康学院,TUM医院Rechts der Isar分院) Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出结合高分辨率阻抗测压仪数据与患者信息的多模态图分类方法,通过图神经网络学习生理意义的表示,提升食管动力障碍分类的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17555 2026-05-14 cs.CV 77%

GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking

GraphThinker: 通过事件图思维强化时间感知的视频推理

Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li

机构 * Queen Mary University of London(伦敦玛丽女王大学) Samsung AI Centre Cambridge(剑桥三星人工智能中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11193 2026-05-14 cs.RO cs.AI cs.CV 76%

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

多模态世界模型用于物理机器人交互:同时进行视觉和触觉预测以提高准确性

Willow Mandil, Amir Ghalamzan-E

机构 * University of Lincoln(林肯大学) University of Sheffield(谢菲尔德大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出多模态世界模型,通过整合视觉和触觉信息提升机器人物理交互的预测精度,特别是在物理模糊场景中表现更优。

Comments This paper is accepted for publication in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13228 2026-05-14 cs.CV cs.AI 73%

ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding

ReTool-Video:具有元增强工具定位的递归工具使用视频代理

Xiao Liu, Nayu Liu, Junnan Zhu, Ruirui Chen, Guohui Xiang, Changjian Wang, Kaiwen Wei, Rongzhen Li, Jiang Zhong

机构 * Chongqing University(重庆大学) Tianjin University(天津大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所) Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReTool-Video,通过构建元增强视频工具库和递归工具使用方法,提升视频理解的稳定性和效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12571 2026-05-14 cs.CV cs.AI 73%

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

VideoSEAL: 通过解耦答案权威性来缓解代理长视频理解中的证据错位

Chenhao Qiu, Yechao Zhang, Xin Luo, Shien Song, Xusheng Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出VideoSEAL框架,通过解耦规划与答案权威性,解决长视频理解中证据错位问题,提升回答准确性和证据对齐度,实验结果显示在多个基准上表现优异。

Comments Accepted to ICML 2026. 33 pages, 13 figures. Code and models are available at https://github.com/Echochef/VideoSEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01707 2026-05-14 cs.CV cs.AI cs.CL 67%

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

StreamGaze:流媒体视频中的目光引导时间推理与前瞻性理解

Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 StreamGaze通过引入目光引导的任务评估多模态大语言模型在流媒体视频中的时间推理和前瞻性理解能力,揭示了现有模型在目光引导下的时间推理、意图建模和前瞻性预测方面的局限性。

Comments Accepted to CVPR 2026 with strong scores (5/5/5) but desk-rejected after the camera-ready due to not completing all reviewing duties

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13737 2026-05-14 cs.AI cs.CL 62%

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

宽视角闭合:多模态大语言模型中的表征-行动鸿沟

Trung Nguyen Quang, Yiming Gao, Fanyi Pu, Kaichen Zhang, Shuo Sun, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) LMMs-Lab Team(多模态大模型实验室团队) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13202 2026-05-14 cs.CV cs.AI 62%

STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

STAR:语义-时间自适应表示学习用于少样本动作识别

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Engineering Research Center of Key Software Technologies for Smart City Perception and Planning, Ministry of Education(教育部智能城市感知与规划关键软件技术工程研究中心)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 STAR通过语义对齐和时间感知模块,解决少样本动作识别中的语义-时间对齐和多尺度时间动态建模问题,提升模型在有限样本下的泛化能力。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12725 2026-05-14 cs.CV 57%

Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models

视频异常检测是否被错误地框架化?来自基于大语言模型和多场景模型的证据

Furkan Mumcu, Michael J. Jones, Anoop Cherian, Yasin Yilmaz

机构 * University of South Florida(佛罗里达州立大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文探讨视频异常检测是否应关注单场景、空间感知和可解释性,以捕捉环境中的正常结构,而非依赖多场景模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12735 2026-05-14 cs.RO 50%

The Unified Autonomy Stack: Toward a Blueprint for Generalizable Robot Autonomy

统一自主栈:迈向通用机器人自主性的蓝图

Mihir Dharmadhikari, Nikhil Khedekar, Mihir Kulkarni, Morten Nissov, Martin Jacquet, Angelos Zacharia, Marvin Harms, Albert Gassol Puigjaner, Philipp Weiss, Kostas Alexis

机构 * Autonomous Robots Lab(自主机器人实验室)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出统一自主栈,通过多模态感知、多行为规划和多层安全导航模块实现通用机器人自主性,经实地测试验证其在复杂环境中的鲁棒性。

Comments 35 pages, 22 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏