arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 148 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 15 篇

2506.04559 2026-03-24 cs.CV 83%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 79%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 74%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04839 2026-03-24 cs.CV 70%

Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction

通过语义增强的动态对比交互实现高度可迁移的视觉-语言攻击

Yuanbo Li, Tianyang Xu, Cong Hu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出SADCA方法,通过语义引导的渐进扰动提升视觉-语言模型的对抗可迁移性,实验表明其在多个数据集上优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 70%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 62%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 62%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 57%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21484 2026-03-24 cs.CV 57%

Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models

哪些概念需要遗忘以及如何拒绝?分解概念以在大视觉-语言模型中实现持续反学习

Hyundong Jin, Dongyoon Han, Eunwoo Kim

机构 * Chung-Ang University(Chung-Ang大学) NAVER AI Lab(NAVER AI实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种持续反学习框架,通过分解删除目标中的视觉和文本概念,生成基于细粒度描述的拒绝响应,以提升反学习效果和保持通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17657 2026-03-24 cs.CV 57%

SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation

SPACE-CLIP:通过自适应CLIP嵌入实现空间感知的单目深度估计

Taewan Cho, Taeryang Kim, Andrew Jaeyong Choi

机构 * School of Computing, Gachon University(加尔文大学计算机学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPACE-CLIP提出了一种仅解码器的深度框架,通过冻结的CLIP视觉编码器直接读取几何线索,无需文本编码器,实现了高效的单目深度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21047 2026-03-24 cs.CV 57%

When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound

微小修改同样重要:基于LLM驱动的提示攻击用于医学视觉语言模型在超声中的鲁棒性

Yasamin Medghalchi, Milad Yazdani, Amirhossein Dabiriaghdam, Moein Heidari, Mojan Izadkhah, Zahra Kavian, Giuseppe Carenini, Lele Wang, Dena Shahriari, Ilker Hacihaliloglu

机构 * University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个可扩展的对抗评估框架,利用大语言模型生成临床合理的对抗提示变体,评估SOTA医学视觉语言模型在超声中的鲁棒性,揭示模型在临床应用中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI 57%

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15977 2026-03-24 cs.HC 50%

Adaptive Captioning with Emotional Cues: Supporting DHH and Neurodivergent Learners in STEM

适应性字幕与情感提示:支持聋人及神经多样性学习者在STEM领域

Sunday David Ubur, Eugenia Ha Rim Rho, Denis Gracanin

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨了四种嵌入情感和多模态提示的字幕原型,通过实验证明其能降低认知负荷并提升理解成绩,强调了为神经多样性用户定制字幕功能的重要性。

Comments Accepted and presented at Affective Computing and Intelligent Interaction (ACII) Conference 2025; final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20607 2026-03-24 cs.RO cs.LG 50%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 11 篇

2603.21948 2026-03-24 cs.MM 83%

Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation

注视、倾听与分割:迈向弱监督音频视觉语义分割

Chengzhi Li, Heyan Huang, Ping Jian, Yanghao Zhou

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出弱监督音频视觉语义分割方法,通过分解为注视、倾听和分割三个阶段,结合渐进跨模态对齐模块,实现基于视频级标签的帧级语义分割,实验表明其在弱监督方法中表现优异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21803 2026-03-24 cs.CV 79%

Timing In stand-up Comedy: Text, Audio, Laughter, Kinesics (TIC-TALK): Pipeline and Database for the Multimodal Study of Comedic Timing

喜剧表演中的时间:文本、音频、笑声、身体语言(TIC-TALK):用于喜剧时间多模态研究的管道和数据库

Yaelle Zribi, Florian Cafiero, Vincent Lépinay, Chahan Vidal-Gorène

机构 * Centre Jean-Mabillon, École nationale des chartes, PSL, Paris, France(中心 Jean-Mabillon,国家档案学院,PSL,巴黎,法国) Laboratoire de Recherche, EPITA, Paris, France(研究实验室,EPITA,巴黎,法国) médialab, Sciences Po, Paris, France(媒体实验室,社会科学高等学院,巴黎,法国)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文介绍TIC-TALK数据库,通过5400多个时间对齐的主题片段,结合BERTopic、Whisper-AT、YOLOv8等技术,研究喜剧表演中的时间动态及观众反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21013 2026-03-24 cs.AI cs.LG cs.RO 79%

A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot

一种用于Pepper机器人低延迟LLM驱动多模态交互的框架

Erich Studerus, Vivienne Jia Zhong, Stephan Vonschallen

机构 * Institute for Information Systems(信息系统研究所) University of Applied Sciences and Arts Northwestern Switzerland(西北瑞士应用科学与艺术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个开源Android框架,通过端到端语音模型和功能调用能力,实现低延迟多模态交互,提升Pepper机器人的人机交互性能。

Comments 4 pages, 2 figures. To appear in Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, Scotland, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20894 2026-03-24 cs.MM 70%

AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

AcoustEmo:通过语句感知的声学Q-Former实现开放词汇情绪推理

Liyun Zhang, Xuanmeng Sha, Shuqiong Wu, Fengkai Liu

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.MM

AI总结 AcoustEmo通过引入语句感知的声学Q-Former,利用时间同步滑动窗口提取段级音频token,提升复杂情绪推理能力,在EMER任务中优于基线模型。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14922 2026-03-24 cs.AI cs.CL cs.LG eess.AS eess.SP 67%

TRI-DEP: A Trimodal Comparative Study for Depression Detection Using Speech, Text, and EEG

TRI-DEP:一种利用语音、文本和EEG进行抑郁症检测的三模态比较研究

Annisaa Fitri Nurfidausi, Eleonora Mancini, Paolo Torroni

机构 * DISI, University of Bologna, Italy(博洛尼亚大学DISI学院,意大利)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过系统比较语音、文本和EEG的三模态方法,验证了多模态检测的有效性,发现预训练嵌入优于手工特征,三模态模型达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 67%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 57%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21233 2026-03-24 cs.LG cs.AI 57%

AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression

AngelSlim:一个更易用、更全面且更高效的大型模型压缩工具包

Rui Cen, QiangQiang Hu, Hong Huang, Hong Liu, Song Liu, Xin Luo, Lin Niu, Yifan Tan, Decheng Wu, Linchuan Xie, Rubing Yang, Guanghua Yu, Jianchen Zhu

机构 * Hunyuan AI Infra Team(文心一言AI基础设施团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AngelSlim 提供统一流程,整合量化、推测解码等算法,实现从模型压缩到工业部署的高效加速,同时提出训练对齐的推测解码框架和训练无关的稀疏注意力框架,提升吞吐量并优化多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05911 2026-03-24 cs.CL 57%

Pantagruel: Unified Self-Supervised Encoders for French Text and Speech

Pantagruel:面向法语文本和语音的统一自监督编码器

Phuong-Hang Le, Valentin Pelloin, Arnault Chatelain, Maryem Bouziane, Mohammed Ghennai, Qianwen Guan, Kirill Milintsevich, Salima Mdhaffar, Aidan Mannion, Nils Defauw, Shuyue Gu, Alexandre Audibert, Marco Dinarelli, Yannick Estève, Lorraine Goeuriot, Steffen Lalande, Nicolas Hervé, Maximin Coavoux, François Portet, Étienne Ollion, Marie Candito, Maxime Peyrard, Solange Rossato, Benjamin Lecouteux, Aurélie Nardy, Gilles Sérasset, Vincent Segonne, Solène Evain, Diandra Fabre, Didier Schwab

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,LIG) INA (Institut National de l'Audiovisuel)(国家视听研究院) Avignon Université, LIA(阿维尼翁大学,LIA) CREST (École Polytechnique, ENSAE, CNRS)(CREST(巴黎政治学院、ENSAE、CNRS)) LLF (Université Paris Cité and CNRS)(LLF(巴黎城市大学和CNRS)) Univ. Grenoble Alpes, EFELIA-MIAI, IUT2 Grenoble, LIG(格勒诺布尔阿尔卑斯大学,EFELIA-MIAI,格勒诺布尔IUT2,LIG) Univ. Grenoble Alpes, Lidilem(格勒诺布尔阿尔卑斯大学,Lidilem) Université Bretagne Sud, CNRS, IRISA(布列塔尼南部大学,CNRS,IRISA) Saclay AI(萨克莱AI) IRIT, Université de Toulouse, CNRS, Toulouse INP, UT3(IRIT,图卢兹大学,CNRS,图卢兹INP,UT3)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 Pantagruel通过在特征空间中学习上下文化的目标表示,提升法语文本和语音的多模态理解能力,在多个下游任务中表现优异,优于现有基线模型。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07010 2026-03-24 cs.LG 50%

Always Keep Your Promises: A Model-Agnostic Attribution Algorithm for Neural Networks

始终信守承诺:一种针对神经网络的模型无关属性算法

Kevin Lee, Duncan Smith-Halverson, Pablo Millan Arias

机构 * David R. Cheriton School of Computer Science, University of Waterloo, ON, Canada(滑铁卢大学戴维·R·切里顿计算机科学学院) Scotiabank AML AI Research, Toronto, ON, Canada(多伦多加拿大Scotiabank反洗钱AI研究)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出DynamicLRP,一种在张量操作层面运行的模型无关LRP框架,通过分解计算图中的属性并引入新的延迟激活解决机制,实现了真正的架构无关性,同时保持了LRP的理论保证,并在多个模型上展示了高准确性与效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 17 篇

2603.13406 2026-03-24 cs.CV cs.AI 84%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视频多模态 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19248 2026-03-24 cs.CV cs.AI 84%

No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

无需真实异常:MLLM赋能的零样本视频异常检测

Zunkai Dai, Ke Li, Jiajia Liu, Jie Yang, Yuanyuan Qiao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LAVIDA框架,利用多模态大语言模型和异常暴露采样器,解决视频异常检测中数据稀少和语义理解不足的问题,实现零样本下的帧级和像素级异常检测最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 83%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08138 2026-03-24 cs.CV cs.AI cs.MM 82%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏