arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2604.22492 2026-04-27 eess.IV cs.CV 85%

MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

MTT-Bench:通过多模态大语言模型预测小鼠的社会支配

Yunquan Chen, Haoyu Chen

机构 * Department of Communication Systems, KTH Royal Institute of Technology(通信系统系,皇家理工学院) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MTT-Bench基准,利用多模态大语言模型分析小鼠行为视频,预测社会支配等级,无需显式标签进行零样本推理,展示了在乙学和社会行为分析中的应用潜力。

Comments 8 pages, 2 figures. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19592 2026-04-27 cs.CV 57%

Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation

MLLMs中分解注意力融合用于无训练视频推理分割

Su Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim, Dongyoon Wee, Seon Joo Kim

机构 * Yonsei University(延世大学) Inha University(inha大学) NAVER Cloud(NAVER云)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22575 2026-04-27 cs.LG 50%

SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

SpikingBrain2.0:面向高效长上下文和跨平台推理的脑启发基础模型

Yuqi Pan, Jinghao Zhuang, Yupeng Feng, Fangzhi Zhong, Siyu Ding, Xuerui Qiu, Shaowei Gu, Bohan Sun, Zhiyong Qin, Yibo Zhong, Lingtao Ouyang, Kun Yang, Zehao Liu, Yuhong Chou, Shurong Wang, Anjie Hu, Han Xu, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 SpikingBrain2.0通过双空间稀疏注意力机制和优化训练策略,在保持性能的同时提升长上下文处理效率,实现跨平台高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22043 2026-04-27 physics.soc-ph cs.LG 50%

Audio Video Verbal Analysis (AVVA) for Capturing Classroom Dialogues

音频视频言语分析(AVVA)用于捕捉课堂对话

Vivek Upadhyay, Amaresh Chakrabarti

机构 * Department of Design and Manufacturing, Indian Institute of Science(设计与制造系,印度科学研究院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出AVVA框架,通过整合定性解释与定量建模,提升课堂对话分析的可扩展性与严谨性,验证了其在23小时课堂录音中的实用性。

Comments 42 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07818 2026-04-27 cs.MA 50%

Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding

基于代理推理和时间定位的开放式视频游戏漏洞检测

Muyang Zheng, Tong Zhou, Geyang Wu, Zihao Lin, Haibo Wang, Lifu Huang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。

Comments 16 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏