arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 12 篇

2604.05947 2026-04-08 cs.CV 83%

Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition

多模态专家混合与整体标记学习用于驾驶员行为识别的细粒度多模态视觉分析

Tianyi Liu, Yiming Li, Wenqian Wang, Jiaojiao Wang, Chen Cai, Yi Wang, Kim-Hui Yap

机构 * Nanyang Technological University(南洋理工大学) Singapore University of Technology and Design(新加坡科技设计大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoME框架与HTL策略,通过类标记和时空标记提升多模态学习的专家细化与知识传递,验证了在驾驶员行为识别任务中优于单模态和多模态基线的方法。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05375 2026-04-08 cs.MM 83%

DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems

DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理

Qi Guo, Zheming Yang, Yunqing Hu, Chang Zhao, Wen Ji

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。

Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19457 2026-04-08 cs.CL 83%

MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models

MINED:利用多模态时间敏感知识进行探测与更新以提升大多模态模型

Kailin Jiang, Ning Jiang, Yuntao Du, Yuchen Ren, Yuchen Li, Yifan Gao, Jinhe Bi, Yunpu Ma, Bin Li, Lei Liu, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Northeast Forestry University(东北林业大学) C-FAIR&school of software, Shandong University(山东大学软件学院C-FAIR) State Key Lab. for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) The University of Sydney(悉尼大学) Anhui Polytechnic University(安徽工程大学) Ludwig Maximilian University of Munich(慕尼黑大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MINED基准,评估LMMs在时间敏感知识上的认知、意识、可信度等六个维度,发现Gemini-2.5-Pro在时间理解上表现最佳,而多数开源模型仍缺乏此能力,且在体育知识上表现最差。

Comments ACL 2026, Project Page: https://mined-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 82%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05079 2026-04-08 cs.CV 79%

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

SVAgent:通过跨模态多智能体协作实现故事线引导的长视频理解

Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦特大学BCML) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 SVAgent通过跨模态多智能体协作,利用故事线引导实现视频问答的高效理解,提升推理鲁棒性和答案一致性。

Comments Published in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 67%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 67%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05323 2026-04-08 cs.CV cs.RO 57%

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

VLA-InfoEntropy:一种无需训练的视觉-注意力信息熵方法,用于视觉-语言-动作模型的推理加速与成功

Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLA-InfoEntropy方法,通过图像熵和注意力熵结合时间步信息,动态调整模型关注区域,减少冗余并提升推理效率。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05015 2026-04-08 cs.CV 57%

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Video-MME-v2:迈向综合视频理解基准的下一阶段

Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, Yongkang Xie, Xiawu Zheng, Xue Yang, Haoyu Cao, Yunsheng Wu, Ziwei Liu, Xing Sun, Caifeng Shan, Ran He

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。

Comments Homepage: https://video-mme-v2.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25021 2026-04-08 cs.CV 57%

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

VideoTIR:通过高效工具集成推理实现长视频的准确理解

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao

机构 * Nanjing University(南京大学) Nankai University(南开大学) East China Normal University(华东师范大学) Tencent(腾讯) MiroMind Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05507 2026-04-08 cs.CY 50%

From Pixels to Personas: Tracking the Evolution of Anime Characters

从像素到人物:动漫角色演变的追踪

Rongze Liu, Jiaxin Pei, Jian Zhu

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究通过大规模多模态数据集分析动漫角色演变,结合LLM提取的性格特征与视觉特征,揭示观众群体从儿童向青少年过渡,角色设计呈现萌系化趋势,视觉信号比性格特征更主导观众偏好。

Comments Accepted at the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05303 2026-04-08 cs.LG cs.NA math.NA physics.comp-ph stat.ML 50%

Jeffreys Flow: Robust Boltzmann Generators for Rare Event Sampling via Parallel Tempering Distillation

Jeffreys 流:通过并行退火蒸馏实现鲁棒的玻尔兹曼生成器用于稀有事件采样

Guang Lin, Christian Moya, Di Qi, Xuda Ye

机构 * Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出Jeffreys流,通过并行退火轨迹蒸馏数据,利用对称Jeffreys散度缓解玻尔兹曼生成器的模式崩溃问题,提升多模分布的采样精度与全局模式覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏