arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2603.18118 2026-03-20 cs.CV cs.AI cs.LG 81%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10887 2026-03-20 cs.CV 79%

AutoOEP -- A Multi-modal Framework for Online Exam Proctoring

AutoOEP -- 一种用于在线考试监考的多模态框架

Aryan Kashyap Naveen

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出AutoOEP,通过计算机视觉和机器学习实现高效的自动监考,采用双摄像头和LSTM网络检测可疑行为,准确率达90.7%。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11403 2026-03-20 quant-ph physics.optics 78%

Bidimensional measurements of photon statistics within a multimodal temporal framework

双维光子统计的多模时域测量

C. Hainaut, K. Ouahrouche, A. Rancon, G. Patera, C. Ouarkoub, M. Le Parquier, P. Suret, A. Amo

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种双维光子统计测量方法,利用DFG在非线性BBO晶体中实现高时间分辨率的单次成像,区分相干与热光子统计,并通过时间模式分解框架解释测量偏差原因。

Journal ref Phys. Rev. Research 8, 013286 (16 March, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 78%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18758 2026-03-20 cs.HC cs.CV cs.SD 57%

Dual-Model Prediction of Affective Engagement and Vocal Attractiveness from Speaker Expressiveness in Video Learning

双模型预测视频学习中说话者表达性对情感参与和语音吸引力的影响

Hung-Yue Suen, Kuo-En Hung, Fan-Hsun Tseng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于说话者情感表达的双回归模型,利用大规模在线课程数据预测观众情感参与和语音吸引力,验证说话者多模态特征可预测观众反馈。

Comments Preprint. Accepted for publication in IEEE Transactions on Computational Social Systems

Journal ref IEEE Transactions on Computational Social Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18649 2026-03-20 cs.CV 57%

Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA

点击提问:一种带有离线文案生成和在线交互问答的AI直播助手

Ruizhi Yu, Keyang Zhong, Peng Liu, Qi Wu, Haoran Zhang, Yanhao Zhang, Chen Chen, Haonan Lu

机构 * East China normal University(东中国正常大学) Sun Yat-sen University(孙中山大学) OPPO AI Center(OPPO AI中心) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Click-to-Ask系统,通过离线处理多模态产品信息生成结构化数据和合规文案,结合在线实时问答模块提升直播电商效率和观众互动性。

Comments 4 pages, 2 figures, Accepted at WWW2026 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21782 2026-03-20 cs.CV 57%

Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding

Mobile-VideoGPT:用于移动视频理解的高效模型

Abdelrahman Shaker, Muhammad Maaz, Chenhui Gou, Hamid Rezatofighi, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Monash University(莫纳什大学) Linköping University(利尔贝里大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mobile-VideoGPT,一种轻量级多模态框架,通过高效编码器、投影器和小语言模型实现快速推理,提升移动视频理解效率。

Comments Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00960 2026-03-20 cs.CV 57%

Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction

高效且可扩展的单目人类-物体交互运动重建

Boran Wen, Ye Lu, Sirui Wang, Keyan Wan, Jiahong Zhou, Junxuan Liang, Xinpeng Liu, Bang Xiao, Ruiyang Liu, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海信息院) FDU(福建大学) BJTU(北京理工大学) ZJU(浙江大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效的稀疏接触标注方法和InterPoint多模态预测器,结合4DHOISolver框架,构建了大规模4D HOI数据集,并通过强化学习验证了运动重建的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02535 2026-03-20 cs.CV 57%

Video Anomaly Detection with Semantics-Aware Information Bottleneck

基于语义感知信息瓶颈的视频异常检测

Juntong Li, Lingwei Dang, Qingxin Xiao, Shishuo Shang, Jiajia Cheng, Haomin Wu, Yun Hao, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SIB-VAD框架,通过自适应信息瓶颈过滤和语义增强方法,解决视频异常检测中正常与异常边界模糊和低级特征难以捕捉高级语义异常的问题。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏