arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 83%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25420 2026-03-27 cs.CV 79%

VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

VideoWeaver:多模态多视角视频到视频转换用于具身智能体

George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Ludwig Maximilian University of Munich(慕尼黑大学) University of Freiburg(弗莱堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoWeaver是首个多视角视频到视频转换框架,通过共享4D潜在空间实现多视角一致性,支持动态相机运动和不同视角的自回归合成,提升具身智能体在真实环境中的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24636 2026-03-27 cs.LG cs.AI 79%

DyMRL: Dynamic Multispace Representation Learning for Multimodal Event Forecasting in Knowledge Graph

DyMRL: 动态多空间表征学习用于知识图谱中的多模态事件预测

Feng Zhao, Kangzheng Liu, Teng Peng, Yu Yang, Guandong Xu

机构 * Huazhong University of Science and Technology(华中科技大学) Centre for Learning, Teaching and Technology(学习、教学与技术中心) The Education University of Hong Kong(香港教育大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DyMRL通过动态多空间表征学习,解决多模态知识动态获取与融合问题,提升事件预测性能。

Comments Accepted to The ACM Web Conference 2026 (WWW '26). This version is published under a CC BY license

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13315 2026-03-27 cs.RO 78%

Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning via Subtask-Level Progress Rate and Keyframe Memory for Long-Horizon Contact-Rich Robotic Manipulation

双侧控制基于多模态分层模仿学习的长时程接触丰富机械臂操作

Thanpimon Buamanee, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(神户大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Bi-HIL框架,通过子任务级进度率和关键帧记忆实现长时程接触丰富机械臂操作的稳定分层协调,验证了显式建模子任务进展与力感知控制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV 57%

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI 57%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25054 2026-03-27 cs.CV 57%

Synergistic Event-SVE Imaging for Quantitative Propellant Combustion Diagnostics

协同事件-SVE成像用于定量推进剂燃烧诊断

Jing Tao, Taihang Lei, Banglei Guan, Ying Qu, Xudong Na, Likun Ma, Yang Shang, Qifeng Yu

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(国防科技大学航天科学与工程学院) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation, National University of Defense Technology(国防科技大学湖南省图像测量与视觉导航重点实验室) Hypersonic Technology Laboratory, National University of Defense Technology(国防科技大学高超声速技术实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种闭环事件-SVE测量系统,结合空间变曝光相机与双目神经形态事件相机,通过烟雾感知融合策略生成HDR图像,用于烟雾遮挡下的高精度推进剂燃烧诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25353 2026-03-27 cs.RO 50%

SafeGuard ASF: SR Agentic Humanoid Robot System for Autonomous Industrial Safety

SafeGuard ASF:基于SR代理的人形机器人自主工业安全系统

Thanh Nguyen Canh, Thang Tran Viet, Thanh Tuan Tran, Ben Wei Lim

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SafeGuard ASF系统,利用人形机器人结合多模态感知与ReAct代理推理框架,实现工业环境中的火灾烟雾、管道异常温度及禁区入侵检测,通过训练多种运动策略实现自主巡逻与避障。

详情

展开后加载摘要…

URL PDF HTML 收藏