arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-18 至 2026-03-18 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2505.23359 2026-03-18 cs.CV 83%

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI 79%

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13397 2026-03-18 cs.CV 74%

TennisExpert: Towards Expert-Level Analytical Sports Video Understanding

TennisExpert: 向专家级分析体育视频理解迈进

Zhaoyu Liu, Xi Weng, Lianyu Hu, Zhe Hou, Kan Jiang, Jin Song Dong, Yang Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16154 2026-03-18 cs.CV cs.AI 57%

GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation

GATS: 基于高斯意识的时间缩放变换器的不变四维时空点云表示

Jiayi Tian, Jiaze Wang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GATS框架,通过不确定性引导的高斯卷积和时间缩放注意力模块,解决四维点云视频中时间尺度偏差和分布不确定性问题,提升鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 50%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2603.13506 2026-03-18 cs.CV 79%

LibraGen: Playing a Balance Game in Subject-Driven Video Generation

LibraGen:在以主题驱动的视频生成中进行平衡游戏

Jiahao Zhu, Shanshan Lao, Lijie Liu, Gen Li, Tianhao Qi, Wei Han, Bingchuan Li, Fangfang Liu, Zhuowei Chen, Tianxiang Ma, Qian HE, Yi Zhou, Xiaohua Xie

机构 * Pazhou Laboratory (Huangpu)(黄埔实验室( Pazhou))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LibraGen通过平衡视频生成基础模型的内在先验与主题到视频能力,提出了一种新的框架,采用质量优先策略和动态分类器自由引导方案,提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG 70%

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16669 2026-03-18 cs.RO cs.CV 57%

Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation

Kinema4D: 用于空间时间具身模拟的运动学4D世界建模

Mutian Xu, Tianbao Zhang, Tianqi Liu, Zhaoxi Chen, Xiaoguang Han, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SSE, CUHKSZ(香港中文大学深圳校区SSE)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Kinema4D,一种基于动作条件的4D生成机器人模拟器,通过精确的4D机器人控制表示和环境反应的生成建模,实现了高精度的空间时间交互模拟,并首次展示零样本迁移能力。

Comments Project page: https://mutianxu.github.io/Kinema4D-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 81%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04153 2026-03-18 cs.CV 79%

Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning

Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调

Yifan Wang, Yanyu Li, Gordon Guocheng Qian, Sergey Tulyakov, Yun Fu, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。

Comments Webpage: https://snap-research.github.io/diffusion-drf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15627 2026-03-18 cs.GR cs.CE physics.comp-ph physics.flu-dyn 78%

Physics-Informed Video Diffusion For Shallow Water Equations

基于物理的视频扩散用于浅水方程

Yang Bai, George Eskandar, Ziyuan Liu, Gitta Kutyniok

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。

Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16566 2026-03-18 cs.CV cs.GR 57%

VideoMatGen: PBR Materials through Joint Generative Modeling

VideoMatGen:基于联合生成模型的PBR材质

Jon Hasselgren, Zheng Zeng, Milos Hasan, Jacob Munkberg

机构 * NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视频扩散变压器架构的方法,通过输入几何和文本描述联合生成物理合理的PBR材质,包含基础颜色、粗糙度、金属度和高度图等属性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2603.16256 2026-03-18 cs.CV 74%

When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition

当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘

Xiaokun Sun, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视频问答 :video reasoning(title);分类 cs.CV

AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2603.00512 2026-03-18 cs.CV 88%

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

基于语义边界的小波帧选择用于长视频理解

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出WFS-SB方法,通过小波变换检测语义边界,提升长视频中大视觉语言模型的性能,实验显示在多个基准上均优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏