arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-05 至 2026-03-05 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2511.19524 2026-03-05 cs.CV cs.MA 79%

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2603.03505 2026-03-05 cs.CV cs.AI 86%

PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation

PhyPrompt:基于强化学习的物理合理文本到视频生成的提示优化

Shang Wu, Chenwei Xu, Zhuofan Xia, Weijian Li, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 PhyPrompt通过强化学习优化提示,提升文本到视频生成的物理合理性,优于GPT-4o和DeepSeek-V3,实现更高效的物理常识和语义忠实度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04291 2026-03-05 cs.CV cs.AI 79%

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03646 2026-03-05 cs.CV 74%

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡

Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan, Puneet Mathur, Varun Manjunatha, Daksh Dangi, Chien Nguyen, Nedim Lipka, Trung Bui, Krishna Kumar Singh, Ruiyi Zhang, Xiaolei Huang, Jaemin Cho, Yu Wang, Namyong Park, Zhengzhong Tu, Hongjie Chen, Hoda Eldardiry, Nesreen Ahmed, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

机构 * Adobe Research(Adobe研究院) KAUST(卡塔尔科技大学) University of Oregon(俄勒冈大学) University of Memphis(密苏里大学孟菲斯分校) Johns Hopkins University(约翰霍普金斯大学) Meta AI Texas A&M University(德克萨斯农工大学) Dolby Labs(杜比实验室) Virginia Tech(弗吉尼亚理工大学) Cisco(思科) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18573 2026-03-05 cs.CV cs.AI 74%

Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model

Kaleido:开源多主体参考视频生成模型

Zhenxing Zhang, Jiayan Teng, Zhuoyi Yang, Tiankun Cao, Cheng Wang, Xiaotao Gu, Jie Tang, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Kaleido通过改进的数据构建和参考旋转位置编码,提升了多主体参考视频生成的一致性、保真度和泛化能力。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2508.12880 2026-03-05 cs.CV 70%

Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models

扩散模型训练无关增强的随机自引导

Chubin Chen, Jiashu Zhu, Xiaokun Feng, Nisha Huang, Chen Zhu, Meiqi Wu, Fangyuan Mao, Jiahong Wu, Xiangxiang Chu, Xiu Li

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出S$^2$-Guidance方法,通过随机块丢弃构建子网络,提升扩散模型在文本到图像和视频生成任务中的性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04338 2026-03-05 cs.CV 57%

ArtHOI: Articulated Human-Object Interaction Synthesis by 4D Reconstruction from Video Priors

ArtHOI: 通过视频先验进行4D重建的可变形人-物交互合成

Zihao Huang, Tianqi Liu, Zhaoxi Chen, Shaocong Xu, Saining Zhang, Lixing Xiao, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院) the S-Lab, Nanyang Technological University (NTU)(南洋理工大学S实验室) the Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Zhejiang University (ZJU)(浙江大学) the Institute for AI Industry Research (AIR), Tsinghua University (THU)(清华大学人工智能产业研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ArtHOI通过4D重建从视频先验生成可变形人-物交互,提升接触精度和物理合理性。

Comments Project Page: https://arthoi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16957 2026-03-05 cs.CV 57%

MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis

MatPedia: 一种通用生成基础,用于高保真材料合成

Di Luo, Shuhui Yang, Mingxin Yang, Jiawei Lu, Yixuan Tang, Xintong Han, Zhuo Chen, Beibei Wang, Chunchao Guo

机构 * Nankai University(南开大学) Tencent Hunyuan(腾讯文言) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MatPedia是一种基于联合RGB-PBR表示的生成模型,能够统一处理多种材料生成任务,实现高质量的高保真材料合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV 57%

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2603.04349 2026-03-05 cs.CV 83%

FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

FocusGraph: 用于具身长视频问答的图结构帧选择

Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

机构 * AXXX MIRAI Yandex FusionBrain Lab(FusionBrain实验室)

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 FocusGraph通过图结构帧选择和轻量级模型实现高效长视频问答,提升性能并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2602.11291 2026-03-05 cs.RO 50%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 4 篇

2603.04379 2026-03-05 cs.CV 86%

Helios: Real Real-Time Long Video Generation Model

Helios:实时长视频生成模型

Shenghai Yuan, Yuanyang Yin, Zongjian Li, Xinwei Huang, Xiao Yang, Li Yuan

机构 * Peking University(北京大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 Helios是首个无需并行框架、能实时生成长视频且质量媲美基线模型的14B视频生成模型。

Comments Page: pku-yuangroup.github.io/Helios-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 79%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 长视频与时序推理 :video reasoning(title,abstract);分类 cs.CV

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04336 2026-03-05 cs.CV 79%

Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs

构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱

Zeyi Huang, Yuyang Ji, Xiaofang Wang, Nikhil Mehta, Tong Xiao, Donghyun Lee, Sigmund Vanvalkenburgh, Shengxin Zha, Bolin Lai, Yiqiu Ren, Licheng Yu, Ning Zhang, Yong Jae Lee, Miao Liu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Meta UIUC(伊利诺伊大学香槟分校)

专题命中 长视频与时序推理 :long video(title);video understanding(abstract);分类 cs.CV

AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03985 2026-03-05 cs.CV 57%

RIVER: A Real-Time Interaction Benchmark for Video LLMs

RIVER:面向视频大语言模型的实时交互基准

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。

详情

展开后加载摘要…

URL PDF HTML 收藏