arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-25 至 2026-03-25 共收录 19 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2603.22466 2026-03-25 cs.CV cs.AI cs.HC cs.MM 62%

Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

颜色何时重要:灰度引导的在线触发用于始终开启的流视频感知

Weitong Cai, Hang Zhang, Yukai Huang, Shitong Sun, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Independent Researcher(独立研究者) Durham University(杜伦大学) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出灰度引导的在线触发方法,通过减少颜色捕获频率,在资源受限设备上实现高效流视频感知,实验显示其在保持性能的同时显著降低能耗。

Comments Accepted at CVPR 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV 57%

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV 57%

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2511.03334 2026-03-25 cs.CV 79%

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 74%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23462 2026-03-25 cs.CV 70%

RealMaster: Lifting Rendered Scenes into Photorealistic Video

RealMaster: 将渲染场景提升为逼真视频

Dana Cohen-Bar, Ido Sobol, Raphael Bensadoun, Shelly Sheynin, Oran Gafni, Or Patashnik, Daniel Cohen-Or, Amit Zohar

机构 * Tel Aviv University(特拉维夫大学) Reality Labs, Meta(Meta现实实验室) Technion Israel(技术学院以色列)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 RealMaster通过视频扩散模型将渲染视频提升为逼真视频,保持与3D引擎输出的精确对齐,同时通过IC-LoRA训练实现高质量输出和泛化能力。

Comments Project page: https://danacohen95.github.io/RealMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22606 2026-03-25 cs.CV 70%

TrajLoom: Dense Future Trajectory Generation from Video

TrajLoom:从视频生成密集未来轨迹

Zewei Zhang, Jia Jun Cheng Xian, Kaiwen Liu, Ming Liang, Hang Chu, Jun Chen, Renjie Liao

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出TrajLoom框架,通过过去轨迹和视频上下文预测未来轨迹和可见性,采用Grid-Anchor Offset Encoding、TrajLoom-VAE和TrajLoom-Flow三种组件,扩展预测时间范围并提升轨迹真实性和稳定性。

Comments Project page, code, model checkpoints, and datasets: https://trajloom.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 50%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19709 2026-03-25 cs.RO 50%

Morphology-Consistent Humanoid Interaction through Robot-Centric Video Synthesis

通过机器人中心视频合成实现形态一致的人形交互

Weisheng Xu, Jian Li, Yi Gu, Bin Yang, Haodong Chen, Shuyi Lin, Mingqian Zhou, Jing Tan, Qiwei Wu, Xiangrui Jiang, Taowen Wang, Jiawen Wen, Qiwei Liang, Jiaxi Zhang, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Dream2Act框架,通过生成视频合成实现零样本人形机器人交互,避免传统retargeting的形态差距问题,提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2603.23491 2026-03-25 cs.CV 79%

Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation

视网膜扩散:高效的视空适应图像和视频生成

Brian Chao, Lior Yariv, Howard Xiao, Gordon Wetzstein

机构 * Stanford University, USA(斯坦福大学,美国)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出视网膜扩散模型,通过非均匀分配token提高生成效率,利用人类视觉的视网膜区域高分辨率特性,在保持视觉质量的同时显著减少token数量和生成时间。

Comments Project website at https://bchao1.github.io/foveated-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO 78%

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 74%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23326 2026-03-25 cs.CV 70%

ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images

ViBe:源自纯图像的超高清视频合成

Yunfeng Wu, Hongying Cheng, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出纯图像适应框架,通过两阶段LoRA策略提升视频扩散模型生成超高清视频的能力,无需视频训练数据,在VBench基准上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2603.22953 2026-03-25 cs.CV 79%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2603.23487 2026-03-25 cs.CV 57%

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 2 篇

2601.13719 2026-03-25 cs.CV cs.AI cs.IR 88%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22815 2026-03-25 cs.CV 57%

Captain Safari: A World Engine with Pose-Aligned 3D Memory

Captain Safari: 一种具有姿态对齐3D记忆的世界引擎

Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出Captain Safari,一种基于姿态条件的世界引擎,通过持久化世界记忆生成视频,提升了复杂场景下的3D一致性与轨迹跟踪能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 2 篇

2603.22756 2026-03-25 cs.CV 74%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23497 2026-03-25 cs.CV 57%

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG

Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Tsinghua University(清华大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏