arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-13 至 2026-04-13 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01400 2026-04-13 cs.CV 57%

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

通过局部和全局上下文优化实现高效视频大语言模型的token缩减

Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出AOT方法,通过局部-全局最优传输优化视频大语言模型中的token,实现高效的token缩减,保持时间与视觉保真度。

Comments CVPR2026, Project webpage: https://tyroneli.github.io/AOT

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2604.09201 2026-04-13 cs.CV 83%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05091 2026-04-13 cs.CV 74%

PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation

PoseGen: 一种基于上下文LoRA微调的长人类视频生成框架

Jingxuan He, Busheng Su, Finn Wong

机构 * Xiaoice, China(小冰公司,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 PoseGen通过上下文LoRA微调实现对人物姿态的精细控制,生成长时长视频,解决了身份漂移和视频长度限制问题。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09195 2026-04-13 cs.AI 71%

Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation

Camera Artist: 一种多智能体框架用于电影语言叙事视频生成

Haobo Hu, Qi Mao, Yuanhang Li, Libiao Jin

机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 视频生成 :video generation(title)

AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04175 2026-04-13 cs.CV 57%

Beyond Flicker: Detecting Kinematic Inconsistencies for Generalizable Deepfake Video Detection

超越闪烁:检测可泛化深度伪造视频检测中的运动不一致

Alejandro Cobo, Roberto Valle, José Miguel Buenaposada, Luis Baumela

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出合成视频生成方法,通过引入微妙的运动不一致来训练模型,从而提升深度伪造视频检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2604.08646 2026-04-13 cs.CV 79%

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06161 2026-04-13 cs.CV cs.AI cs.GR 79%

DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models

DiffHDR:利用视频扩散模型重新暴露LDR视频

Zhengming Yu, Li Ma, Mingming He, Leo Isikdogan, Yuancheng Xu, Dmitriy Smirnov, Pablo Salamanca, Dao Mi, Pablo Delgado, Ning Yu, Julien Philip, Xin Li, Wenping Wang, Paul Debevec

机构 * Eyeline Labs(Eyeline 实验室) Netflix

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DiffHDR通过视频扩散模型的潜在空间将LDR视频转换为HDR,恢复过曝和欠曝区域的真实细节,提升动态范围和再曝光效果。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24718 2026-04-13 cs.CV cs.LG 70%

Generative View Stitching

生成视图拼接

Chonghyuk Song, Michal Stary, Boyuan Chen, George Kopanas, Vincent Sitzmann

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Runway ML

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出生成视图拼接(GVS),通过并行采样确保生成场景与预定义相机轨迹一致,解决视频生成中因未来条件缺失导致的碰撞问题,实现稳定且一致的相机引导视频生成。

Comments Published at ICLR 2026. Camera-ready Submission. Project website: https://andrewsonga.github.io/gvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10632 2026-04-13 cs.CV 57%

CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos

CoMoVi:3D人类动作与真实视频的联合生成

Chengfeng Zhao, Jiazhi Shu, Yubo Zhao, Tianyu Huang, Jiahao Lu, Zekai Gu, Chengwei Ren, Zhiyang Dou, Qing Shuai, Yuan Liu

机构 * HKUST(香港科技大学) SCUT(华南理工大学) HKU(香港大学) MIT(麻省理工学院) ZJU(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出CoMoVi框架,通过单个扩散去噪循环同步生成3D人类动作和视频,采用双分支扩散模型实现动作与视频生成的互惠特征交互和3D-2D交叉注意力。

Comments Project Page: https://igl-hkust.github.io/CoMoVi/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2511.15578 2026-04-13 cs.CV 57%

AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning

AVATAAR:通过时间自适应对齐和推理实现代理视频回答

Urjitkumar Patel, Fang-Chun Yeh, Chinmay Gondhalekar

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 AVATAAR通过结合全局和局部视频上下文,以及预检索思考代理和重思模块,提升长视频问答的准确性和可解释性,实验显示在CinePile基准上显著提升各类问答任务性能。

Comments Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2604.09164 2026-04-13 cs.CV 70%

Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection

高效空间-时间聚焦适配器与SSM用于时间动作检测

Yicheng Qiu, Keiji Yanai

机构 * Department of Informatics The University of Electro-Communications Chofu, Tokyo, Japan

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出高效空间-时间聚焦适配器与SSM结合的方法,用于提升长视频中动作检测的定位精度与鲁棒性,通过综合时空特征建模与高效处理,验证了方法的有效性。

Comments ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 1 篇

2508.06869 2026-04-13 cs.CV cs.AI 86%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 2 篇

2604.09415 2026-04-13 cs.CV cs.AI cs.LG cs.RO 57%

PhysInOne: Visual Physics Learning and Reasoning in One Suite

PhysInOne:一套视觉物理学习与推理系统

Siyuan Zhou, Hejun Wang, Hu Cheng, Jinxi Li, Dongsheng Wang, Junwei Jiang, Yixiao Jin, Jiayue Huang, Shiwei Mao, Shangjia Liu, Yafei Yang, Hongkang Song, Shenxing Wei, Zihui Zhang, Peng Huang, Shijie Liu, Zhengli Hao, Hao Li, Yitian Li, Wenqi Zhou, Zhihan Zhao, Zongqi He, Hongtao Wen, Shouwang Huang, Peng Yun, Bowen Cheng, Pok Kazaf Fu, Wai Kit Lai, Jiahao Chen, Kaiyuan Wang, Zhixuan Sun, Ziqi Li, Haochen Hu, Di Zhang, Chun Ho Yuen, Bing Wang, Zhihua Wang, Chuhang Zou, Bo Yang

机构 * vLAR Group(vLAR 研究组) The Hong Kong Polytechnic University(香港理工大学) Syai Singapore(Syai 新加坡) Meta

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。

Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 57%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏