arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-06 至 2026-04-06 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2604.02891 2026-04-06 cs.CV 83%

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

逐步视频压缩与MLLM代理用于长视频理解

Yufei Yin, Yuchen Xing, Qianke Meng, Minghao Chen, Yan Yang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 79%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08666 2026-04-06 cs.CV 79%

Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding

隐私超越像素:用于隐私保护视频理解的潜在匿名化

Joseph Fioresi, Ishan Rajendrakumar Dave, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Adobe

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出了一种在潜在空间中操作的视频基础模型视觉隐私保护新方法,通过轻量级匿名化适配模块在保留任务实用性的同时去除隐私信息,显著降低隐私泄露,适用于多种下游任务。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2504.17180 2026-04-06 cs.CV cs.AI 88%

We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback

事后修复:通过神经符号反馈改进文本到视频生成

Minkyu Choi, S P Sharan, Harsh Goel, Sahil Shah, Sandeep Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NeuS-E框架,通过神经符号反馈提升文本到视频生成的语义和时间一致性,实验显示其在多种提示下提升了40%的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16933 2026-04-06 cs.CV cs.LG 79%

Reward-Forcing: Autoregressive Video Generation with Reward Feedback

基于奖励的强制:利用奖励反馈的自回归视频生成

Jingran Zhang, Ning Li, Yuanhao Ban, Andrew Bai, Justin Cui

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种利用奖励信号指导生成的自回归视频生成方法,提升了生成效率和可扩展性,实验表明其性能与现有自回归模型相当,甚至在某些情况下超越了双向模型。

Comments https://openreview.net/forum?id=K8Qjsxxl7y&noteId=K8Qjsxxl7y

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02867 2026-04-06 cs.CV 57%

HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits

HairOrbit: 从单人像中基于多视角的3D毛发建模

Leyang Jin, Yujian Zheng, Bingkui Tong, Yuda Qiu, Zhenyu Xie, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SSE, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Pinscreen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HairOrbit框架,利用视频生成模型的3D先验知识,将单视角毛发重建转化为校准的多视角重建任务,并设计两阶段毛发生长算法,实现高质量的3D毛发合成。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2512.00961 2026-04-06 cs.LG 78%

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02828 2026-04-06 cs.CV cs.AI 57%

NavCrafter: Exploring 3D Scenes from a Single Image

NavCrafter:从单张图像探索3D场景

Hongbo Duan, Peiyu Zhuang, Yi Liu, Zhengyang Zhang, Yuxin Zhang, Pengting Luo, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院人工智能与机器人中心) Peng Cheng Laboratory(鹏城实验室) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Central Media Technology Institute, Huawei Incorporated Company(华为技术有限公司中央媒体技术研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 NavCrafter通过合成新颖视角视频序列,实现从单张图像生成灵活的3D场景,采用视频扩散模型和几何感知扩展策略,提升可控多视角合成与3D重建精度。

Comments 8 pages accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2512.07951 2026-04-06 cs.CV 57%

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏