arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-04 至 2026-03-04 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 3 篇

2603.00976 2026-03-04 cs.CV 79%

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

PreciseCache: 用于高效且高保真的视频生成的精确特征缓存

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Tsinghua University(清华大学) Tongyi Lab, Alibaba(阿里巴巴通义实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PreciseCache通过精确检测和跳过冗余计算,实现视频生成的高效且高质量推理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00438 2026-03-04 cs.CV 79%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00578 2026-03-04 cs.CV 57%

Arbitrary Generative Video Interpolation

任意生成视频插值

Guozhen Zhang, Haiguang Wang, Chunyu Wang, Yuan Zhou, Qinglin Lu, Limin Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ArbInterp提出了一种可灵活调整时间戳和长度的视频帧插值框架,通过时间戳感知旋转位置嵌入和外观-运动解耦策略,实现更高效的生成与更流畅的时空过渡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 6 篇

2603.02882 2026-03-04 cs.CV 83%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI 83%

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI 79%

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02256 2026-03-04 cs.CV 57%

CamDirector: Towards Long-Term Coherent Video Trajectory Editing

CamDirector: 向长期一致的视频轨迹编辑迈进

Zhihao Shi, Kejia Yin, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu

机构 * McMaster University(麦克 master 大学) University of Toronto(多伦多大学) The University of Hong Kong(香港大学) McGill University(麦吉尔大学) Concordia University(Concordia 大学) MBZUAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 CamDirector通过混合变形方案和历史引导的自回归扩散模型,实现长期一致的视频轨迹编辑,并提出新的VTE基准iPhone-PTZ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16397 2026-03-04 cs.CV 57%

Scale-wise Distillation of Diffusion Models

扩散模型的分层蒸馏

Nikita Starodubcev, Ilya Drobyshevskiy, Denis Kuznedelev, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) HSE University(俄罗斯高等经济大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SwD通过分层蒸馏框架提升扩散模型效率,引入MMD补丁级目标改进收敛性,实现更快采样和更高性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02646 2026-03-04 cs.RO 50%

Compositional Visual Planning via Inference-Time Diffusion Scaling

通过推理时扩散缩放进行组合式视觉规划

Yixin Zhang, Yunhao Luo, Utkarsh Aashu Mishra, Woo Chul Shin, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频问答 1 篇

2510.13251 2026-03-04 cs.CV 57%

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

映射流:揭示视频大语言模型中的隐藏信息路径

Minji Kim, Taekyung Kim, Bohyung Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 视频问答 :video-language(abstract);分类 cs.CV

AI总结 本研究通过机理可解释性技术揭示视频大语言模型中信息流的隐藏路径,展示了时间推理机制及提升模型可解释性和泛化能力的贡献。

Comments ICLR 2026, 32 pages, 39 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2501.12477 2026-03-04 eess.IV cs.CV 62%

Slot-BERT: Self-supervised Object Discovery in Surgical Video

Slot-BERT: 在手术视频中实现自监督的对象发现

Guiqiu Liao, Matjaz Jogan, Marcel Hussing, Kenta Nakahashi, Kazuhiro Yasufuku, Amin Madani, Eric Eaton, Daniel A. Hashimoto

机构 * Outcomes Laboratory, Department of Surgery, University of Pennsylvania, Philadelphia, PA, USA. Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA. Division of Thoracic Surgery, Toronto General Hospital, University Health Network, Toronto, Ontario, Canada. Surgical Artificial Intelligence Research Academy, University Health Network, Toronto, ON, Canada.

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

AI总结 Slot-BERT通过双向长距离模型在手术视频中实现自监督的对象发现,提升时间一致性和跨领域适应能力。

Comments Accepted to Medical Image Analysis Journal, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08862 2026-03-04 cs.CV cs.LG 57%

StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams

StreamSplat: 向动态3D重建的在线方法:从未校准视频流中

Zike Wu, Qi Yan, Xuanyu Yi, Lele Wang, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Nanyang Technological University(南洋理工大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 StreamSplat通过在线动态3D重建方法,实现从未校准视频流中快速生成高精度3DGS表示,支持任意长度视频的实时重建。

Comments Accepted by ICLR 2026, Project page: https://streamsplat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2602.23823 2026-03-04 cs.CV 79%

APPO: Attention-guided Perception Policy Optimization for Video Reasoning

APPO:基于注意力的视频推理感知策略优化

Henghui Du, Chang Zhou, Xi Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG人工智能技术中心)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 APPO通过基于注意力的感知策略优化,利用token级奖励提升视频推理中的细粒度感知能力,有效提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI 50%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视频数据与评测 :video-language(abstract)

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏