arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-11 至 2026-03-11 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2603.07071 2026-03-11 cs.CV 88%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09496 2026-03-11 cs.CV 79%

SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding

SurgFed: 基于语言引导的多任务联邦学习用于手术视频理解

Zheng Fang, Ziwei Niu, Ziyue Wang, Zhu Zhuo, Haofeng Liu, Shuyang Qian, Jun Xia, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 SurgFed通过语言引导的通道选择和超聚合方法,提升手术视频多任务联邦学习的跨站点和跨任务适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2603.09883 2026-03-11 cs.CV 79%

DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary

DISPLAY:通过稀疏运动引导和多任务辅助实现可直接控制的人机交互视频生成

Jiazhi Guan, Quanwei Yang, Luying Huang, Junhao Liang, Borong Liang, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DISPLAY通过稀疏运动引导和多任务辅助训练,实现高保真且可控的人机交互视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08850 2026-03-11 cs.CV 79%

HECTOR: Hybrid Editable Compositional Object References for Video Generation

HECTOR:混合可编辑组合对象引用用于视频生成

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Alan Yuille, Chongyang Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 HECTOR通过混合可编辑组合对象引用,实现了视频生成中对复杂时空约束的高保真度满足和运动可控性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2603.09657 2026-03-11 cs.CV cs.AI cs.ET eess.IV 81%

When to Lock Attention: Training-Free KV Control in Video Diffusion

何时锁定注意力:视频扩散中的无训练KV控制

Tianyi Zeng, Jincheng Gao, Tianyi Wang, Zijie Meng, Miao Zhang, Jun Yin, Haoyuan Sun, Junfeng Jiao, Christian Claudel, Junbo Tan, Xueqian Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。

Comments 18 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09819 2026-03-11 cs.CV 74%

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2508.10729 2026-03-11 cs.CV cs.AI 57%

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

EgoCross:多模态大语言模型跨领域眼动视频问答基准测试

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 EgoCross提出一个跨领域眼动视频问答基准,评估多模态大语言模型在不同领域中的泛化能力,揭示现有模型在非日常领域任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2602.05871 2026-03-11 cs.CV 84%

Pathwise Test-Time Correction for Autoregressive Long Video Generation

逐帧测试时校正用于自回归长视频生成

Xunzhi Xiang, Zixuan Duan, Guiyu Zhang, Haiyu Zhang, Zhe Gao, Junta Wu, Shaofeng Zhang, Tengfei Wang, Qi Fan, Chunchao Guo

机构 * Nanjing University(南京大学) Tencent Hunyuan(腾讯文言) Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 长视频与时序推理 :video generation(title);long video(title);分类 cs.CV

AI总结 本文提出TTC方法,通过利用初始帧作为参考锚点,有效校正自回归长视频生成中的漂移问题,提升生成质量并延长生成长度。

详情

展开后加载摘要…

URL PDF HTML 收藏