arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-10 至 2026-04-10 共收录 17 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 88%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05650 2026-04-10 cs.CL 50%

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

见林木而非树木:通过视觉-语义引导实现松散推测解码以提高视频大语言模型的推理效率

Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li

机构 * ZJU(浙江大学) BUPT(北京邮电大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出LVSpec,一种无需训练的松散推测解码框架,通过视觉相关锚点识别和位置移位容忍机制,提升视频大语言模型的推理速度和精度。

Comments ACL'2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2604.07966 2026-04-10 cs.CV 83%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07402 2026-04-10 cs.LG eess.IV 83%

Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity

通过局部优化与表征连续性加速自回归视频生成模型训练

Yucheng Zhou, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 eess.IV

AI总结 本文提出局部优化与表征连续性方法,通过减少误差传播和提升生成视频一致性,使自回归视频生成模型训练效率提升一倍而不牺牲质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 79%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07721 2026-04-10 cs.MA 50%

Sima 1.0: A Collaborative Multi-Agent Framework for Documentary Video Production

Sima 1.0:一种用于纪录片视频制作的协作多智能体框架

Zhao Song

专题命中 视频生成 :video generation(abstract)

AI总结 Sima 1.0通过多智能体系统优化纪录片视频制作流程,将任务分解为11个步骤,利用人类操作基础创作和录制,AI代理处理编辑、字幕优化等任务,减少生产负担,提升制作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07517 2026-04-10 cs.RO 50%

Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations

抓取如梦:从生成的人类示范中模仿功能抓取

Chao Tang, Jiacheng Xu, Haofei Lu, Bolin Zou, Wenlong Dong, Hong Zhang, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习系) Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology(南方科技大学深圳市机器人视觉与感知重点实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出GraspDreamer方法,利用视觉生成模型合成的人类示范实现零样本功能抓取,通过隐含的通用先验知识和动作优化,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2604.08546 2026-04-10 cs.CV 88%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 62%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08500 2026-04-10 cs.CV 57%

Novel View Synthesis as Video Completion

新颖视角合成作为视频补全

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出将稀疏新颖视角合成视为低帧率视频补全任务,通过改进架构实现视角不变性,证明视频模型能以最少监督生成竞争性稀疏视角合成结果。

Comments Project page: https://frame-crafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04335 2026-04-10 cs.DC 50%

GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads

GENSERVE:高效共服务异构扩散模型工作负载

Fanjiang Ye, Zhangke Li, Xinrui Zhong, Ethan Ma, Russell Chen, Kaijian Wang, Jingwei Zuo, Desen Sun, Ye Cao, Triston Cao, Myungjin Lee, Arvind Krishnamurthy, Yuke Wang

专题命中 视频扩散模型 :text-to-video(abstract)

AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH 50%

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2512.08410 2026-04-10 cs.CV 88%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08542 2026-04-10 cs.CV 57%

Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction

Scal3R: 适用于大规模3D重建的可扩展测试时间训练

Tao Xie, Peishan Yang, Yudong Jin, Yingfeng Cai, Wei Yin, Weiqiang Ren, Qian Zhang, Wei Hua, Sida Peng, Xiaoyang Guo, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Horizon Robotics(地平线机器人) Zhejiang Lab(之江实验室)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出Scal3R,通过轻量神经子网络在测试时自监督学习,提升大规模3D重建的精度和一致性,实验证明其在KITTI和Oxford Spires数据集上的优越性能。

Comments Project page: https://zju3dv.github.io/scal3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07634 2026-04-10 cs.CV 57%

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2604.08540 2026-04-10 cs.CV cs.AI cs.CL 74%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频数据与评测 :video generation(title);分类 cs.CV

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏