arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-07 至 2026-07-07 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.18157 2026-07-07 cs.CV cs.LG 版本更新 88%

Agentic Very Long Video Understanding

智能体超长视频理解

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim

机构 * Reality Labs Research at Meta(Meta 实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对智能眼镜等设备带来的长视频理解需求,以实体场景图为核心构建增强智能体框架EGAgent,实现结构化搜索、推理及跨模态能力,在相关数据集实验中取得较好表现。

Comments 29 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10805 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

Learning to Visually Connect Actions and their Effects

学习在视觉上连接动作及其效果

Paritosh Parmar, Eric Peh, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究引入视觉连接动作及其效果(CATE)概念,探索其动作选择和效果亲和力评估两方面,设计基线模型,发现模型在该任务中表现不佳,人类远超模型,还表明CATE可作为自监督任务学习视频表征。

Comments WACV 2025 (Two Reviewer Nominations for Best Paper Candidate; Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2601.08828 2026-07-07 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 84%

Motion Attribution for Video Generation

视频生成中的运动归因

Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé, Olga Russakovsky, Sanja Fidler, Jonathan Lorraine

机构 * NVIDIA Princeton University(普林斯顿大学) MIT(麻省理工学院) University of Michigan(密歇根大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 研究视频生成模型中数据对运动影响,提出基于梯度的运动归因框架Motive,通过运动加权损失掩码分离静态外观和时间动态,用于研究微调剪辑对时间动态的影响及指导数据策划,提升视频运动质量。

Comments See the project website at https://research.nvidia.com/labs/sil/projects/MOTIVE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08982 2026-07-07 cs.CV 版本更新 83%

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 81%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19048 2026-07-07 cs.CV 版本更新 74%

Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

动态生成视频中3D空间几何一致性的测量

Weijia Dou, Wenzhao Zheng, Weiliang Chen, Yu Zheng, Jie Zhou, Jiwen Lu

机构 * Tongji University(同济大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。

Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 70%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 70%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 57%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2604.17195 2026-07-07 cs.CV 版本更新 79%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 79%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 70%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2508.21010 2026-07-07 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 57%

ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering

ChainReaction:用于模块化和可解释因果关系视频问答的因果链引导推理

Paritosh Parmar, Eric Peh, Basura Fernando

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(新加坡高性能计算研究所,科技研究局) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科技研究局前沿人工智能研究中心,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 针对现有因果关系视频问答模型的问题,提出新的模块化范式,将因果推理与答案生成解耦,引入自然语言因果链,介绍两阶段架构及生成因果链方法,新指标,实验证明该方法性能优越。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2605.27318 2026-07-07 cs.CV 版本更新 57%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏