arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-10 至 2026-07-10 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2607.08514 2026-07-10 cs.CV 新提交 79%

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

机构 * The University of Tokyo(东京大学) University of Twente(特温特大学) University of Bristol(布里斯托大学)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24477 2026-07-10 cs.CV cs.AI cs.SD 新提交 79%

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解

Yixuan Li, Guangzhi Sun, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) University of Cambridge(剑桥大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 57%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2607.08763 2026-07-10 cs.CV cs.AI 新提交 83%

OpenCoF: Learning to Reason Through Video Generation

OpenCoF:通过视频生成学习推理

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) CUHK IMIXR(香港中文大学IMIXR)

专题命中 视频生成 :video generation(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 研究针对视频生成中帧链推理缺乏多样监督和专门设计的问题,引入OpenCoF框架,含OpenCoF - 17K数据集和Wan - CoF模型。通过实验探索先进设计,发现视频推理需广泛时间监督和明确机制,还开源相关资源促进研究。

Comments Project Page: https://opencof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08020 2026-07-10 cs.CV 新提交 83%

SAGA: Stable Acceleration Guidance for Autoregressive Video Generation

SAGA:自回归视频生成的稳定加速引导

Thanh-Nhan Vo, Trong-Thuan Nguyen, Trung-Hoang Le, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学) University of Dayton(Dayton 大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究自回归视频生成中因重复使用潜在变量致时间误差问题,提出SAGA方法,它整合加速域频谱引导目标与初始化策略,无需训练可直接用于现有模型,能提升时间质量、减少时间不稳定性并保持视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08766 2026-07-10 cs.CV 新提交 70%

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

机构 * Meituan(美团) HKUST(香港科技大学) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。

Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 56%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 视频生成 :video generation(abstract,comments)

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08193 2026-07-10 cs.LG cs.AI 新提交 50%

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

机构 * Sapienza University of Rome(罗马第一大学) Sony AI(索尼人工智能)

专题命中 视频生成 :video language model(abstract)

AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2507.05240 2026-07-10 cs.RO cs.CV 版本更新 57%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2605.21917 2026-07-10 cs.CV cs.AI 版本更新 74%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 视频数据与评测 :video reasoning(title);分类 cs.CV

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏