arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-20 至 2026-08-20 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2605.09874 2026-08-20 cs.CV cs.AI cs.CL 版本更新 83%

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。

Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17935 2026-08-20 cs.CV 版本更新 61%

Beyond Instrument Motion: Recognizing Tissue Tension Toward Surgical Skill Assessment

超越器械运动:面向手术技能评估的组织张力识别

Marko Haralović, Zhiqi Miao, Alexander Machiel Bont, Jiapan Guo, Frans van Workum, Estefanía Talavera

机构 * University of Zagreb(萨格勒布大学) University of Twente(特文特大学) University of Groningen(格罗宁根大学) Radboud University Medical Center(拉德堡德大学医学中心) Canisius-Wilhelmina Hospital(卡尼修斯-威廉明娜医院)

专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV

AI总结 针对现有手术视频理解方法未捕捉组织张力的问题,本文构建SurgTension数据集,提出TensionTRAC框架,实现了腹腔镜及机器人辅助直肠癌手术的组织张力识别,为手术技能评估提供客观基准。

Comments The paper is accepted by ECCV 2026 Workshop On Medical Video Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31029 2026-08-20 cs.CV 版本更新 57%

PEEK: Picking Essential frames via Efficient Knowledge distillation

PEEK: 通过高效知识蒸馏提取关键帧

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) Institut Polytechnique de Paris(巴黎政治学院) Moments Lab

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。

Comments Accepted at BMVC 2026. Supplementary material at this https URL (https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2512.22274 2026-08-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26154 2026-08-20 cs.CV 版本更新 79%

IPV-Bench: Benchmarking Image Protection Methods under Diverse Image-to-Video Generation Scenarios

IP-Bench:图像到视频生成场景中的图像保护方法基准

Xiaofeng Li, Leyi Sheng, Yifan Zhao, Zhen Sun, Zongmin Zhang, Jiaheng Wei, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03079 2026-08-20 cs.CV 版本更新 79%

ORV: 4D Occupancy-centric Robot Video Generation

ORV:基于占用的4D机器人视频生成

Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波工程技术院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) S-Lab, Nanyang Technological University(南洋理工大学S实验室) ByteDance(字节跳动) Kling, Kuaishou Technology(Kling,快手科技) GigaAI AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。

Comments CVPR 2026. Project page: this https URL (https://orangesodahub.github.io/ORV/) Code: this https URL (https://github.com/OrangeSodahub/ORV)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: this https URL (https://srl-ethz.github.io/Mask2Real-WM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 57%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2605.06185 2026-08-20 cs.AI cs.CV 版本更新 89%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏