arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-20 至 2026-08-20 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2605.09874 2026-08-20 cs.CV cs.AI cs.CL 版本更新 83%

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。

Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17935 2026-08-20 cs.CV 版本更新 61%

Beyond Instrument Motion: Recognizing Tissue Tension Toward Surgical Skill Assessment

超越器械运动:面向手术技能评估的组织张力识别

Marko Haralović, Zhiqi Miao, Alexander Machiel Bont, Jiapan Guo, Frans van Workum, Estefanía Talavera

机构 * University of Zagreb(萨格勒布大学) University of Twente(特文特大学) University of Groningen(格罗宁根大学) Radboud University Medical Center(拉德堡德大学医学中心) Canisius-Wilhelmina Hospital(卡尼修斯-威廉明娜医院)

专题命中 视频理解 :video understanding(abstract,comments);分类 cs.CV

AI总结 针对现有手术视频理解方法未捕捉组织张力的问题,本文构建SurgTension数据集,提出TensionTRAC框架,实现了腹腔镜及机器人辅助直肠癌手术的组织张力识别,为手术技能评估提供客观基准。

Comments The paper is accepted by ECCV 2026 Workshop On Medical Video Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18386 2026-08-20 cs.CV cs.AI 新提交 57%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31029 2026-08-20 cs.CV 版本更新 57%

PEEK: Picking Essential frames via Efficient Knowledge distillation

PEEK: 通过高效知识蒸馏提取关键帧

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) Institut Polytechnique de Paris(巴黎政治学院) Moments Lab

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。

Comments Accepted at BMVC 2026. Supplementary material at this https URL (https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2608.18710 2026-08-20 cs.CV 新提交 79%

CamWorldQA: Perceptual Quality Assessment of Camera-Controlled World Video Generation

CamWorldQA:相机控制型世界视频生成的感知质量评估

Yunhe Li, Likun Wu, Sijing Wu, Xinyu Tian, Huiyu Duan, Yixuan Gao, Yunhao Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究推出首个相机控制型世界视频生成质量评估基准CamWorldQA,并提出含三分支的无参考评估网络CWQA,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18484 2026-08-20 cs.CV cs.AI cs.LG 新提交 79%

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

划分支撑集,重建残差:用于视频生成和世界模型的无训练稀疏注意力

Pardis Taghavi, Reza Langari, Gaurav Pandey

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparsePR算法,结合响应耦合划分与探针拟合残差重建,在四个视频生成和世界模型上实现注意力重建误差降低,22.0%-26.0%执行对密度下保持生成质量,获1.48-2.61倍端到端加速。

Comments 22 pages, 5 figures. Project page: this https URL (https://pardistaghavi.github.io/SparsePR-website/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22274 2026-08-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26154 2026-08-20 cs.CV 版本更新 79%

IPV-Bench: Benchmarking Image Protection Methods under Diverse Image-to-Video Generation Scenarios

IP-Bench:图像到视频生成场景中的图像保护方法基准

Xiaofeng Li, Leyi Sheng, Yifan Zhao, Zhen Sun, Zongmin Zhang, Jiaheng Wei, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03079 2026-08-20 cs.CV 版本更新 79%

ORV: 4D Occupancy-centric Robot Video Generation

ORV:基于占用的4D机器人视频生成

Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波工程技术院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) S-Lab, Nanyang Technological University(南洋理工大学S实验室) ByteDance(字节跳动) Kling, Kuaishou Technology(Kling,快手科技) GigaAI AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。

Comments CVPR 2026. Project page: this https URL (https://orangesodahub.github.io/ORV/) Code: this https URL (https://github.com/OrangeSodahub/ORV)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: this https URL (https://srl-ethz.github.io/Mask2Real-WM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 57%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2605.06185 2026-08-20 cs.AI cs.CV 版本更新 89%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2608.18532 2026-08-20 cs.CV 新提交 83%

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) The University of Sydney(悉尼大学) Central South University(中南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) SenseTime Research(商汤科技研究院)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。

Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18640 2026-08-20 cs.CV 新提交 57%

SAM2Dual: Training-Free, Dual Memory for Long-Term Video Object Segmentation

SAM2Dual:用于长期视频目标分割的无训练双内存机制

JeongRae Kim, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文针对长期视频目标分割的误差累积问题,提出无训练即插即用的SAM2Dual,通过双内存设计与文本感知内存提升长视频鲁棒性,在MOSEv2、LVOSv2基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2608.18607 2026-08-20 cs.CV 新提交 57%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏