arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-07 至 2026-08-07 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2607.16284 2026-08-07 cs.CV cs.MM 版本更新 62%

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11183 2026-08-07 cs.CV 版本更新 57%

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

基于前馈二维高斯溅射标记化的通用视频表示

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。

Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2603.26154 2026-08-07 cs.CV 版本更新 79%

IPV-Bench: Benchmarking Image Protection Methods under Diverse Image-to-Video Generation Scenarios

IP-Bench:图像到视频生成场景中的图像保护方法基准

Xiaofeng Li, Leyi Sheng, Yifan Zhao, Zhen Sun, Zongmin Zhang, Jiaheng Wei, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 57%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 57%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16987 2026-08-07 cs.CV 版本更新 57%

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

DVAR:对抗性多智能体辩论用于视频真实性检测

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学) Guangming Lab(光明实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2608.04657 2026-08-07 cs.CV 版本更新 70%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏