arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-14 至 2026-08-14 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2608.13031 2026-08-14 cs.CV cs.AI 新提交 79%

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。

Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 57%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12920 2026-08-14 cs.CV 新提交 57%

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理

Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。

Comments Project Page: https://whynotgit2025.github.io/TennisVAR/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2608.13037 2026-08-14 cs.CV 新提交 89%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13049 2026-08-14 cs.RO cs.CV 新提交 79%

H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

H2R-Bench:面向世界模型的人到机器人操作视频生成基准测试

Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang, Zeyu Zhang, Yao Mu, Guangtao Zhai, Ning Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 该研究推出H2R-Bench基准测试,评估视频世界模型跨实体将人类操作视频转为机器人操作视频的能力,发现现有模型在实体一致性等方面存在局限,为相关模型评估提供诊断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交 79%

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13391 2026-08-14 cs.CV 新提交 70%

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性

Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao, Ruilong Li, Bryan Chu, Sanja Fidler, Yi-Zhe Song, Zian Wang

机构 * NVIDIA(英伟达) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出上下文匹配蒸馏(CMD)框架,解决现有视频蒸馏中教师监督与学生因果信息集不一致的问题,实现了自回归视频生成的最先进性能及对相机控制的更好依从性。

Comments Project Page: https://hmrishavbandy.github.io/cmd-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 57%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2608.13205 2026-08-14 cs.CV 新提交 79%

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13043 2026-08-14 cs.AI cs.CV cs.LG 新提交 57%

From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

从局部失配到全局影响:优化缓存重用策略以实现高效扩散模型

Xichen Ye, Yifan Wu, Zhikang Xie, Xiangyu Yue, Cheng Jin, Weizhong Zhang

机构 * Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对扩散模型缓存策略与生成质量失配问题,提出GCache双层优化框架,在Wan2.1模型上实现2.17倍加速且LPIPS降至0.0316,性能优于现有缓存策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2608.13210 2026-08-14 cs.CV cs.AI cs.MM 新提交 81%

NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准

Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma

机构 * The University of Tokyo(东京大学) Kyushu University(九州大学) Macau University of Science and Technology(澳门科技大学) Infinimind Japan Inc.(Infinimind日本公司) University of Alberta(阿尔伯塔大学)

专题命中 长视频与时序推理 :long video(title);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。

Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏