arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-11 至 2026-06-11 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2606.12125 2026-06-11 cs.CV 新提交 88%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 83%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12195 2026-06-11 cs.CV 新提交 57%

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

InternVideo3: 用多模态上下文推理代理化基础模型

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12047 2026-06-11 cs.CV cs.AI stat.ML 新提交 57%

Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding

元数据感知的多提示推理用于零样本事故理解

Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran

机构 * Netradyne

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出三阶段流水线,通过视觉-语言相似性、元数据驱动的多提示推理和开放词汇检测,实现零样本事故视频的时序定位、语义分类和空间定位,显著提升性能。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 15

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2606.11969 2026-06-11 cs.CV 新提交 88%

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation

SpecLoR: 面向运动连贯文本到视频生成的频谱前瞻矫正

Xu Zhang, Yu Lu, Ruijie Quan, Zhaozheng Chen, Bohan Wang, Yi Yang

机构 * ReLER, College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院ReLER实验室) Huawei Central Research Institute(华为中央研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 提出SpecLoR,一种即插即用的推理方法,通过前瞻预测和频域矫正减少文本到视频生成中的时空不一致性,在Wan2.2上显著提升运动连贯性且仅增加4次NFE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 79%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 79%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 78%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11838 2026-06-11 cs.CV 新提交 57%

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

基于时空场景图基础的计划与验证视频奖励推理

Hyomin Kim, Junghye Kim, Joanie Hayoun Chung, Yoonjin Oh, Kyungjae Lee, Sungbin Lim, Sungwoong Kim

机构 * Korea University(高丽大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出SG-PVR视频奖励模型,通过计划-验证推理和时空场景图,系统验证提示中的每个条件,实现细粒度语义对齐,提升文本到视频生成的组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 70%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12033 2026-06-11 cs.CV 新提交 57%

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

SpikeTAD:用于端到端时序动作检测的脉冲神经网络

Min Yang, Mi Zhou, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出首个基于脉冲神经网络的端到端时序动作检测架构SpikeTAD,在保持极低功耗的同时,在THUMOS14和ActivityNet-1.3上分别达到67.2%和37.42%的平均mAP。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2606.11576 2026-06-11 cs.CV cs.AI 新提交 57%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2606.12300 2026-06-11 cs.CV cs.AI 新提交 79%

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

自然语言在小时级视频中的时间定位是一个搜索问题:基准与经验分解

Sukmin Seo, Geewook Kim

机构 * NAVER Cloud AI KAIST AI(韩国科学技术院人工智能系)

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 针对小时级视频的自然语言时间定位,提出搜索是主要瓶颈而非识别,发布首个开放小时级定位基准ExtremeWhenBench,并通过检索-定位混合方法显著提升性能。

Comments 10 pages, 6 figures, Code and benchmark: https://github.com/naver-ai/ExtremeWhenBench

详情

展开后加载摘要…

URL PDF HTML 收藏