arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-03 至 2026-06-03 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2606.03920 2026-06-03 cs.CV 79%

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03635 2026-06-03 cs.CV cs.AI 70%

VidMsg: A Benchmark for Implicit Message Inference in Short Videos

VidMsg:短视频中隐含信息推断的基准测试

Issar Tzachor, Michael Green, Rami Ben-Ari

机构 * OriginAI, Israel(OriginAI以色列)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。

Comments Project page: https://iyttor.github.io/VidMsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03837 2026-06-03 cs.CV 57%

Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation?

在低资源视频任务适应中,我们(不)需要时间上下文的哪些部分?

Luc P. J. Sträter, Hazel Doughty

机构 * Leiden University(莱顿大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文系统研究了视频理解中模型适应策略的时间上下文分配问题,通过评估不同设置下的参数高效微调和探测方法,揭示了时间上下文在骨干网络、PEFT和探测之间的最优分布。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS 81%

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18639 2026-06-03 cs.CV 79%

OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance

OrthoPhys:基于正交视角几何引导的物理合理视频生成

Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Zhibo Chen

机构 * the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(SKLCCSE,北京航空航天大学计算机科学与工程学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出两阶段框架 OrthoPhys,通过正交视角几何引导生成物理一致的前景运动,再合成完整视频,显著提升物理真实感和时空一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 50%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 视频生成 :video generation(abstract)

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2606.03971 2026-06-03 cs.CV 79%

Video-Mirai: Autoregressive Video Diffusion Models Need Foresight

Video-Mirai: 自回归视频扩散模型需要远见

Yonghao Yu, Lang Huang, Runyi Li, Zerun Wang, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(信息处理研究所) Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Video-Mirai训练方法,通过冻结的远见编码器从完整生成序列中提取未来信息并蒸馏到因果状态,在不改变推理过程的情况下弥合表示层面的规划差距,提升长视频生成的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2603.14377 2026-06-03 cs.CV 57%

LoCAtion: Long-time Collaborative Attention Framework for High Dynamic Range Video Reconstruction

LoCAtion: 用于高动态范围视频重建的长时间协同注意力框架

Qianyu Zhang, Bolun Zheng, Lingyu Zhu, Aiai Huang, Zongpeng Li, Shiqi Wang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出LoCAtion框架,通过解耦对齐与融合、采用协同注意力机制和全局序列求解器,实现无需显式对齐的高动态范围视频重建,在视觉质量和时间稳定性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2606.03301 2026-06-03 cs.CL cs.CV 57%

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series

SagaQA:面向电视剧长篇叙事理解的多跳推理基准

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

机构 * IRIT, University of Toulouse, France(法国图卢兹大学IRIT中心) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局) CNRS, IRIT, France(法国CNRS与IRIT)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 提出SagaQA基准,通过跨剧集的多跳推理任务评估模型对完整电视剧多模态叙事的高层次理解,并比较并行、顺序和混合三种规划策略的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏