arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-18 至 2026-08-18 共收录 38 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 1 篇

2608.15539 2026-08-18 cs.CV 新提交 57%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作与事件理解 3 篇

2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 81%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 57%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 4 篇

2608.16316 2026-08-18 cs.CV cs.AI cs.CL 新提交 83%

Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏

Ao Shen, Yongheng Zhang, Yinghui Li, Manning Wang, Di Yin, Xing Sun

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 79%

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu

机构 * National University of Singapore(新加坡国立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 长视频与时序推理 :video-language(title,abstract);分类 cs.CV

AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 57%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏