2608.15539 2026-08-18 cs.CV 新提交 57% CrossView: Can Vision-Language Models Reason Across Cameras? CrossView:视觉-语言模型能否跨相机进行推理? Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali 机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) 纠错 专题命中 视频问答 :video understanding(abstract);分类 cs.CV AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。 Comments ECCV 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 81% Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning 超越视觉思维链:用于主动视频推理的内化视觉思维 Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt 机构 * Apple(苹果公司) 纠错 专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV、cs.MM AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57% DriveCache: Action-Aware Caching for Driving World Model Inference DriveCache:面向驾驶世界模型推理的动作感知缓存 Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye 专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。 Comments 9 pages, 7 figures, 4 tables 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.15058 2026-08-18 cs.CV 新提交 57% MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring MEDR:基于多信号事件建模与动态重评分的查询无关帧选择 Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu 专题命中 动作与事件理解 :long video(abstract);分类 cs.CV AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。 Comments 9 pages, 2 figures, 3 tables 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.16316 2026-08-18 cs.CV cs.AI cs.CL 新提交 83% Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning 深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏 Ao Shen, Yongheng Zhang, Yinghui Li, Manning Wang, Di Yin, Xing Sun 专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 79% Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models 层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理 Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu 机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) 纠错 专题命中 长视频与时序推理 :video-language(title,abstract);分类 cs.CV AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62% Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation Omni-LiveAvatar:分钟级实时流式视听联动数字人生成 Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang 专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV、cs.MM AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 57% ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow ODEWorld:一种基于物理时间流的连续预测架构 Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan 机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR)) 纠错 专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图