arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2603.14377 2026-06-03 cs.CV 57%

LoCAtion: Long-time Collaborative Attention Framework for High Dynamic Range Video Reconstruction

LoCAtion: 用于高动态范围视频重建的长时间协同注意力框架

Qianyu Zhang, Bolun Zheng, Lingyu Zhu, Aiai Huang, Zongpeng Li, Shiqi Wang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出LoCAtion框架,通过解耦对齐与融合、采用协同注意力机制和全局序列求解器,实现无需显式对齐的高动态范围视频重建,在视觉质量和时间稳定性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02491 2026-06-02 cs.CV 57%

MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents

MORPHOS: 基于时间结构化潜变量的自回归4D生成

Minkyung Kwon, Jinhyeok Choi, Youngjin Shin, Jaeyeong Kim, JongMin Lee, Seungryong Kim

机构 * KAIST AI(韩国国立科学技术院人工智能实验室)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出MORPHOS框架,利用时间结构化潜变量(T-SLAT)统一表示4D动态资产,通过自回归因果注意力生成,解决多表示兼容、拓扑变化和长时间一致性问题。

Comments Project page: https://cvlab-kaist.github.io/MORPHOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17625 2026-06-02 cs.CV 57%

FlowC2S: Flowing from Current to Succeeding Frames for Fast and Memory-Efficient Video Continuation

FlowC2S:从当前帧流向后续帧以实现快速且内存高效的视频延续

Hovhannes Margaryan, Quentin Bammey, Christian Sandor

机构 * Team ARAI, Université Paris-Saclay, CNRS, LISN, France(ARAI团队,巴黎萨克雷大学,法国国家科学研究中心,LISN,法国) LTCI, Télécom Paris, Institut Polytechnique de Paris, France(LTCI,巴黎电信学院,巴黎理工学院,法国)

专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV

AI总结 提出FlowC2S方法,通过微调预训练文本到视频流模型学习当前与后续视频块之间的向量场,利用固有最优耦合和目标反转实现快速、内存高效的视频延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 57%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27686 2026-05-28 cs.CV cs.AI 57%

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

张量记忆:用于长程Transformer的固定大小循环状态

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) IBM Research, Cambridge, MA, USA(IBM研究院) University of Toronto, Toronto, Canada(多伦多大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 提出张量记忆模块,通过固定大小的3D循环张量状态增强Transformer,以解耦状态容量与输入长度,并保持空间归纳偏置,适用于长程视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL 57%

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22718 2026-05-22 cs.CV 57%

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV: 通过世界检索和压缩实现高效的world内存

Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Naver AI Lab(Naver人工智能实验室)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldKV,一种无需训练的框架,通过世界检索和压缩技术,在保持一致性的同时提高效率,实现在Matrix-Game-2.0和LingBot-World-Fast数据集上达到或超越全KV内存保真的性能。

Comments Project Page: https://cvlab-kaist.github.io/WorldKV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20818 2026-05-21 cs.CV 57%

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Yisen Feng, Leigang Qu, Haoyu Zhang, Qiaohui Chu, Meng Liu, Xuemeng Song, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学) Southern University of Science and Technology(南方科技大学)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 本文提出一种基于多模态大语言模型(MLLM)的重排序框架,用于解决Ego4D事件记忆挑战2026中的自然语言查询和目标步 tracks,通过结合现有定位模型OSGNet的候选片段和MLLM的视频-语言推理能力,提升时间片段的定位精度。

Comments Champion solution for the Natural Language Queries and GoalStep tracks of the Ego4D Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18176 2026-05-19 cs.CV cs.AI 57%

MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

MARS:EgoVis 2026 CASTLE挑战的技术报告

Haoyu Zhang, Qiaohui Chu, Yisen Feng, Meng Liu, Weili Guan, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出MARS系统,用于EgoVis 2026的CASTLE挑战,通过多模态代理推理解决需要多源信息的复杂问题,核心方法是多模态证据选择,主要贡献是实现了在多源数据上的有效推理。

Comments The Runner-up Solution for CASTLE Challenge @ EgoVis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17303 2026-05-19 cs.CV 57%

LongDPM: Overlap-Aware 4D Reconstruction from Long Monocular Videos

LongDPM: 长视频中基于重叠意识的4D重建

Chenyi Xu, Yihao Wu, Liqi Yan, Chao Yang, Jianhui Zhang, Fangli Guan, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出LongDPM,一种基于重叠意识的长视频单目动态重建框架,通过分块处理、重登记和动态身份关联,实现长距离的3D重建和跟踪,提升了PointOdyssey、Kubric-F和Kubric-G等数据集上的密集跟踪精度和相机姿态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15042 2026-05-15 cs.CV cs.AI 57%

EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

EverAnimate:通过潜在流恢复实现分钟级人类动画

Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

机构 * EPFL(瑞士联邦理工学院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 EverAnimate通过潜在流恢复技术,在保持视觉质量和角色身份的同时,高效生成长时域动画视频,解决了动态人类动作与静态环境之间的生成漂移问题。

Comments Project Page: https://everanimate.github.io/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12496 2026-05-13 cs.CV 57%

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

CausalCine:多镜头视频叙事的实时自回归生成

Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) SJTU(上海交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 CausalCine通过自回归框架实现多镜头视频生成,通过动态提示和记忆路由保持跨镜头连贯性,优于现有自回归模型,实现实时交互生成。

Comments Project page: https://yihao-meng.github.io/CausalCine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10762 2026-05-12 cs.CV cs.AI 57%

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV 57%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05959 2026-04-30 cs.CV 57%

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT:O(1)常数成本流式视觉几何变换器

Si-Yu Lu, Po-Ting Chen, Hui-Che Hsu, Sin-Ye Jhong, Wen-Huang Cheng, Yung-Yao Chen

机构 * National Taiwan University(国立台湾大学) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 OVGGT通过自选择缓存和动态锚点保护,在固定内存预算下实现长视频流式处理,取得最佳3D几何精度。

Comments Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG 57%

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV 57%

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20311 2026-04-24 cs.MM cs.AI 57%

Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction

看得更远且更广:面向微视频流行度预测的联合时空放大

Dali Wang, Yunyao Zhang, Junqing Yu, Yi-Ping Phoebe Chen, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.MM

AI总结 本文提出联合时空放大框架,通过时空增强模块提升微视频流行度预测的精度与可扩展性,实验表明其在主流指标上优于11个基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 57%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 57%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18573 2026-04-21 cs.CV 57%

T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability

T-REN:学习文本对齐的区域标记以提高密集视觉-语言对齐和可扩展性

Savya Khosla, Sethuraman T, Aryan Chadha, Alex Schwing, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 T-REN通过文本对齐的区域标记提升密集视觉-语言对齐和可扩展性,实验证明在多个任务中性能提升显著同时大幅降低token数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17115 2026-04-21 cs.CV 57%

Inference-Time Temporal Probability Smoothing for Stable Video Segmentation with SAM2 under Weak Prompts

推理时的时间概率平滑用于在弱提示下稳定的视频分割与SAM2

Dawar Jyoti Deka

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出一种推理时的时间概率平滑方法,提升SAM2视频分割的时序稳定性,无需重训练或修改架构。通过光流运动变形和像素不确定性估计,实现弱提示下的时序一致分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 57%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06559 2026-04-17 cs.CV 57%

ArrowGEV: Grounding Events in Video via Learning the Arrow of Time

ArrowGEV:通过学习时间之箭来视频中接地事件

Fangxu Yu, Ziyao Lu, Liqiang Niu, Fandong Meng, Jie Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院,中国)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ArrowGEV框架,通过学习时间方向性提升视频中事件接地与时间理解能力,通过区分时间敏感和时间不敏感事件增强模型鲁棒性与泛化能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07209 2026-04-14 cs.CV 57%

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling

INSPATIO-WORLD:通过时空自回归建模实现实时4D世界模拟器

InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, Siji Pan, Weihong Pan, Weijian Xie, Xianbin Liu, Xiaojun Xiang, Xiaoyu Zhang, Xinyu Chen, Yifu Wang, Yipeng Chen, Zhenzhou Fan, Zhewen Le, Zhichao Ye, Ziqiang Zhao

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出INSPATIO-WORLD框架,通过时空自回归模型实现从单帧视频恢复和生成高保真动态交互场景,解决空间一致性和实时交互难题,实现在WorldScore-Dynamic基准中领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08995 2026-04-14 cs.CV 57%

Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory

矩阵游戏3.0:具有长时程记忆的实时和流式交互世界模型

Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, Peiyu Wang, Biao Jiang, Yichen Wei, Yidan Xietian, Jiangbo Pei, Liang Hu, Boyi Jiang, Hua Xue, Zidong Wang, Haofeng Sun, Wei Li, Wanli Ouyang, Xianglong He, Yang Liu, Yangguang Li, Yahui Zhou

机构 * Skywork AI(天工AI)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 矩阵游戏3.0通过改进数据、模型和推理方法,实现了720p实时长视频生成,支持长时程时空一致性,提升了生成效率和质量。

Comments Project page: https://matrix-game-v3.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08542 2026-04-10 cs.CV 57%

Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction

Scal3R: 适用于大规模3D重建的可扩展测试时间训练

Tao Xie, Peishan Yang, Yudong Jin, Yingfeng Cai, Wei Yin, Weiqiang Ren, Qian Zhang, Wei Hua, Sida Peng, Xiaoyang Guo, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Horizon Robotics(地平线机器人) Zhejiang Lab(之江实验室)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出Scal3R,通过轻量神经子网络在测试时自监督学习,提升大规模3D重建的精度和一致性,实验证明其在KITTI和Oxford Spires数据集上的优越性能。

Comments Project page: https://zju3dv.github.io/scal3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07634 2026-04-10 cs.CV 57%

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06789 2026-04-09 cs.CV cs.CL 57%

Video-guided Machine Translation with Global Video Context

基于全局视频上下文的视频引导机器翻译

Jian Chen, JinZe Lv, Zi Long, XiangHua Fu

机构 * Shenzhen University(深圳大学) Shenzhen Technology University(深圳技术大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18601 2026-04-08 cs.GR cs.AI cs.CV cs.LG 57%

BulletGen: Improving 4D Reconstruction with Bullet-Time Generation

BulletGen: 通过子弹时间生成提升4D重建

Denis Rozumny, Jonathon Luiten, Numair Khan, Johannes Schönberger, Peter Kontschieder

机构 * Meta Reality Labs(Meta 现实实验室)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 BulletGen利用生成模型在Gaussian动态场景表示中校正错误并补全缺失信息,通过对扩散视频生成模型输出与4D重建在单个冻结子弹时间步骤的对齐,实现新颖视角合成和2D/3D跟踪任务的最先进结果。

Comments Accepted at CVPR 2026 Workshop "4D World Models: Bridging Generation and Reconstruction"

详情

展开后加载摘要…

URL PDF HTML 收藏