arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2509.25183 2025-09-30 cs.CV 57%

PAD3R: Pose-Aware Dynamic 3D Reconstruction from Casual Videos

Ting-Hsuan Liao, Haowen Liu, Yiran Xu, Songwei Ge, Gengshan Yang, Jia-Bin Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025. Project page:https://pad3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21790 2025-09-29 cs.CV 57%

LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE

Yu Shang, Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21113 2025-09-29 cs.CV 57%

MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning

Sicheng Tao, Jungang Li, Yibo Yan, Junyan Zhang, Yubo Gao, Hanqian Li, ShuHang Xun, Yuxuan Fan, Hong Chen, Jianxiang He, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) HIT(哈尔滨工业大学)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05271 2025-09-29 cs.CV 57%

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yiming Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Kaipeng Zhang, Limin Wang, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21100 2025-09-26 cs.CV 57%

VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception

Ziang Yan, Xinhao Li, Yinan He, Zhengrong Yue, Xiangyu Zeng, Yali Wang, Yu Qiao, Limin Wang, Yi Wang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17500 2025-09-23 cs.CV 57%

SAMSON: 3rd Place Solution of LSVOS 2025 VOS Challenge

Yujie Xie, Hongyang Zhang, Zhihui Liu, Shihai Ruan

机构 * Truesight Research(Truesight研究机构) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳))

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05467 2025-09-22 cs.CV cs.AI cs.CL 57%

StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant

Haibo Wang, Bo Feng, Zhengfeng Lai, Mingze Xu, Shiyu Li, Weifeng Ge, Afshin Dehghan, Meng Cao, Ping Huang

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00879 2025-09-16 cs.CV 57%

GISE-TTT:A Framework for Global InformationSegmentation and Enhancement

Fenglei Hao, Yuliang Yang, Ruiyuan Su, Zhengran Zhao, Yukun Qiao, Mengyu Zhu

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments The manuscript requires further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02733 2025-09-11 cs.CV cs.AI 57%

UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression

Jia Wang, Xinfeng Zhang, Gai Zhang, Jun Zhu, Lv Tang, Li Zhang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(计算机科学与技术学院,中国科学院大学) Bytedance Inc.(字节跳动公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted to TCSVT2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03501 2025-09-04 cs.CV cs.AI cs.HC cs.LG 57%

Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data

Honglu Zhou, Xiangyu Peng, Shrikant Kendre, Michael S. Ryoo, Silvio Savarese, Caiming Xiong, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments This technical report serves as the archival version of our paper accepted at the ICCV 2025 Workshop. For more information, please visit our project website: https://strefer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23575 2025-09-03 cs.CV 57%

Beyond Gloss: A Hand-Centric Framework for Gloss-Free Sign Language Translation

Sobhan Asasi, Mohamed Ilyas Lakhal, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Center for Vision, Speech and Signal Processing (CVSSP) University of Surrey(视觉、语音和信号处理中心(CVSSP)大学学院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13138 2025-09-03 cs.CV 57%

STAGE: A Stream-Centric Generative World Model for Long-Horizon Driving-Scene Simulation

Jiamin Wang, Yichen Yao, Xiang Feng, Hang Wu, Yaming Wang, Qingqiu Huang, Yuexin Ma, Xinge Zhu

机构 * ShanghaiTech University(上海科技大学) Yinwang Intelligent Technology Co. Ltd.(英伟达智能科技有限公司)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

Comments Accepted for 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23266 2025-08-26 cs.CV cs.AI cs.CL 57%

TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models

Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17890 2025-08-26 cs.CV 57%

UniAPO: Unified Multimodal Automated Prompt Optimization

Qipeng Zhu, Yanzhe Chen, Huasong Zhong, Yan Li, Jie Chen, Zhixin Zhang, Junping Zhang, Zhenheng Yang

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13692 2025-08-20 cs.CV 57%

HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes

Keliang Li, Hongze Shen, Hao Shi, Ruibing Hou, Hong Chang, Jie Huang, Chenghao Jia, Wen Wang, Yiling Wu, Dongmei Jiang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)、计算技术研究所、中国)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07330 2025-08-19 cs.CV 57%

Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos

Tuyen Tran, Thao Minh Le, Quang-Hung Le, Truyen Tran

机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

Comments Accepted for publication at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08082 2025-08-12 cs.CV 57%

ME-TST+: Micro-expression Analysis via Temporal State Transition with ROI Relationship Awareness

Zizheng Guo, Bochao Zou, Junbao Zhuo, Huimin Ma

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(信息与通信工程学院,北京科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07543 2025-08-12 cs.CV cs.LG 57%

Commentary Generation for Soccer Highlights

Chidaksh Ravuru

机构 * cs.unc.edu(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06317 2025-08-11 cs.CV 57%

Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding

Jian Hu, Zixu Cheng, Shaogang Gong, Isabel Guan, Jianye Hao, Jun Wang, Kun Shao

机构 * Queen Mary University of London(伦敦女王学院) Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05001 2025-08-11 cs.CV cs.LG cs.PF 57%

CRAM: Large-scale Video Continual Learning with Bootstrapped Compression

Shivani Mall, Joao F. Henriques

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Journal ref International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09144 2025-08-05 cs.CV 57%

$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting

Zhimin Liao, Ping Wei, Ruijie Zhang, Shuaijia Chen, Haoxuan Wang, Ziyang Ren

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人学院,西安交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24329 2025-08-01 cs.CV 57%

DisTime: Distribution-based Time Representation for Video Large Language Models

Yingsen Zeng, Zepeng Huang, Yujie Zhong, Chengjian Feng, Jie Hu, Lin Ma, Yang Liu

机构 * Meituan Inc.(美团公司) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19754 2025-07-29 cs.CV 57%

Latest Object Memory Management for Temporally Consistent Video Instance Segmentation

Seunghun Lee, Jiwan Seo, Minwoo Choi, Kiljoon Han, Jaehoon Jeong, Zane Durante, Ehsan Adeli, Sang Hyun Park, Sunghoon Im

机构 * DGIST, Daegu, Republic of Korea(韩国大邱科学技术院) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments ICCV 2025. Code: https://github.com/Seung-Hun-Lee/LOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18921 2025-07-28 cs.CV 57%

HQ-SMem: Video Segmentation and Tracking Using Memory Efficient Object Embedding With Selective Update and Self-Supervised Distillation Feedback

Elham Soltani Kazemi, Imad Eddine Toubal, Gani Rahmon, Jaired Collins, K. Palaniappan

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments submit/6651762

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09577 2025-07-23 cs.CV 57%

Memory-Augmented SAM2 for Training-Free Surgical Video Segmentation

Ming Yin, Fu Wang, Xujiong Ye, Yanda Meng, Zeyu Fu

机构 * Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted in MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18423 2025-07-22 cs.CV cs.AI 57%

OCK: Unsupervised Dynamic Video Prediction with Object-Centric Kinematics

Yeon-Ji Song, Jaein Kim, Suhyung Choi, Jin-Hwa Kim, Byoung-Tak Zhang

机构 * Seoul National University(首尔国立大学) SNU AIIS NAVER AI Lab(NAVER AI实验室)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted at ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05166 2025-07-22 cs.CV 57%

CD-NGP: A Fast Scalable Continual Representation for Dynamic Scenes

Zhenhuan Liu, Shuai Liu, Zhiwei Ning, Jie Yang, Yifan Zuo, Yuming Fang, Wei Liu

机构 * Dept. of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments 18 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12762 2025-07-18 cs.CV cs.LG 57%

World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving

Yanchen Guan, Haicheng Liao, Chengyue Wang, Xingcheng Liu, Jiaxun Zhang, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City(物联网智能城市国家重点实验室) University of Macau(澳门大学) Department of Civil Engineering(土木工程系) Department of Computer and Information Science(计算机与信息科学系)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13377 2025-07-01 cs.CV cs.AI cs.CL 57%

Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding

Ye Wang, Ziheng Wang, Boshen Xu, Yang Du, Kejun Lin, Zihan Xiao, Zihao Yue, Jianzhong Ju, Liang Zhang, Dingyi Yang, Xiangnan Fang, Zewen He, Zhenbo Luo, Wenxuan Wang, Junqi Lin, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

Comments Project Page: https://xuboshen.github.io/Time-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18839 2025-06-24 cs.CV 57%

4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation

Chaoyang Wang, Ashkan Mirzaei, Vidit Goel, Willi Menapace, Aliaksandr Siarohin, Avalon Vinella, Michael Vasilkovsky, Ivan Skorokhodov, Vladislav Shakhrai, Sergey Korolev, Sergey Tulyakov, Peter Wonka

机构 * Snap Inc. KAUST

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏