arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2412.04729 2025-05-19 cs.CV 77%

Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model

Keunwoo Peter Yu, Achal Dave, Rares Ambrus, Jean Mercat

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07413 2022-12-15 cs.CV 77%

Towards Smooth Video Composition

Qihang Zhang, Ceyuan Yang, Yujun Shen, Yinghao Xu, Bolei Zhou

专题命中 长视频与时序推理 :video generation(abstract);video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16400 2025-05-27 cs.LG 75%

ScalingNoise: Scaling Inference-Time Search for Generating Infinite Videos

Haolin Yang, Feilong Tang, Ming Hu, Qingyu Yin, Yulong Li, Yexin Liu, Zelin Peng, Peng Gao, Junjun He, Zongyuan Ge, Imran Razzak

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);long video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 74%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 长视频与时序推理 :video reasoning(title);分类 cs.CV

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07660 2026-06-30 cs.CV 74%

End-to-End Facial Expression Detection in Long Videos

长视频中端到端面部表情检测

Yini Fang, Alec F. Diallo, Frederic Jumelle, Bertram Shi

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Edinburgh(爱丁堡大学) Ydentity Organization(Ydentity组织)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 本文提出FEDN网络,将面部表情识别与检测统一为端到端任务,通过时间注意力模块提升多时间尺度表现,优于现有基准。

Comments ICANN 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 74%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29664 2026-04-01 cs.CV 74%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12513 2026-03-16 cs.CV 74%

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

MemRoPE:通过演化记忆标记实现无训练的无限视频生成

Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

专题命中 长视频与时序推理 :video generation(title);分类 cs.CV

AI总结 MemRoPE通过演化记忆标记和在线RoPE索引机制,解决长视频生成中的时间一致性、视觉保真度和主体一致性问题,实现无训练的无限视频生成。

Comments 9 pages main, 3 pages references, 6 pages appendix. Project page: https://memrope.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09663 2026-01-15 cs.CV 74%

Self-Supervised Animal Identification for Long Videos

长时间视频中的自监督动物识别

Xuyang Fang, Sion Hannuna, Edwin Simpson, Neill Campbell

机构 * University of Bristol(布里斯托大学)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA 74%

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00694 2025-12-02 cs.CV 74%

Affordance-First Decomposition for Continual Learning in Video-Language Understanding

基于可及性的分解方法用于视频-语言理解中的持续学习

Mengzhu Xu, Hanzhi Liu, Ningkang Peng, Qianyu Chen, Canran Xiao

机构 * University of Sydney(悉尼大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Nanjing Normal University(南京师范大学) Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

AI总结 AFD通过显式分解视频-语言理解中的稳定性与适应性,实现了在持续学习中的高性能表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02617 2025-10-06 cs.CV 74%

Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation

Beijia Lu, Ziyi Chen, Jing Xiao, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) PAII Inc.(PAII公司)

专题命中 长视频与时序推理 :video generation(title);分类 cs.CV

Comments Project Page: https://beijia11.github.io/IASA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02790 2025-10-06 cs.CV cs.CL 74%

From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding

Xiangfeng Wang, Xiao Li, Yadong Wei, Xueyu Song, Yang Song, Xiaoqiang Xia, Fangrui Zeng, Zaiyi Chen, Liu Liu, Gu Xu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance China(字节跳动中国)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16268 2025-07-30 cs.CV 74%

SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree

Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments ICCV 2025, Project page: https://mark12ding.github.io/project/SAM2Long/ ; github page: https://github.com/Mark12Ding/SAM2Long/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02433 2025-06-04 cs.CV 74%

OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking

Zhongjian Wang, Peng Zhang, Jinwei Qi, Guangyuan Wang, Chaonan Ji, Sheng Xu, Bang Zhang, Liefeng Bo

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长视频与时序推理 :video generation(title);分类 cs.CV

Comments Project Page https://humanaigc.github.io/omnitalker

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05298 2025-04-08 cs.CV 74%

One-Minute Video Generation with Test-Time Training

Karan Dalal, Daniel Koceja, Gashon Hussein, Jiarui Xu, Yue Zhao, Youjin Song, Shihao Han, Ka Chun Cheung, Jan Kautz, Carlos Guestrin, Tatsunori Hashimoto, Sanmi Koyejo, Yejin Choi, Yu Sun, Xiaolong Wang

专题命中 长视频与时序推理 :video generation(title);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00692 2025-03-28 cs.CV 74%

MCBLT: Multi-Camera Multi-Object 3D Tracking in Long Videos

Yizhou Wang, Tim Meinhardt, Orcun Cetintas, Cheng-Yen Yang, Sameer Satish Pusegaonkar, Benjamin Missaoui, Sujit Biswas, Zheng Tang, Laura Leal-Taixé

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07096 2025-02-12 cs.HC cs.CV 74%

Lotus: Creating Short Videos From Long Videos With Abstractive and Extractive Summarization

Aadit Barua, Karim Benharrak, Meng Chen, Mina Huh, Amy Pavel

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments 15 pages, 9 figures, ACM IUI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05847 2024-09-10 cs.CV 74%

LSVOS Challenge Report: Large-scale Complex and Long Video Object Segmentation

Henghui Ding, Lingyi Hong, Chang Liu, Ning Xu, Linjie Yang, Yuchen Fan, Deshui Miao, Yameng Gu, Xin Li, Zhenyu He, Yaowei Wang, Ming-Hsuan Yang, Jinming Chai, Qin Ma, Junpei Zhang, Licheng Jiao, Fang Liu, Xinyu Liu, Jing Zhang, Kexin Zhang, Xu Liu, LingLing Li, Hao Fang, Feiyu Pan, Xiankai Lu, Wei Zhang, Runmin Cong, Tuyen Tran, Bin Cao, Yisi Zhang, Hanyi Wang, Xingjian He, Jing Liu

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments ECCV 2024 LSVOS Challenge Report: https://lsvos.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16730 2024-08-30 cs.CV 74%

VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation

Shiwei Wu, Joya Chen, Kevin Qinghong Lin, Qimeng Wang, Yan Gao, Qianli Xu, Tong Xu, Yao Hu, Enhong Chen, Mike Zheng Shou

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14105 2024-06-25 cs.CV cs.AI 74%

Unified and Dynamic Graph for Temporal Character Grouping in Long Videos

Xiujun Shu, Wei Wen, Liangsheng Xu, Ruizhi Qiao, Taian Guo, Hanjun Li, Bei Gan, Xiao Wang, Xing Sun

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.10306 2019-07-16 cs.CV 74%

Spotting Micro-Expressions on Long Videos Sequences

Jingting Li, Catherine Soladie, Renaud Sguier, Sujing Wang, Moi Hoon Yap

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments 4 pages, 3 figures and 3 tables

Journal ref The 14th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.10765 2019-03-27 cs.CV 74%

Micro-expression detection in long videos using optical flow and recurrent neural networks

Michiel Verburg, Vlado Menkovski

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments 6 pages, 6 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10625 2023-10-17 cs.CV cs.AI cs.LG cs.RO 72%

Video Language Planning

Yilun Du, Mengjiao Yang, Pete Florence, Fei Xia, Ayzaan Wahid, Brian Ichter, Pierre Sermanet, Tianhe Yu, Pieter Abbeel, Joshua B. Tenenbaum, Leslie Kaelbling, Andy Zeng, Jonathan Tompson

专题命中 长视频与时序推理 :text-to-video(abstract);long video(abstract);分类 cs.CV;video-language(comments)

Comments https://video-language-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13141 2026-06-12 cs.AI 新提交 71%

Rethinking RAG in Long Videos: What to Retrieve and How to Use It?

重新思考长视频中的RAG:检索什么以及如何使用?

Yuho Lee, Jisu Shin, Nicole Hee-Yeon Kim, Jihwan Bang, Juntae Lee, Kyuwoong Hwang, Fatih Porikli, Hwanjun Song

机构 * Department of Computer Science, Cranberry-Lemon University(蔓越莓柠檬大学计算机科学系)

专题命中 长视频与时序推理 :long video(title)

AI总结 针对视频检索增强生成中检索粒度单一和基准测试缺陷,提出V-RAGBench基准和CARVE方法,通过分块自适应重排序实现多配置交错证据,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20290 2026-07-31 cs.GR cs.CV 版本更新 70%

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 长视频与时序推理 :video generation(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 70%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11312 2026-07-14 cs.CV 新提交 70%

SLVMBench: Skill Learning from Video Memory

SLVMBench:从视频记忆中学习技能

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10190 2026-07-14 cs.LG cs.AI cs.CV 新提交 70%

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

PhysMRV:用于物理合理性推理的物理内存检索与验证

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏