arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1369 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2605.18041 2026-05-19 cs.CV 70%

OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models

OmniSelect: 动态模态感知的令牌压缩用于高效多模态大语言模型

Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出OmniSelect,一种无需训练的模态自适应令牌剪枝框架,通过动态选择压缩策略来提高多模态大语言模型的效率,通过轻量级AudioCLIP模型估计跨模态相关性,并根据相关性得分在不同时间组中进行细粒度令牌剪枝,从而在不增加训练成本的情况下实现高效的多模态令牌压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13228 2026-05-14 cs.CV cs.AI 70%

ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding

ReTool-Video:具有元增强工具定位的递归工具使用视频代理

Xiao Liu, Nayu Liu, Junnan Zhu, Ruirui Chen, Guohui Xiang, Changjian Wang, Kaiwen Wei, Rongzhen Li, Jiang Zhong

机构 * Chongqing University(重庆大学) Tianjin University(天津大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所) Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出ReTool-Video,通过构建元增强视频工具库和递归工具使用方法,提升视频理解的稳定性和效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI 70%

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23617 2026-05-12 cs.CV cs.AI cs.GR cs.LG 70%

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory

一条轨迹,一个标记:通过全景子对象轨迹实现的 grounded 视频标记化

Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能艾伦研究所) Woven by Toyota, Inc(丰田公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出 grounded 视频标记化方法,通过全景子对象轨迹组织标记,减少冗余并保持时间一致性,TrajViT 在多个视频理解基准上优于空间-时间 ViT,具有更高的效率和性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 70%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV 70%

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 70%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 视频理解 :video understanding(abstract,abstract_cn);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV 70%

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20473 2026-04-23 cs.CV 70%

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15724 2026-04-21 cs.CV cs.AI 70%

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker:构建具有LLM引导工具推理的智能视频大语言模型

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 VideoThinker通过合成工具交互轨迹构建大规模视频与工具推理数据集,提升长视频理解能力,优于传统语言模型和视频模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 70%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20739 2026-02-25 cs.AI cs.CV 70%

PyVision-RL: Forging Open Agentic Vision Models via RL

通过强化学习构建开放代理视觉模型:PyVision-RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

机构 * Shanghai AI Lab(上海人工智能实验室) Rice University(里士满大学) Shanda AI Research, Tokyo(上海沙达人工智能研究东京)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 PyVision-RL通过强化学习框架解决多模态代理的交互崩溃问题,结合回放策略和累积奖励提升多轮推理能力,实现高效视频理解与处理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI 70%

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08861 2026-02-10 cs.CV 70%

TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models

TiFRe: 基于文本的视频帧减少用于高效视频多模态大语言模型

Xiangtian Zheng, Zishuo Wang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 TiFRe通过文本引导的帧采样和帧匹配机制,有效减少视频输入帧数,同时保留关键信息,提升视频多模态大语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08024 2026-02-10 cs.CV cs.AI cs.CL cs.LG 70%

FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

FlashVID: 通过无训练树状时空标记合并实现高效的视频大语言模型

Ziyang Fan, Keyu Chen, Ruilong Xing, Yulin Li, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 FlashVID通过无训练的树状时空标记合并技术,在保留99.1%性能的情况下将视频帧输入提升10倍,实现高效视频大语言模型加速。

Comments Accepted by ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07689 2026-02-10 cs.CV cs.AI 70%

Process-of-Thought Reasoning for Videos

视频过程推理

Jusheng Zhang, Kaitong Cai, Jian Wang, Yongsen Zheng, Kwok-Yan Lam, Keze Wang

机构 * Sun Yat-sen University, China(中山大学) Nanyang Technological University, Singapore(南洋理工大学) Snap Inc.(Snap公司)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 视频过程推理框架通过结构化推理步骤提升视频理解的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03615 2026-02-04 cs.CV 70%

KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

KTV: 关键帧与关键令牌选择用于高效无训练视频大语言模型

Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 KTV通过两阶段框架高效选择关键帧和令牌,提升无训练视频理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 70%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 70%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 70%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG 70%

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02014 2025-12-02 cs.CV 70%

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA: 降低统一视觉表示以适应原生统一多模态模型

Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong

机构 * Meta BizAI University of Waterloo(滑铁卢大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 TUNA通过统一视觉表示提升多模态模型的性能,实现端到端理解和生成任务的高效处理。

Comments Project page: https://tuna-ai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV 70%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV 70%

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视频理解 :video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08818 2025-10-13 cs.CV cs.AI 70%

D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition

Yiyang Huang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments This paper has been accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20444 2025-10-09 cs.LG cs.CV 70%

HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models

Haoran Li, Yingjie Qin, Baoyuan Ou, Lai Xu, Ruiwen Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Xiaohongshu Inc.(小红书公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24109 2025-09-30 cs.CV 70%

SVAC: Scaling Is All You Need For Referring Video Object Segmentation

Li Zhang, Haoxiang Gao, Zhihao Zhang, Luoxiao Huang, Tao Zhang

机构 * Columbia University New York, USA(哥伦比亚大学) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学) New York University New York, USA(纽约大学) Wuhan University Wuhan, China(武汉大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments This paper is accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07680 2025-09-10 cs.CV cs.LG 70%

CAViAR: Critic-Augmented Video Agentic Reasoning

Sachit Menon, Ahmet Iscen, Arsha Nagrani, Tobias Weyand, Carl Vondrick, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00969 2025-09-10 cs.CV 70%

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors

Xiangchen Wang, Jinrui Zhang, Teng Wang, Haigang Zhang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 17 pages, 8 figures, EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09919 2025-08-12 cs.CV cs.AI 70%

B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens

Zhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang, Zicheng Liu, Zhiyong Wang, Kun Hu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院) Advanced Micro Devices(先进微器件公司) School of Science, Edith Cowan University(埃迪斯科文大学科学学院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ICCV2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏