arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6737 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2603.25841 2026-03-30 cs.CV cs.AI 79%

GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding

GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解

Trong Thang Pham, Hien Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) University of Houston(休斯顿大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV 79%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG 79%

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21647 2026-03-24 cs.CV cs.LG 79%

FedCVU: Federated Learning for Cross-View Video Understanding

FedCVU: 联邦学习用于跨视图视频理解

Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang

机构 * Software College, Northeastern University, Shenyang, China(东北大学软件学院) University of Science and Technology of China, Hefei, China(中国科学技术大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 FedCVU通过VS-Norm、CV-Align和SLA解决联邦学习在跨视图视频理解中的异质视角、分布偏差和通信开销问题,提升未见视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 79%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 视频理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 79%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21782 2026-03-20 cs.CV 79%

Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding

Mobile-VideoGPT:用于移动视频理解的高效模型

Abdelrahman Shaker, Muhammad Maaz, Chenhui Gou, Hamid Rezatofighi, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Monash University(莫纳什大学) Linköping University(利尔贝里大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出Mobile-VideoGPT,一种轻量级多模态框架,通过高效编码器、投影器和小语言模型实现快速推理,提升移动视频理解效率。

Comments Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17374 2026-03-19 cs.CV 79%

Shot-Aware Frame Sampling for Video Understanding

面向快门的视频帧采样

Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

机构 * ByteDance(字节跳动) Rutgers University(罗格斯大学) Georgia Tech(佐治亚理工学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出InfoShot,一种任务无关的快门感知帧采样方法,用于长视频理解。通过分割视频为语义一致的快门,并选择两种互补的关键帧,以保留视频结构和短时变化信息,提升视频理解和异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 79%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI 79%

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 79%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 79%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12254 2026-03-13 cs.CV 79%

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 79%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09496 2026-03-11 cs.CV 79%

SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding

SurgFed: 基于语言引导的多任务联邦学习用于手术视频理解

Zheng Fang, Ziwei Niu, Ziyue Wang, Zhu Zhuo, Haofeng Liu, Shuyang Qian, Jun Xia, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 SurgFed通过语言引导的通道选择和超聚合方法,提升手术视频多任务联邦学习的跨站点和跨任务适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA 79%

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00983 2026-03-03 cs.CV 79%

Event-Anchored Frame Selection for Effective Long-Video Understanding

基于事件的帧选择用于有效长视频理解

Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01649 2026-03-03 cs.CV cs.AI 79%

Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning

面向贡献的视频理解强化学习token压缩

Yinchao Ma, Qiang Zhou, Zhibin Wang, Xianing Chen, Hanqing Yang, Jun Song, Bo Zheng

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CaCoVID通过强化学习优化token选择策略,以提高视频理解任务的效率。

Comments This paper is accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23709 2026-03-02 cs.CV 79%

EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding

EgoGraph:用于第一人称视频理解的时序知识图谱

Shitong Sun, Ke Han, Yukai Huang, Weitong Cai, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) University of Trento(特伦托大学) University of Surrey(萨里大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 EgoGraph通过构建动态知识图谱,有效解决超长第一人称视频的时序建模问题,实现更丰富的语义表示和复杂的时序推理。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-03-02 cs.CV 79%

LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, SP Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22932 2026-02-27 cs.CV 79%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16412 2026-02-24 cs.CV 79%

ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

ReMoRa:基于精细运动表示的多模态大语言模型用于长视频理解

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura

机构 * Keio University(庆应大学) NII(日本信息处理学会) NII LLMC(日本信息处理学会语言模型中心)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 ReMoRa通过精细运动表示实现长视频理解,有效压缩视频数据并提升多模态大语言模型性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18019 2026-02-23 cs.CV cs.AI 79%

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

DeepSVU: 向深入的安全导向视频理解迈进:通过统一的物理世界正则化MoE

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出DeepSVU任务,通过统一物理世界正则化MoE方法,提升视频中威胁的识别、归因和评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17869 2026-02-23 cs.CV 79%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15329 2026-02-18 cs.CV 79%

EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use

EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用

Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Paradigm Inc.(4Paradigm公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 EventMemAgent通过分层事件中心记忆和自适应工具使用,解决在线视频理解中长程推理与细粒度细节的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06619 2026-02-09 cs.CV 79%

CauCLIP: Bridging the Sim-to-Real Gap in Surgical Video Understanding via Causality-Inspired Vision-Language Modeling

CauCLIP:通过因果启发的视觉-语言模型弥合手术视频理解的仿真到现实差距

Yuxin He, An Li, Cheng Xue

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CauCLIP通过因果启发的视觉-语言模型,在不访问目标领域数据的情况下,提升手术视频理解的领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV 79%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03369 2026-01-22 cs.CV cs.CL 79%

RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models

RiskCueBench: 视频语言模型中早期风险信号的前瞻性推理基准测试

Sha Luo, Yogesh Prabhu, Timothy Ossowski, Kaiping Chen, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 RiskCueBench通过标注早期风险信号片段,评估视频语言模型在预测未来风险事件中的能力,揭示了现有系统在解读动态情境方面的不足。

Comments *updated author email in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 79%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06843 2026-01-13 cs.CV cs.CL 79%

Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models

边看边说:解锁多模态大语言模型的实时视频理解能力

Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shanghai Jiao Tong University(上海交通大学) Ocean University of China(中国海洋大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏