arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 11 篇

2603.21493 2026-03-24 cs.CV cs.MM 81%

StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding

StreamingEval: 一种面向真实流媒体视频理解的统一评估协议

Guowei Tang, Tianwen Qian, Huanran Zheng, Yifei Wang, Xiaoling Wang

机构 * East China Normal University(华东师范大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出StreamingEval评估框架,用于评估视频大语言模型在真实资源约束下的流媒体视频理解能力,通过标准化协议测试效率、存储与准确性的平衡,揭示当前模型与实际应用需求的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21647 2026-03-24 cs.CV cs.LG 79%

FedCVU: Federated Learning for Cross-View Video Understanding

FedCVU: 联邦学习用于跨视图视频理解

Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang

机构 * Software College, Northeastern University, Shenyang, China(东北大学软件学院) University of Science and Technology of China, Hefei, China(中国科学技术大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 FedCVU通过VS-Norm、CV-Align和SLA解决联邦学习在跨视图视频理解中的异质视角、分布偏差和通信开销问题,提升未见视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 79%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 视频理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 79%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV 57%

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13406 2026-03-24 cs.CV cs.AI 57%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02845 2026-03-24 cs.CV 57%

Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments

超越地球:理解微重力环境中的人类行为与场景

Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国) Hunan University, China(湖南大学,中国) INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚) Waseda University, Japan(早稻田大学,日本) KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典) RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MicroG-4M数据集,用于微重力环境下的人类行为和场景理解,包含50种动作、1238个丰富描述和7000多个问答对,支持动作识别、视频captioning和视觉问答任务。

Comments 16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 57%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 57%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16975 2026-03-24 cs.CV cs.AI 57%

InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression

InfoTok: 通过信息论压缩实现自适应离散视频分块器

Haotian Ye, Qiyuan He, Jiaqi Han, Puheng Li, Jiaojiao Fan, Zekun Hao, Fitsum Reda, Yogesh Balaji, Huayu Chen, Sheng Liu, Angela Yao, James Zou, Stefano Ermon, Haoxiang Wang, Ming-Yu Liu

机构 * NVIDIA Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出InfoTok框架,通过信息论压缩实现视频分块的自适应优化,实验证明在不损失性能的情况下,压缩率提升2.3倍,节省20%的token。

详情

展开后加载摘要…

URL PDF HTML 收藏