arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-30 至 2026-03-30 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2603.26365 2026-03-30 cs.CV 79%

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 79%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25841 2026-03-30 cs.CV cs.AI 79%

GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding

GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解

Trong Thang Pham, Hien Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) University of Houston(休斯顿大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26639 2026-03-30 cs.CV cs.AI 57%

Make Geometry Matter for Spatial Reasoning

让几何在空间推理中发挥作用

Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GeoSR框架,通过几何解封掩码和几何引导融合,提升视觉语言模型的空间推理能力,实验证明其在静态和动态场景中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26336 2026-03-30 cs.CV 57%

From Pixels to Privacy: Temporally Consistent Video Anonymization via Token Pruning for Privacy Preserving Action Recognition

从像素到隐私:通过令牌修剪实现时间一致的视频匿名化以保护隐私的行动识别

Nazia Aslam, Abhisek Ray, Joakim Bruslund Haurum, Lukas Esterle, Kamal Nasrollahi

机构 * Aalborg University(奥尔堡大学) Aarhus University(奥胡斯大学) Poineer Centre for AI(先锋人工智能中心) University of Southern Denmark(南丹麦大学) Milestone System(Milestone系统公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出一种基于注意力机制的时空视频匿名化框架,通过分离效用和隐私特征,实现对隐私保护的行动识别。

Comments 10 pages, CVPR paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2507.03745 2026-03-30 cs.CV cs.AI cs.LG eess.IV 88%

StreamDiT: Real-Time Streaming Text-to-Video Generation

StreamDiT:实时流式文本到视频生成

Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, Yue Zhao

机构 * UC Berkeley(加州大学伯克利分校) Meta

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26610 2026-03-30 cs.CV cs.AI 79%

Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling

轨迹思考:利用视频生成从蜂窝信号中重建GPS轨迹

Ruixing Zhang, Hanzhang Jiang, Leilei Sun, Liangzhe Han, Jibin Wang, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂与关键软件环境国家重点实验室) H3I, Beihang University(北京航空航天大学H3I) China Mobile Information Technology Center(中国移动信息技术中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Sig2GPS方法,通过视频生成技术从蜂窝信号中重建高精度GPS轨迹,利用地图视觉域直接生成连续路径,提升轨迹数据挖掘的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25931 2026-03-30 cs.CV cs.AI 74%

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

DiReCT:对比轨迹解耦的对比正则化用于物理精细视频生成

Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim

机构 * Path Robotics The Ohio State University(俄亥俄州立大学) University of Central Florida(中佛罗里达大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出DiReCT方法,通过解耦对比轨迹正则化提升物理精细视频生成的物理合理性,改进VideoPhy的物理常识评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08277 2026-03-30 cs.CV cs.AI 70%

PISCO: Precise Video Instance Insertion with Sparse Control

PISCO:具有稀疏控制的精确视频实例插入

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu

机构 * Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PISCO模型,通过稀疏关键帧控制实现精确视频实例插入,解决传统视频编辑中对空间时间定位、物理一致性及动态保持的挑战,采用变量信息引导和分布保持时间遮罩技术提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19623 2026-03-30 cs.CV cs.AI cs.HC 57%

PedaCo-Gen: Scaffolding Pedagogical Agency in Human-AI Collaborative Video Authoring

PedaCo-Gen:在人机协作视频制作中构建教学代理

Injun Baek, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 PedaCo-Gen通过引入中间表示阶段,使教育者能与AI审查员互动审查和优化视频蓝图,提升视频质量与教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 57%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2603.25892 2026-03-30 cs.CV 70%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG 88%

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26193 2026-03-30 cs.CV cs.AI 83%

MemCam: Memory-Augmented Camera Control for Consistent Video Generation

MemCam:用于一致视频生成的记忆增强摄像机控制

Xinhang Gao, Junlin Guan, Shuhan Luo, Wenzhuo Li, Guanghuan Tan, Jiacheng Wang

机构 * Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 MemCam通过利用先前生成帧作为外部记忆,提升动态摄像机控制下的视频生成一致性,实验表明其在长视频场景中表现优异。

Comments 6 pages, 3 figures, 3 tables, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2603.26653 2026-03-30 cs.CV cs.AI cs.CL cs.LG 57%

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

PerceptionComp:一个复杂感知导向推理的视频基准测试

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Ziwei Liu, Ranjay Krishna

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。

Comments Project Page: https://perceptioncomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 57%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏