arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-03 至 2026-03-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 4 篇

2510.07940 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM 81%

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM:测试时优化与记忆化用于组合视频生成

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 长视频与时序推理 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。

Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02096 2026-03-03 cs.CV cs.AI 79%

FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

FluxMem: 用于流视频理解的自适应分层内存

Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 长视频与时序推理 :video understanding(title,abstract);分类 cs.CV

AI总结 FluxMem通过自适应分层内存压缩技术,在流视频理解中实现了高效处理,提升了实时性能和离线表现。

Comments Accepted at CVPR 2026. Project page: https://yiwengxie.com/FluxMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01804 2026-03-03 cs.CV cs.AI 57%

Non-verbal Real-time Human-AI Interaction in Constrained Robotic Environments

非语言实时人机交互在受限机器人环境中

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science Princeton University, Princeton NJ 08544, USA, , WWW home page: http://users/ iekeland/web/welcome.html Universit\' e de Paris-Sud, Laboratoire d'Analyse Num\' e rique, B\ a timent 425, F-91405 Orsay Cedex, France

专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出首个实时生成非语言人机交互的框架,通过对比合成与真实数据发现时间一致性对实际性能的影响,揭示了人类与AI运动间的统计差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03905 2026-03-03 cs.CV 57%

EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation

EchoMimicV3:13亿参数足矣实现统一的多模态和多任务人类动画

Rang Meng, Yan Wang, Weipeng Wu, Ruobing Zheng, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 EchoMimicV3通过统一多任务和多模态人类动画,以13亿参数实现高效且稳定的多任务和多模态动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏