arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-17 至 2026-06-17 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2606.17798 2026-06-17 cs.CV cs.AI 新提交 83%

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu

机构 * IEEE

专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17800 2026-06-17 cs.CV 新提交 57%

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

MaineCoon: 追求实时音视频社交世界模型

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

机构 * Catnip AI Team(Catnip AI团队)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。

Comments 32 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17590 2026-06-17 cs.CV 新提交 57%

TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

TivTok:广播时间不变令牌以实现可扩展视频分词

Weiliang Chen, Yuanhui Huang, Xuebo Wang, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Automation, Tsinghua University(清华大学自动化系) Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出TivTok,一种可重用感知的视频分词器,通过时间不变(TIV)和时间变化(TV)令牌分解视频,实现高效压缩和长视频建模,在标准基准上rFVD达12.65,压缩效率提升2.91倍。

详情

展开后加载摘要…

URL PDF HTML 收藏