arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-05 至 2026-08-05 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2608.03974 2026-08-05 cs.CV 新提交 57%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 57%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17257 2026-08-05 cs.CV 版本更新 57%

Modeling Long-Term Memory and Temporal Attention Shifts for Video Salient Object Ranking with a New Benchmark

用于视频显著对象排序的长期记忆与时间注意力转移建模及新基准

Jiaying Lin, Rui Song, Huankang Guan, Shuanglin Li, Shuquan Ye, Rynson W. H. Lau

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 该研究针对视频显著对象排序(VSOR)缺乏长期时间建模的问题,提出LoTAS长期记忆框架及含124个视频的新数据集,通过TCD、RSSE及排序转移监督提升性能,效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏