arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-18 至 2026-06-18 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2606.15632 2026-06-18 cs.CV 新提交 57%

Open-World Video Segmentation

开放世界视频分割

Qing Su, Kaiyang Li, Yuan Zhuang, Fei Miao, Shihao Ji

机构 * University of Connecticut(康涅狄格大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出Savvy系统,结合分层掩码发现、延迟接纳和轨迹整合,实现零样本开放世界长时视频分割;并设计粒度感知评估套件OGA,采用n:1匹配协议,解决传统1:1匹配对开放世界方法的不公平惩罚问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15824 2026-06-18 cs.CV 版本更新 57%

FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization

FashionChameleon:迈向实时和交互式的人体服装视频定制

Quanjian Song, Yefeng Shen, Mengting Chen, Hao Sun, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Liujuan Cao

机构 * Xiamen University(厦门大学) Alibaba Group(阿里巴巴集团)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出FashionChameleon框架,通过单件服装视频数据实现交互式多服装视频定制,保留动作一致性,实现实时生成23.8FPS,比现有方法快30-180倍。

Comments Project Page: https://quanjiansong.github.io/projects/FashionChameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏