arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-08 至 2026-06-08 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2606.06853 2026-06-08 cs.CV cs.AI 新提交 83%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交 79%

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10578 2026-06-08 cs.CV 版本更新 79%

Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models

Rein3D: 基于全景视频扩散模型的强化3D室内场景生成

Dehui Wang, Rong Wei, Yue Shi, Congsheng Xu, Shoufa Chen, Dingxiang Luo, Tianshuo Yang, Xiaokang Yang, Wei Sui, Yusen Qin, Rui Tang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Manycore Tech Inc.(Manycore科技公司) D-Robotics The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Rein3D框架,结合3D高斯泼溅与视频扩散模型,通过“恢复-细化”范式从稀疏输入生成全局一致的360度室内场景,并构建PanoV2V-15K数据集,显著提升长距离相机探索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02919 2026-06-08 cs.CV 版本更新 57%

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

Pixel Cube: 基于扩散的肖像视频重光照通过真实感光照再现

Yufan Zhang, Yu Ji, Ayo Ajiboye, Rundi Wu, Yu Guo, Changxi Zheng, Jinwei Ye

机构 * George Mason University(乔治·马歇尔大学) LightThought LLC Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散的方法,利用混合训练数据集和HDR环境图控制,实现动态肖像视频的真实感重光照,保持时间一致性和身份特征。

Comments ACM SIGGRAPH 2026 Journal Track / ACM Transactions on Graphics, 17 pages. Project page: https://yufanzhang82.github.io/PixelCube/

Journal ref ACM Trans. Graph. 45, 4, Article 119 (July 2026), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏