arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-19 至 2026-03-19 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 4 篇

2603.17998 2026-03-19 cs.CV 57%

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

文本嵌入插值在连续图像操控中的不合理有效性

Yigit Ekin, Yossi Gandelsman

机构 * Reve

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。

Comments Project Page: https://yigitekin.github.io/diffusion-sliders

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16711 2026-03-19 cs.CV 57%

Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search

Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制

Sainan Liu, Tz-Ying Wu, Hector A Valdez, Subarna Tripathi

机构 * Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25857 2026-03-19 cs.GR cs.AI cs.CV 57%

Vector sketch animation generation with differentiable motion trajectories

基于可微运动轨迹的向量草图动画生成

Xinding Zhu, Xinye Yang, Shuyang Zheng, Zhexin Zhang, Fei Gao, Jing Huang, Jiazhou Chen

机构 * Zhejiang University of Technology(浙江工业大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出一种端到端的向量草图动画生成方法,通过可微运动轨迹解决闪烁问题,提升语义一致性和时间连续性,实现在DAVIS和LVOS数据集上的优越性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏