arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-17 至 2026-03-17 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14073 2026-03-17 cs.CV cs.AI cs.LG 57%

MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation

MotionCFG: 通过随机概念扰动提升运动动态

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出MotionCFG框架,通过对比目标概念与其噪声扰动版本,提升文本到视频合成中的运动动态,同时减少语义偏移和对象完整性损害。

详情

展开后加载摘要…

URL PDF HTML 收藏