arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-03 至 2026-06-03 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 3 篇

2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS 81%

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18639 2026-06-03 cs.CV 79%

OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance

OrthoPhys:基于正交视角几何引导的物理合理视频生成

Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Zhibo Chen

机构 * the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(SKLCCSE,北京航空航天大学计算机科学与工程学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出两阶段框架 OrthoPhys,通过正交视角几何引导生成物理一致的前景运动,再合成完整视频,显著提升物理真实感和时空一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 50%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 视频生成 :video generation(abstract)

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏