arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-25 至 2026-03-25 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2511.03334 2026-03-25 cs.CV 79%

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 74%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23462 2026-03-25 cs.CV 70%

RealMaster: Lifting Rendered Scenes into Photorealistic Video

RealMaster: 将渲染场景提升为逼真视频

Dana Cohen-Bar, Ido Sobol, Raphael Bensadoun, Shelly Sheynin, Oran Gafni, Or Patashnik, Daniel Cohen-Or, Amit Zohar

机构 * Tel Aviv University(特拉维夫大学) Reality Labs, Meta(Meta现实实验室) Technion Israel(技术学院以色列)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 RealMaster通过视频扩散模型将渲染视频提升为逼真视频,保持与3D引擎输出的精确对齐,同时通过IC-LoRA训练实现高质量输出和泛化能力。

Comments Project page: https://danacohen95.github.io/RealMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22606 2026-03-25 cs.CV 70%

TrajLoom: Dense Future Trajectory Generation from Video

TrajLoom:从视频生成密集未来轨迹

Zewei Zhang, Jia Jun Cheng Xian, Kaiwen Liu, Ming Liang, Hang Chu, Jun Chen, Renjie Liao

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出TrajLoom框架,通过过去轨迹和视频上下文预测未来轨迹和可见性,采用Grid-Anchor Offset Encoding、TrajLoom-VAE和TrajLoom-Flow三种组件,扩展预测时间范围并提升轨迹真实性和稳定性。

Comments Project page, code, model checkpoints, and datasets: https://trajloom.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 50%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19709 2026-03-25 cs.RO 50%

Morphology-Consistent Humanoid Interaction through Robot-Centric Video Synthesis

通过机器人中心视频合成实现形态一致的人形交互

Weisheng Xu, Jian Li, Yi Gu, Bin Yang, Haodong Chen, Shuyi Lin, Mingqian Zhou, Jing Tan, Qiwei Wu, Xiangrui Jiang, Taowen Wang, Jiawen Wen, Qiwei Liang, Jiaxi Zhang, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Dream2Act框架,通过生成视频合成实现零样本人形机器人交互,避免传统retargeting的形态差距问题,提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏