arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-12 至 2026-05-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08279 2026-05-12 cs.LG cs.AI 50%

LaWM: Least Action World Models for Long-Horizon Physical Consistency from Visual Observations

LaWM:基于视觉观测的最短作用世界模型用于长时间物理一致性

Qixin Xiao, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 LaWM通过在视觉潜在空间中实现最小作用原理,提升长horizon视觉预测的物理一致性,改进了物理不变性、背景一致性、运动平滑度和外观几何预测指标。

详情

展开后加载摘要…

URL PDF HTML 收藏