arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-04 至 2026-06-04 共收录 17 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2602.22779 2026-06-04 cs.CV 83%

TrajTok: Learning Trajectory Tokens enables better Video Understanding

TrajTok: 学习轨迹令牌以实现更好的视频理解

Chenhao Zheng, Jieyu Zhang, Jianing Zhang, Weikai Huang, Ashutosh Kumar, Quan Kong, Oncel Tuzel, Chun-Liang Li, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Apple(苹果公司) Woven by Toyota, Inc(丰田纺织公司)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出TrajTok,一种端到端视频令牌化模块,通过隐式时空聚类生成对象轨迹令牌,提升视频理解效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 78%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04596 2026-06-04 cs.CL 50%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 10 篇

2606.04527 2026-06-04 cs.MM cs.CV cs.GR 84%

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

Echo-Infinity: 学习演化记忆用于实时无限视频生成

Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Joy Future Academy, JD(京东探索研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。

Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04432 2026-06-04 cs.CV 83%

DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation

DSA: 用于快速自回归视频生成的动态步数分配

Thanh-Tung Le, Yunhan Zhao, Menglei Chai, Zhengyang Shen, Zhe Cao, Danhang Tang, Xiaohui Xie, Deying Kong

机构 * University of California, Irvine(加州大学尔湾分校) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种置信度引导的自适应计算框架DSA,通过轻量级置信度头动态调整每帧去噪步数,在保持视频质量的同时实现实时自回归视频生成。

Comments CVPR2026, Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04775 2026-06-04 cs.LG cs.AI cs.CV cs.SY eess.SY math.OC 79%

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control

通过降阶线性最优控制引导视频生成模型的激活

Jihoon Hong, Alice Chan, Qiyue Dai, Julian Skifstad, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 提出LA-LQR框架,将文本到视频推理建模为动态系统,通过降阶最优控制实现最小干预的激活引导,减少不安全内容生成同时保持视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04737 2026-06-04 cs.CV 79%

Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment

基于物理信息的视频生成:通过混合专家潜在对齐

Cong Wang, Hanxin Zhu, Jiayi Luo, Yonglin Tian, Xiaoqian Cheng, Peiyan Tu, Xin Jin, Long Chen, Zhibo Chen

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(浙江大学) USTC(中国科学技术大学) BUAA(北京航空航天大学) ZJU(浙江大学) EIT(欧洲工业技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PILA框架,通过混合专家潜在对齐将物理结构化潜在引导注入预训练视频模型的冻结流匹配动力学,以提升生成视频的物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03972 2026-06-04 cs.CV 79%

AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation

AAD-1:用于一步自回归视频生成的非对称对抗蒸馏

Haobo Li, Yanhong Zeng, Yunhong Lu, Jiapeng Zhu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yujun Shen, Zhipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出非对称对抗蒸馏框架AAD-1,通过打破生成器与判别器的对称性以及分阶段训练策略,解决一步自回归视频生成中的运动崩溃和训练不稳定问题,实现最先进性能。

Comments ICML 2026. Project page: \url{https://aad-1.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02697 2026-06-04 cs.CV cs.AI 79%

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

ShareVerse:面向共享世界建模的多智能体一致视频生成

Jiayi Zhu, Jianing Zhang, Yiying Yang, Wei Cheng, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University China(上海交通大学中国) Fudan University China(复旦大学中国) StepFun China(StepFun中国)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21094 2026-06-04 cs.CV 79%

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

T2AV-Compass:迈向文本到音频-视频生成的统一评估

Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出T2AV-Compass基准,通过分类学驱动的500个复杂提示和双层次评估框架(客观信号指标+主观MLLM评判),系统评估文本到音频-视频生成模型,发现现有模型在跨模态对齐和指令遵循方面显著不足。

Comments 41 pages, 13 figures, 12 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05162 2026-06-04 cs.CV 57%

Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text

基于3D轨迹和文本的可控动态3D形状生成

Jaeyeong Kim, Ines Kim, Jahyeok Koo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出T2Mo前馈框架,通过3D轨迹和文本条件生成可控动态3D形状,采用形状接地轨迹嵌入处理任意配置轨迹,实现空间精确跟随与全局语义一致。

Comments Project page: https://cvlab-kaist.github.io/T2Mo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19398 2026-06-04 cs.CV cs.AI 57%

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

重新平衡参考帧主导性以改善图像到视频模型中的运动

Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

机构 * Yonsei University(延世大学) GIST(韩国科学技术院) Adobe Research(Adobe研究)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 针对图像到视频模型生成视频过于静态的问题,提出无需训练且模型无关的DyMoS方法,通过重新平衡去噪初期生成帧对参考帧的注意力来增强运动,同时保持视觉质量和保真度。

Comments Preprint. Project page: https://sh0xed98b8.github.io/DyMoS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05160 2026-06-04 cs.RO 50%

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

GRAIL: 从3D资产和视频先验生成人形机器人全身操作

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

机构 * NVIDIA UCLA(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。

Comments Project page: https://research.nvidia.com/labs/dair/grail/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 3 篇

2606.03943 2026-06-04 cs.RO cs.CV cs.LG 70%

PointAction: 3D Points as Universal Action Representations for Robot Control

PointAction: 3D点作为机器人控制的通用动作表示

Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出PointAction框架,通过微调视频生成模型联合预测未来RGB帧和动态3D点图,将点动力学作为与具体本体无关的动作接口,再由扩散动作解码器映射为可执行动作,以减少RGB动作歧义并跨任务/本体迁移。

Comments Project page: https://oriontmt.github.io/pointaction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03402 2026-06-04 cs.CV 57%

Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation

Mamba增强的隐式运动学习用于音频驱动肖像动画

Xuan Wei, Jiahui Chen, Kaiheng Li, Mingyu Shao, Qingqi Hong

机构 * Fujian Provincial Natural Science Foundation of China(福建省自然科学基金委员会) Giant Interactive Group Inc.(巨匠互动集团有限公司) National Natural Science Foundation of China(国家自然科学基金委员会)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出一种两阶段隐式运动框架,结合区域感知注意力机制和Mamba增强扩散模型,从单张静态图像和音频生成逼真且时间一致的人体运动视频,在多个基准上达到最先进性能。

Comments accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04130 2026-06-04 cs.RO 50%

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization

CLAW: 通过对抗潜在正则化学习连续潜在动作世界模型

Tewodros Ayalew, Matthew Jeung, Samuel Wheeler, Xiao Zhang, Andre de la Cruz Arce, Kaylene Stocking, Michael Maire, Matthew R. Walter

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 提出CLAW框架,利用对抗潜在正则化和扩散视频生成,从无动作视频中端到端学习世界模型与连续潜在动作表示,支持观察模仿学习和目标导向规划。

Comments 8 pages, 15 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2606.05008 2026-06-04 cs.CV cs.AI cs.CL 57%

M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

M$^3$Eval: 通过认知基础视频任务的多模态记忆评估

Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 提出首个多模态模型记忆评估框架M$^3$Eval,通过认知心理学设计的视频任务系统评估模型在记忆保持、忠实性和鲁棒性上的表现,发现模型在并行视频流处理、干扰模式、时空记忆和符号记忆方面的显著缺陷。

Comments We present an evaluation designed for multi-modal memory in multi-modal models

详情

展开后加载摘要…

URL PDF HTML 收藏