arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-29 至 2026-04-29 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2604.25584 2026-04-29 cs.AI 71%

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

DualFact+: 一种用于过程视频理解的多模态事实验证框架

Cennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 视频理解 :video understanding(title)

AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV 70%

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23069 2026-04-29 cs.CV 57%

Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception

对齐后再适应:重新思考4D感知中的参数高效迁移学习

Yiding Sun, Jihua Zhu, Haozhe Cheng, Chaoyi Lu, Zhichuan Yang, Lin Chen, Yaonan Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室) School of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院) National Engineering Research Center for Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出PointATA方法,通过分阶段对齐和适应解决4D感知中的模态差距和过拟合问题,实现参数高效迁移学习,实验显示其在动作识别、分割等任务中表现优异。

Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2604.10103 2026-04-29 cs.CV 85%

Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation

通过混合注意力与解耦蒸馏实现长时域流式视频生成

Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出混合强制方法,通过混合注意力设计联合优化时序信息保留与计算效率,采用轻量线性时序注意力和块稀疏注意力,实现高效稳定流式视频生成,实测在单块H100 GPU上达到29.5 FPS的实时832x480视频生成

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 79%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV 79%

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25819 2026-04-29 cs.CV cs.SD 57%

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

相互推动:双模式自我进化用于快速自回归音频视频生成

Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang, Daquan Zhou, Yu Liu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机科学学院VCIP实验室) Tongyi Lab(通义实验室) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Mutual Forcing框架,通过双阶段训练策略解决音频视频联合建模与快速自回归生成问题,通过共享参数实现自蒸馏,提升训练推理一致性,相比传统方法更高效且质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 2 篇

2604.25361 2026-04-29 cs.CV 70%

HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation

HuM-Eval: 一种以人为中心的视频评估框架

Bingzi Zhang, Kaisi Guan, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出HuM-Eval框架,通过粗到细策略评估生成视频中的人体运动质量,实验显示其在人体相关性上达到58.2%的平均值,优于现有方法。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV 57%

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏