arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-02 至 2026-03-02 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.23709 2026-03-02 cs.CV 79%

EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding

EgoGraph:用于第一人称视频理解的时序知识图谱

Shitong Sun, Ke Han, Yukai Huang, Weitong Cai, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) University of Trento(特伦托大学) University of Surrey(萨里大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 EgoGraph通过构建动态知识图谱,有效解决超长第一人称视频的时序建模问题,实现更丰富的语义表示和复杂的时序推理。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-03-02 cs.CV 79%

LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, SP Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2602.22745 2026-03-02 cs.CV 79%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2602.24208 2026-03-02 cs.CV cs.LG 57%

SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching

SenCache: 通过敏感性感知缓存加速扩散模型推理

Yasaman Haghighi, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 SenCache通过敏感性感知缓存策略,提升扩散模型推理效率与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24148 2026-03-02 cs.CV 57%

HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation

HumanOrbit:3D人体重建作为360°轨道生成

Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen

机构 * University of California, San Diego(加州大学圣地亚哥分校) Qualcomm(高通公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 HumanOrbit通过视频扩散模型实现多视角人体生成,生成360°轨道视频并重建高保真3D模型。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2602.24275 2026-03-02 cs.CV 57%

Hierarchical Action Learning for Weakly-Supervised Action Segmentation

分层动作学习用于弱监督动作分割

Junxian Huang, Ruichu Cai, Hao Zhu, Juntao Fang, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao

机构 * Guangdong University of Technology(广东技术大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Hong Kong(香港大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 HAL模型通过分层因果数据生成和稀疏转换约束,提升弱监督动作分割的识别能力。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 3 篇

2602.24289 2026-03-02 cs.CV cs.LG 88%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: https://primecai.github.io/mmm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00805 2026-03-02 cs.CV 88%

Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

通过草稿思考:用于高效长视频理解的推测性时间推理

Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 SpecTemp通过协作双模型设计,实现高效长视频理解,平衡效率与准确性,提升推理速度。

Comments Accepted by CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10553 2026-03-02 cs.CV 57%

Inference-time Physics Alignment of Video Generative Models with Latent World Models

视频生成模型的推理时间物理对齐:基于潜在世界模型

Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Han, Nicolas Ballas, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR, Meta Superintelligence Labs University of Oxford Mila - Qu\' e bec AI Institute Columbia University McGill University Canada CIFAR AI Chair

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出WMReward方法,通过潜在世界模型提升视频生成的物理合理性,实验表明在多个生成设置中显著提高物理合理性,并在ICCV 2025挑战中取得第一名。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2602.23969 2026-03-02 cs.MM cs.CV 81%

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

MSVBench: 向多镜头视频生成的人机水平评估迈进

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11340 2026-03-02 cs.CV 57%

GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection

GenVidBench:一个600万的AI生成视频检测基准数据集

Zhenliang Ni, Qiangyu Yan, Mouxiao Huang, Tianning Yuan, Yehui Tang, Hailin Hu, Xinghao Chen, Yunhe Wang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 GenVidBench是一个包含600万视频的AI生成视频检测基准数据集,通过大规模、跨源和跨生成器的视频收集,提升AI生成视频检测模型的泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏