arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-17 至 2026-03-17 共收录 46 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 10 篇

2603.14659 2026-03-17 cs.CV cs.AI 83%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Project website: https://visioncoach.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 83%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 79%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 79%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18802 2026-03-17 cs.CV 74%

Surgical Video Understanding with Label Interpolation

手术视频理解与标签插值

Garam Kim, Tae Kyeong Jeong, Juyoun Park

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出结合光流分割标签插值与多任务学习的框架,解决手术视频中时间空间不平衡问题,提升手术场景理解的准确性和效率。

Comments Accepted to ICRA 2026. Video: https://youtu.be/24LlhqvgFBU | Dataset: https://huggingface.co/datasets/KIST-HARILAB/MISAW-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 57%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 57%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 57%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 12 篇

2603.13739 2026-03-17 cs.CV cs.AI cs.MM 84%

UniVid: Pyramid Diffusion Model for High Quality Video Generation

UniVid:金字塔扩散模型用于高质量视频生成

Xinyu Xiao, Binbin Yang, Tingtian Li, Yipeng Yu, Sen Lei

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20629 2026-03-17 cs.CV cs.LG 83%

Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning

统一的文本-图像到视频生成:一种无训练的灵活视觉条件方法

Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出无训练的FlexTI2V方法,通过局部图像块交换策略实现灵活的视觉条件,平衡创造力与保真度,验证其在文本-视频生成中的有效性。

Comments 27 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 83%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 81%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08801 2026-03-17 cs.CV cs.AI cs.MM 81%

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成

Hangjie Yuan, Weihua Chen, Jun Cen, Hu Yu, Jingyun Liang, Shuning Chang, Zhihui Lin, Tao Feng, Pengwei Liu, Jiazheng Xing, Hao Luo, Jiasheng Tang, Fan Wang, Yi Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14938 2026-03-17 cs.CV 79%

FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving

FAR-Drive:闭环自动驾驶中的帧自回归视频生成

Yaoru Li, Federico Landi, Marco Godi, Xin Jin, Ruiju Fu, Yufei Ma, Muyang Sun, Heyu Si, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出FAR-Drive,一种用于自动驾驶的帧级自回归视频生成框架,通过多视角扩散变换器实现几何一致的多摄像机生成,解决闭环模拟中的长时程一致性、自回归退化和低延迟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 79%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG 70%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15583 2026-03-17 cs.CV 57%

Grounding World Simulation Models in a Real-World Metropolis

将世界模拟模型扎根于现实世界中的城市

Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin, Gayoung Lee, Junho Kim, JoungBin Lee, Geonmo Gu, Dongyoon Han, Sangdoo Yun, Seungryong Kim, Jin-Hwa Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(成均馆大学人工智能研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。

Comments project page: https://seoul-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 57%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13615 2026-03-17 cs.CV cs.RO 57%

Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis

第一人称世界模型用于逼真手-物体交互合成

Dayou Li, Lulin Liu, Bangya Liu, Shijie Zhou, Jiu Feng, Ziqi Lu, Minghui Zheng, Chenyu You, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(得克萨斯大学奥斯汀分校) Amazon(亚马逊) State University of New York at Stony Brook(纽约州立大学石溪分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出EgoHOI模型,通过动作信号模拟物理一致的交互,克服了高速头部运动、严重遮挡和高自由度手部运动带来的挑战,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22407 2026-03-17 cs.AI cs.RO 50%

EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer

EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化

Zhehao Dong, Xiaofeng Wang, Zheng Zhu, Yirui Wang, Yang Wang, Yukun Zhou, Boyuan Wang, Chaojun Ni, Runqi Ouyang, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhen Lu, Yue Yang

专题命中 视频生成 :video generation(abstract)

AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 9 篇

2603.13405 2026-03-17 cs.CV eess.IV 86%

Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion

锚点强制:用于交互式流视频扩散的锚点记忆与三区域RoPE

Yang Yang, Tianyi Zhang, Wei Huang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo BlueImage Lab(vivo蓝影实验室) University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 本文提出锚点强制框架,通过锚点引导重置缓存和三区域RoPE解决交互式流视频生成中的质量退化和运动动态减弱问题,提升感知质量和运动指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV 83%

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14241 2026-03-17 cs.CV 83%

CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control

CamLit:统一的视频扩散模型,具有显式相机和光照控制

Zhiyi Kuang, Chengan He, Egor Zakharov, Yuxuan Xue, Shunsuke Saito, Olivier Maury, Timur Bagautdinov, Youyi Zheng, Giljoo Nam

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04446 2026-03-17 cs.CV 83%

DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models

DiCoDe:扩散压缩深度标记用于语言模型的自回归视频生成

Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Ping Luo

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 DiCoDe利用扩散压缩深度标记,通过自回归语言模型生成视频,实现高效压缩与高质量输出,展示了在视频建模中的潜力。

Comments Project Page: https://liyz15.github.io/DiCoDe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14320 2026-03-17 cs.CV 79%

Early Failure Detection and Intervention in Video Diffusion Models

视频扩散模型中的早期故障检测与干预

Kwon Byung-Ki, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种用于视频扩散模型的早期故障检测与干预方法,通过实时检查模块在生成过程中快速检测故障并提前干预,减少计算开销,提升生成质量。

Comments 29 pages, 24 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13967 2026-03-17 eess.IV cs.AI cs.CV 76%

EchoLVFM: One-Step Video Generation via Latent Flow Matching for Echocardiogram Synthesis

EchoLVFM: 通过潜在流匹配实现单步视频生成用于超声心动图合成

Emmanuel Oladokun, Sarina Thomas, Jurica Šprem, Vicente Grau

专题命中 视频扩散模型 :video generation(title);分类 cs.CV、eess.IV

AI总结 本文提出EchoLVFM框架,通过潜在空间单步生成可控的超声心动图视频,提升效率并保持视觉质量,实验证明其在单帧条件下的视频质量与专家判断准确率。

Comments Submitted to MICCAI 2026; Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15415 2026-03-17 cs.CV 57%

AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation

AnyCrowd:实例隔离的身份-姿态绑定用于任意多角色动画

Zhenyu Xie, Ji Xia, Michael Kampffmeyer, Panwen Hu, Zehua Ma, Yujian Zheng, Jing Wang, Zheng Chong, Xujie Zhang, Xianhang Cheng, Xiaodan Liang, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) University of Tromsø (UiT) – The Arctic University of Norway, Norway(特罗姆瑟大学(UiT)——挪威北极大学,挪威) Shenzhen campus of Sun Yet-sen University, China(孙中山大学深圳校区,中国)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnyCrowd框架,通过实例隔离潜在表示和三阶段解耦注意力机制,解决多角色动画中身份与姿态绑定不一致的问题,提升生成视频的可控性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏