arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-17 至 2026-03-17 共收录 46 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 9 篇

2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频问答 3 篇

2603.15008 2026-03-17 cs.CV 83%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视频问答 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06662 2026-03-17 cs.CV cs.LG 74%

HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding

HyperTokens: 通过控制令牌动态实现连续视频-语言理解

Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim

专题命中 视频问答 :video-language(title);分类 cs.CV

AI总结 本文提出HyperTokens,通过按需生成微调令牌,控制提示更新并保持内存固定,通过元启发式正则化抑制遗忘,提升连续视频问答任务的准确率与保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19554 2026-03-17 cs.CV 57%

Harvest Video Foundation Models via Efficient Post-Pretraining

通过高效后预训练收获视频基础模型

Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo

专题命中 视频问答 :video-language(abstract);分类 cs.CV

AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14073 2026-03-17 cs.CV cs.AI cs.LG 57%

MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation

MotionCFG: 通过随机概念扰动提升运动动态

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出MotionCFG框架,通过对比目标概念与其噪声扰动版本,提升文本到视频合成中的运动动态,同时减少语义偏移和对象完整性损害。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 4 篇

2603.15167 2026-03-17 cs.CV 83%

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 83%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 79%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 长视频与时序推理 :video understanding(title);video reasoning(abstract);分类 cs.CV

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12372 2026-03-17 cs.CV 57%

STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative

STAGE:基于故事板的电影多镜头叙事生成

Peixuan Zhang, Zijian Jia, Kaiqi Liu, Shuchen Weng, Si Li, Boxin Shi

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 STAGE提出基于故事板的生成方法,通过结构化故事板和多镜头记忆包提升叙事控制与跨镜头一致性,引入ConStoryBoard数据集进行实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 6 篇

2603.14426 2026-03-17 cs.CV cs.IR cs.MM 81%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 79%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 79%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19420 2026-03-17 cs.CV cs.LG 79%

CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models

CircuitProbe: 跟踪视频语言模型中的视觉时间证据流

Yiming Zhang, Zhuokai Zhao, Chengzhang Yu, Kun Wang, Zhendong Chu, Qiankun Li, Zihan Chen, Yang Liu, Zenghui Ding, Yining Sun, Qingsong Wen

专题命中 视频数据与评测 :video language model(title);video-language(abstract);分类 cs.CV

AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11782 2026-03-17 cs.CV 57%

MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator

MatAnyone 2:通过学习的质量评估器扩展视频磨边

Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 本文提出学习质量评估器MQE,用于无地面真实情况下评估alpha磨边的语义和边界质量,通过在线反馈和离线数据筛选构建大规模真实世界视频磨边数据集VMReal,实现高质量视频磨边。

Comments Accepted to CVPR 2026. Project page: https://pq-yang.github.io/projects/MatAnyone2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 57%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏