arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-02 至 2026-07-02 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2607.00983 2026-07-02 cs.CV 新提交 88%

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding

QCA:面向长视频理解的查询与内容感知关键帧选择

Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出QCA框架,通过联合建模查询相关性和内容偏差动态分配关键帧预算,无需额外训练即可集成到Video-LLMs,在长视频理解基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00446 2026-07-02 cs.CV cs.AI 新提交 70%

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出VideoSearch-R1框架,通过软查询细化(SQR)在连续潜空间优化搜索查询,结合GRPO训练,实现大规模视频库的迭代检索与精确时序定位,性能达SOTA。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 57%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2607.00712 2026-07-02 cs.CV cs.MM 新提交 84%

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

面向内存高效的自回归视频生成:基于实例特定参数吸收

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Hong Kong(香港大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03118 2026-07-02 cs.CV eess.IV 版本更新 81%

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

Salt:基于缓存感知训练的自一致分布匹配用于快速视频生成

Xingtong Ge, Yi Zhang, Yushi Huang, Dailan He, Xiahong Wang, Bingqi Ma, Guanglu Song, Yu Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Vivix Group Limited(Vivix集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出Salt方法,通过自一致分布匹配和缓存感知训练,提升低推理预算下的视频生成质量,兼容多种KV缓存机制。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01654 2026-07-02 cs.CV cs.AI cs.MM 版本更新 81%

Moiré Video Authentication: A Physical Signature Against AI Video Generation

摩尔视频认证:一种对抗AI视频生成的物理签名

Yuan Qing, Kunyu Zheng, Lingxiao Li, Boqing Gong, Chang Xiao

机构 * Boston University(波士顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 57%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交 57%

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13793 2026-07-02 cs.CV 版本更新 57%

From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation

从同步到序列:通过插值实现外视角到视角的视频生成

Mohammad Mahdi, Nedko Savov, Danda Pani Paudel, Luc Van Gool

机构 * 1 INSAIT, Sofia University “St. Kliment Ohridski”

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Syn2Seq-Forcing方法,通过插值生成连续信号解决外视角到视角视频生成中的时空和几何断点问题,提升扩散模型在跨视角视频合成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2604.04198 2026-07-02 cs.CV cs.RO 版本更新 57%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2607.00858 2026-07-02 cs.CV cs.LG 新提交 79%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00375 2026-07-02 cs.CV 新提交 57%

LIST3R: Long-sequence Instance-aware 3D Reconstruction

LIST3R: 长序列实例感知三维重建

Jing Gao, Wei Wang, Feiran Wang, Yan Yan

机构 * Beijing Jiaotong University(北京交通大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出LIST3R框架,通过实例锚点组织长序列三维重建,将子序列局部观测整合为全局一致场景,在长序列基准上实现更优轨迹与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2510.10180 2026-07-02 cs.CV 版本更新 57%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏