arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-02 至 2026-07-02 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2607.00983 2026-07-02 cs.CV 新提交 88%

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding

QCA:面向长视频理解的查询与内容感知关键帧选择

Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出QCA框架,通过联合建模查询相关性和内容偏差动态分配关键帧预算,无需额外训练即可集成到Video-LLMs,在长视频理解基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00446 2026-07-02 cs.CV cs.AI 新提交 70%

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出VideoSearch-R1框架,通过软查询细化(SQR)在连续潜空间优化搜索查询,结合GRPO训练,实现大规模视频库的迭代检索与精确时序定位,性能达SOTA。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 57%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2607.00712 2026-07-02 cs.CV cs.MM 新提交 84%

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

面向内存高效的自回归视频生成:基于实例特定参数吸收

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Hong Kong(香港大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交 57%

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2607.00858 2026-07-02 cs.CV cs.LG 新提交 79%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00375 2026-07-02 cs.CV 新提交 57%

LIST3R: Long-sequence Instance-aware 3D Reconstruction

LIST3R: 长序列实例感知三维重建

Jing Gao, Wei Wang, Feiran Wang, Yan Yan

机构 * Beijing Jiaotong University(北京交通大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出LIST3R框架,通过实例锚点组织长序列三维重建,将子序列局部观测整合为全局一致场景,在长序列基准上实现更优轨迹与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏