arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-26 至 2026-06-26 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2606.26904 2026-06-26 cs.CV cs.AI 新提交 83%

Confidence-Aware Tool Orchestration for Robust Video Understanding

置信度感知的工具编排用于鲁棒视频理解

Yangfan He, Yujin Choi, Jaehong Yoon

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。

Comments Project page: https://rova-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 79%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26762 2026-06-26 cs.CV cs.LG 新提交 79%

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV: 延迟查询下的流式视频理解与摘要状态记忆

Le Tu Ngoc Minh, Jinyeong Lim, Dongsu Han

机构 * KAIST(韩国科学技术院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出ProtoKV,一种固定内存的流式视频理解记忆机制,通过摘要状态表示远历史,在长延迟查询下准确率提升高达12.5点。

Comments 20 pages, 4 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27372 2026-06-26 cs.CV 新提交 57%

DnA: Denoising Attention for Visual Tasks

DnA:用于视觉任务的去噪注意力

Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

机构 * University of Central Florida(中佛罗里达大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出去噪注意力(DnA),通过正负查询分离相关与无关特征,提升多头部注意力的判别性,在ImageNet-1K上提升0.8%,并适用于视频理解任务。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2606.26916 2026-06-26 cs.CV 新提交 83%

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26668 2026-06-26 cs.CV cs.AI 新提交 70%

Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization

Disco-LoRA:内容、风格和运动的解耦组合用于多概念视频定制

Xuancheng Xu, Gengyun Jia, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Hefei University of Technology(合肥工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出Disco-LoRA框架,通过两阶段解耦和重组内容、风格和运动概念,实现多概念视频定制,并采用Z-score正则化协调LoRA权重分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 57%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26587 2026-06-26 cs.LG cs.AI 新提交 50%

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ:桥接激活稀疏性与FP4量化用于LLM推理

Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Huaqing Zheng, Xindian Ma, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract)

AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2606.27277 2026-06-26 cs.AI cs.CV 新提交 57%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2606.26942 2026-06-26 cs.CV 新提交 57%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏