arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-23 至 2026-07-23 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2607.19515 2026-07-23 eess.IV cs.CV 新提交 62%

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

BLUE:用于高效视觉语言监控分析的语义保留视频压缩

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2607.20174 2026-07-23 cs.CV cs.AI 新提交 79%

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

机构 * Kling AI Research(克林人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) National Cheng Kung University(国立成功大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。

Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20247 2026-07-23 cs.CV 新提交 74%

Vera: Identity-Faithful Human Subject-to-Video Generation

Vera:身份忠实的人类主体到视频生成

Yulong Xu, Xinyue Liu, Shujuan Li, huafeng shi, Yan Zhou, Jiwen Liu, Xintao Wang, Yu Shen Liu, Huaibo Huang

机构 * Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对主体到视频生成中人类身份一致性不足问题,提出Vera框架,通过构建百万对身份对齐数据集,引入身份聚焦掩码监督和参考感知分层注意力两种设计,提升了身份一致性、主体绑定及运动自然性等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19895 2026-07-23 cs.CV cs.AI 新提交 57%

OSVE: One Step Video Editing with One Step Diffusion Models

OSVE:使用单步扩散模型进行单步视频编辑

Habin Lim, Gyeong-Moon Park

机构 * Korea University(韩国大学)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 研究针对扩散模型文本引导视频编辑慢的问题,提出OSVE框架。通过训练可学习编码器预测初始噪声,引入UFE技术及滑动窗口策略保持一致性,实现高质量视频编辑,速度比现有方法快约155 - 171倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 57%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2607.20125 2026-07-23 cs.CV cs.LG 新提交 79%

HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation

HeadCast:为高效自回归视频生成分配注意力头

Jinliang Shen, Lianghao Su, Zheming Li, Kang He, ZiLiang Lai, Yanbing Jiang, Chengru Song

机构 * KlingAI Research(克林人工智能研究公司)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型注意力成本高的问题,提出HeadCast框架,基于预训练模型注意力头行为进行一次性分类,重组KV缓存,保留全局头,在不同分辨率下有效加速推理且保持质量,减少闪烁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 74%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19522 2026-07-23 cs.LG cs.CV 新提交 57%

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation

基于地理空间扩散的风暴中心天气增强演化合成(GeoDES)

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Youran Wang, Grace Kisslinger, Frederic Sala, James Booth, Allegra LeGrande

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究针对机器学习天气模型预测风暴结构难题,提出基于地理空间扩散的演化合成(GeoDES)模型,该模型能合成高保真天气事件,经评估在关键指标上优于先前方法,可用于测试预测模型和扩展气象数据集。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏