StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
StreamFlow:用于流视频理解的动态内存流
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
StreamFlow:用于流视频理解的动态内存流
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
FADE:从被动验证到反事实视频理解中的主动发现
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出FADE框架,解决现有反事实视频理解基准泄露目标事件的问题,通过两阶段训练实现主动发现,在三项任务上性能优于GPT-5.6,为相关研究提供坚实基线。
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。
Comments 10 pages, 4 figures
流强制:构建用于鲁棒流视频生成的统一训练轨迹
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics(地平线机器人) ; Anyverse Dynamics
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。
Comments 15 pages,6 figures
观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐
机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。
SparSTAR:用于时空自回归视频合成的稀疏注意力机制
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。
Sekai2:从世界探索到交互式世界建模
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。
Comments Sekai2 dataset technical report. Developed at Alaya Lab
VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Microsoft(微软公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。
Comments 27 pages, 15 figures
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
机构 * Huazhong University of Science & Technology(华中科技大学) ; Dongfeng Research & Development Institute(东风研发院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。
Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
数据驱动的自然注视-头部协调头部运动生成
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 提出首个数据驱动方法,通过自动提取自然注视和头部运动,利用条件变分自编码器生成与注视相关的头部运动,并应用于注视控制的视频生成。
超越像素:从视频先验到4D世界
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。
Comments Project page: https://hayd-zju.github.io/Beyond-Pixels
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成
机构 * South China University of Technology(华南理工大学) ; Fudan University(复旦大学) ; Yunnan Normal University(云南师范大学)
专题命中 视频数据与评测 :video generation(title);分类 cs.CV
AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。
Comments 17 pages, 9 figues
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。