StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
StreamFlow:用于流视频理解的动态内存流
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
StreamFlow:用于流视频理解的动态内存流
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
FADE:从被动验证到反事实视频理解中的主动发现
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出FADE框架,解决现有反事实视频理解基准泄露目标事件的问题,通过两阶段训练实现主动发现,在三项任务上性能优于GPT-5.6,为相关研究提供坚实基线。
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。
Comments 10 pages, 4 figures
流强制:构建用于鲁棒流视频生成的统一训练轨迹
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics(地平线机器人) ; Anyverse Dynamics
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。
Comments 15 pages,6 figures
观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐
机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。
SparSTAR:用于时空自回归视频合成的稀疏注意力机制
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。
VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Microsoft(微软公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。
Comments 27 pages, 15 figures
超越像素:从视频先验到4D世界
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。
Comments Project page: https://hayd-zju.github.io/Beyond-Pixels
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。