Coverage-Driven Adaptive Keyframe Selection for Video Understanding
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。
Comments 11 pages, 5 figures
重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。
用于手语翻译的注意力引导视觉-语言模型
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; University of Virginia(弗吉尼亚大学) ; National Technical Institute for the Deaf(国家聋人技术学院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
用于高效视频生成的 Token 半径注意力机制
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理
机构 * SJTU(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低
诊断视频生成中不可逆过程的欠发展问题
机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) ; RIKEN AIP(理化学研究所 AIP) ; South China University of Technology(华南理工大学) ; Columbia University(哥伦比亚大学)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。
LeapTalk:打破说话头生成中的延迟-质量权衡
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。
WorldExam:从表观外观到内在反应性对世界模型进行基准测试
机构 * CASIA(中国科学院自动化研究所) ; SLAI(智能科学与技术实验室) ; CUHK(香港中文大学) ; AMAP(中国农业科学院) ; THU(清华大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。
Comments Project Website: https://WorldExam.github.io
DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。
Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/
Zellige:用于混合图像-视频DiT训练的可塑序列放置
专题命中 视频扩散模型 :video generation(abstract)
AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。
LiveLight:具备交互式控制的实时流视频重光照
机构 * HKUST(香港科技大学) ; University of Macau(澳门大学) ; THU(清华大学) ; UoT(多伦多大学) ; University of Tuebingen(蒂宾根大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。
Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io
AcoustiTrace:看似合理的声音为何违背物理规律
专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM
AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。