Coverage-Driven Adaptive Keyframe Selection for Video Understanding
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
ObjectStream:将潜在对象作为记忆锚点用于流视频理解
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 提出无需训练的 ObjectStream 框架,以潜在对象为记忆锚点组织流视频证据,使 Video-LLMs 无需改动即可推理对象相关内容,在多基准上实现性能提升且内存与推理效率显著优化。
WaveZip:用于视频令牌压缩的小波驱动时空解耦
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。
Comments 13 pages, 10 figures
CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。
Comments 11 pages, 5 figures
重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。
用于手语翻译的注意力引导视觉-语言模型
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; University of Virginia(弗吉尼亚大学) ; National Technical Institute for the Deaf(国家聋人技术学院)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
FreqForcing:基于频谱自锚定的自回归长视频生成方法
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV
AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。
Comments Code is available at: https://github.com/jiatongli2024/FreqForcing
MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; StepFun(阶跃星辰) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。
Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page
GimbalDiffusion:基于重力的摄像机控制用于视频生成
机构 * Université Laval(拉瓦尔大学) ; Adobe
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出GimbalDiffusion框架,通过物理坐标系实现摄像机运动的精确控制,引入null-pitch conditioning策略以避免冲突提示内容干扰,并建立新基准评估重力感知摄像机控制视频生成能力。
Comments Accepted at ECCV 2026. Project page: https://lvsn.github.io/GimbalDiffusion/
用于高效视频生成的 Token 半径注意力机制
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理
机构 * SJTU(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低
诊断视频生成中不可逆过程的欠发展问题
机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) ; RIKEN AIP(理化学研究所 AIP) ; South China University of Technology(华南理工大学) ; Columbia University(哥伦比亚大学)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。
LeapTalk:打破说话头生成中的延迟-质量权衡
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。
MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。
Comments Project page: https://mvhoi.hirotong.fun
WorldExam:从表观外观到内在反应性对世界模型进行基准测试
机构 * CASIA(中国科学院自动化研究所) ; SLAI(智能科学与技术实验室) ; CUHK(香港中文大学) ; AMAP(中国农业科学院) ; THU(清华大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。
Comments Project Website: https://WorldExam.github.io
大基础模型时代的手物交互:重建、生成与具身迁移
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。
3D场景自适应轨迹可控的人体图像动画与相机运动
机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) ; Ministry of Education(教育部) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; University of Warwick(沃林格大学) ; Zhejiang Yuexiu University(浙江越秀大学) ; University of Surrey(萨里大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)
ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染
机构 * University of Rochester(罗切斯特大学) ; Pixocial Technology(Pixocial技术)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。
Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web
DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。
Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/
轻量强制:通过稀疏注意力加速自回归视频扩散
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。
Comments ICML 2026
ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。
Zellige:用于混合图像-视频DiT训练的可塑序列放置
专题命中 视频扩散模型 :video generation(abstract)
AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。
LiveLight:具备交互式控制的实时流视频重光照
机构 * HKUST(香港科技大学) ; University of Macau(澳门大学) ; THU(清华大学) ; UoT(多伦多大学) ; University of Tuebingen(蒂宾根大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。
Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io
AcoustiTrace:看似合理的声音为何违背物理规律
专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM
AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。
EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准
专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV
AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。