AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
STAC:用于视频推理分割的选择性时空聚合与压缩
机构 * School of EEE, Nanyang Technological University, Singapore(新加坡南洋理工大学电气与电子工程学院) ; Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯通信研究院) ; VCIP, CS, Nankai University, Tianjin, China(中国天津南开大学计算机科学学院视觉计算与模式识别实验室) ; AAIS, Nankai University, Tianjin, China(中国天津南开大学人工智能学院) ; NKIARI, Shenzhen Futian, China(中国深圳福田国家知识创新工程研究院) ; Guizhou University, Guizhou, China(中国贵州大学) ; Fudan University, Shanghai, China(中国上海复旦大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 视频推理分割面临高成本问题,现有方法有局限。基于状态空间模型,STAC通过解耦的空间和时间扫描丰富特征,利用冗余进行分层压缩,在零样本流兼容设置下减少令牌、加速并超越基线。
用于视频推理的潜在视觉缓存
机构 * Tencent Youtu Lab(腾讯优图实验室) ; Tsinghua University(清华大学) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。