arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 其他视频模型 3 篇

2608.01980 2026-08-04 cs.CV cs.AI 新提交 79%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02922 2026-07-07 cs.CV 新提交 79%

STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

STAC:用于视频推理分割的选择性时空聚合与压缩

Syed Ariff Syed Hesham, Yun Liu, Guolei Sun, Jing Yang, Henghui Ding, Xue Geng, Xudong Jiang

机构 * School of EEE, Nanyang Technological University, Singapore(新加坡南洋理工大学电气与电子工程学院) Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯通信研究院) VCIP, CS, Nankai University, Tianjin, China(中国天津南开大学计算机科学学院视觉计算与模式识别实验室) AAIS, Nankai University, Tianjin, China(中国天津南开大学人工智能学院) NKIARI, Shenzhen Futian, China(中国深圳福田国家知识创新工程研究院) Guizhou University, Guizhou, China(中国贵州大学) Fudan University, Shanghai, China(中国上海复旦大学)

专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV

AI总结 视频推理分割面临高成本问题,现有方法有局限。基于状态空间模型,STAC通过解耦的空间和时间扫描丰富特征,利用冗余进行分层压缩,在零样本流兼容设置下减少令牌、加速并超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02607 2026-07-07 cs.CV cs.CL 新提交 79%

Latent Visual Cache for Video Reasoning

用于视频推理的潜在视觉缓存

Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV

AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。

详情

展开后加载摘要…

URL PDF HTML 收藏