2608.18386 2026-08-20 cs.CV cs.AI 新提交 57% TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏 Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger 专题命中 视频理解 :video-language(abstract);分类 cs.CV AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.18710 2026-08-20 cs.CV 新提交 79% CamWorldQA: Perceptual Quality Assessment of Camera-Controlled World Video Generation CamWorldQA:相机控制型世界视频生成的感知质量评估 Yunhe Li, Likun Wu, Sijing Wu, Xinyu Tian, Huiyu Duan, Yixuan Gao, Yunhao Li, Guangtao Zhai 机构 * Shanghai Jiao Tong University(上海交通大学) ; Eindhoven University of Technology(埃因霍温理工大学) 纠错 专题命中 视频生成 :video generation(title,abstract);分类 cs.CV AI总结 本研究推出首个相机控制型世界视频生成质量评估基准CamWorldQA,并提出含三分支的无参考评估网络CWQA,实验显示其性能优于现有方法。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.18484 2026-08-20 cs.CV cs.AI cs.LG 新提交 79% Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models 划分支撑集,重建残差:用于视频生成和世界模型的无训练稀疏注意力 Pardis Taghavi, Reza Langari, Gaurav Pandey 机构 * Texas A&M University(德克萨斯农工大学) 纠错 专题命中 视频生成 :video generation(title,abstract);分类 cs.CV AI总结 本文提出SparsePR算法,结合响应耦合划分与探针拟合残差重建,在四个视频生成和世界模型上实现注意力重建误差降低,22.0%-26.0%执行对密度下保持生成质量,获1.48-2.61倍端到端加速。 Comments 22 pages, 5 figures. Project page: this https URL (https://pardistaghavi.github.io/SparsePR-website/) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.18532 2026-08-20 cs.CV 新提交 83% StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架 Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su 机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) ; The University of Sydney(悉尼大学) ; Central South University(中南大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; SenseTime Research(商汤科技研究院) 纠错 专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。 Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.18640 2026-08-20 cs.CV 新提交 57% SAM2Dual: Training-Free, Dual Memory for Long-Term Video Object Segmentation SAM2Dual:用于长期视频目标分割的无训练双内存机制 JeongRae Kim, Changwon Lim 机构 * Chung-Ang University(中央大学) 纠错 专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV AI总结 本文针对长期视频目标分割的误差累积问题,提出无训练即插即用的SAM2Dual,通过双内存设计与文本感知内存提升长视频鲁棒性,在MOSEv2、LVOSv2基准上取得性能提升。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.18607 2026-08-20 cs.CV 新提交 57% VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模 Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu 机构 * Shanghai Innovation Institution(上海创新研究院) ; Fudan University(复旦大学) ; Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司) 纠错 专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。 Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图