arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-20 至 2026-08-20 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2608.18386 2026-08-20 cs.CV cs.AI 新提交 57%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2608.18710 2026-08-20 cs.CV 新提交 79%

CamWorldQA: Perceptual Quality Assessment of Camera-Controlled World Video Generation

CamWorldQA:相机控制型世界视频生成的感知质量评估

Yunhe Li, Likun Wu, Sijing Wu, Xinyu Tian, Huiyu Duan, Yixuan Gao, Yunhao Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究推出首个相机控制型世界视频生成质量评估基准CamWorldQA,并提出含三分支的无参考评估网络CWQA,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18484 2026-08-20 cs.CV cs.AI cs.LG 新提交 79%

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

划分支撑集,重建残差:用于视频生成和世界模型的无训练稀疏注意力

Pardis Taghavi, Reza Langari, Gaurav Pandey

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparsePR算法,结合响应耦合划分与探针拟合残差重建,在四个视频生成和世界模型上实现注意力重建误差降低,22.0%-26.0%执行对密度下保持生成质量,获1.48-2.61倍端到端加速。

Comments 22 pages, 5 figures. Project page: this https URL (https://pardistaghavi.github.io/SparsePR-website/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2608.18532 2026-08-20 cs.CV 新提交 83%

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) The University of Sydney(悉尼大学) Central South University(中南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) SenseTime Research(商汤科技研究院)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。

Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18640 2026-08-20 cs.CV 新提交 57%

SAM2Dual: Training-Free, Dual Memory for Long-Term Video Object Segmentation

SAM2Dual:用于长期视频目标分割的无训练双内存机制

JeongRae Kim, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文针对长期视频目标分割的误差累积问题,提出无训练即插即用的SAM2Dual,通过双内存设计与文本感知内存提升长视频鲁棒性,在MOSEv2、LVOSv2基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2608.18607 2026-08-20 cs.CV 新提交 57%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏