arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-06 至 2026-08-06 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2608.04676 2026-08-06 cs.CV 新提交 83%

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

SurgNarrator:面向手术视频理解的生成式检索框架

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

机构 * University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) University of Strasbourg(斯特拉斯堡大学) IHU Strasbourg(斯特拉斯堡大学医院研究所) Imperial College London(帝国理工学院)

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 79%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 视频理解 :video language model(title);video understanding(abstract);分类 cs.CV

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 79%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04939 2026-08-06 cs.CL 新提交 75%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);video-language(abstract)

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04501 2026-08-06 cs.CV 新提交 57%

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

隐私保护动作识别:分类、方法与隐私-效用权衡

Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif, Sanghyun Seo

机构 * Chung-Ang University(中央大学) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2608.05070 2026-08-06 cs.CV 新提交 57%

HelloWorld: Enabling Socially Interactive Characters in Video World Models

HelloWorld:在视频世界模型中实现具有社交互动性的角色

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Alaya Lab(阿莱亚实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出HelloWorld视频世界模型,通过自蒸馏流水线和训练模块实现角色与用户的社交互动,构建含400样本的基准,其互动质量优于基线且保持顶尖图像美学。

Comments Project page: https://github.com/AlayaLab/HelloWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04426 2026-08-06 cs.CV cs.CL 新提交 57%

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

预测再检索:从视频前缀中进行跨实例未来状态检索

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04224 2026-08-06 cs.CV 新提交 57%

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR:用于恢复退化历史影片的联合视频-音频条件生成模型

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出首个联合音视频生成修复模型OmniVR,通过三项关键设计解决历史影片的音视频共同退化问题,在多类指标上超越现有方法,还发布了相关基准OmniVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2608.04701 2026-08-06 cs.CV 新提交 79%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 3 篇

2608.04302 2026-08-06 cs.CV cs.IR cs.MM 新提交 81%

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

CLIP-CC-Bench:评估视频语言模型中的段落级视频描述

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack

机构 * South Dakota State University(南达科他州立大学)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV、cs.MM

AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。

Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 74%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频问答 :video understanding(title);分类 cs.CV

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04589 2026-08-06 cs.CV cs.AI 新提交 57%

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。

Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2608.04132 2026-08-06 cs.CV 新提交 57%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏