arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-20 至 2026-07-20 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2607.15778 2026-07-20 cs.CV cs.AI 新提交 89%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2607.16190 2026-07-20 cs.CV 新提交 83%

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

FVAttn:用于视频生成的具有运行时负载均衡的自适应稀疏注意力

Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Hao Liu, Mohan Zhang, Chen Li, Ziyang Ma, Jing Lyu, Jiangsu Du

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中自注意力瓶颈问题,提出FVAttn方法,通过Top-$p$路由等技术及运行时负载均衡等策略,提升自适应稀疏注意力分布式执行效率,降低负载不平衡,实现注意力和推理加速,且视频质量有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15667 2026-07-20 cs.CV 新提交 83%

PE-Field 4D: Video Generation Models as Canvas

PE-Field 4D:作为画布的视频生成模型

Yunpeng Bai, Haoxiang Li, Qixing Huang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Pixocial Technology(皮克社交科技)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器控制场景几何形状的挑战,通过重新审视位置编码作用,引入几何感知交叉注意力机制及相关编码方案,构建可控视频生成框架,提升视点相关编辑任务的空间可控性且保留模型生成先验。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2607.15849 2026-07-20 cs.CV cs.AI 新提交 83%

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation

用于逼真自回归视频生成的测试时噪声引导适应

Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves

机构 * Information Technologies Institute, CERTH(信息技术研究所,希腊研究与技术中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型误差积累问题,提出TANGO方法,通过噪声引导优化避免模型陷入终点,在VBench上有显著改进,降低了弗雷歇视频距离。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15846 2026-07-20 cs.AR 新提交 50%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 视频扩散模型 :video generation(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2607.16189 2026-07-20 cs.CV 新提交 79%

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

将视频搜索为树:用于有基础的长视频问答的自校正智能体

Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Sony(索尼)

专题命中 视频问答 :long video(title,abstract);分类 cs.CV

AI总结 研究有基础的长视频问答问题,提出VideoTreeSearch框架,通过构建自适应时间树及可学习的离散操作让智能体导航,经监督微调与强化学习训练,在多个基准测试中表现出色,证明自校正分层搜索是关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2607.15772 2026-07-20 cs.CV 新提交 88%

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15689 2026-07-20 cs.CV 新提交 79%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏