arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-21 至 2026-08-21 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.07761 2026-08-21 cs.CV 版本更新 83%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04500 2026-08-21 cs.CV cs.AI 版本更新 79%

ReynoldsFlow: Physics-Inspired Spatiotemporal Flow Representation for Video Understanding

ReynoldsFlow:用于视频理解的物理启发式时空流表示

Yu-Hsi Chen, Ching-Kai Lin, PingKong Huang, Chin-Tien Wu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对现有视频理解方法计算成本高、运动表示鲁棒性差的问题,提出基于RTT和HHD的ReynoldsFlow,分解运动为CF和DF分量,可提升下游任务性能且兼具轻量高效性。

Comments 18 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2604.06010 2026-08-21 cs.CV 版本更新 79%

OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control

OmniCamera:一个统一的多任务视频生成框架,支持任意相机控制

Yukun Wang, Ruihuang Li, Jiale Tao, Shiyuan Yang, Liyi Chen, Zhantao Yang, Handz, Yulan Guo, Shuai Shao, Qinglin Lu

机构 * Sun Yat-sen University(中山大学) Hunyuan, Tencent(腾讯混元) CityU(香港城市大学) PolyU(香港理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OmniCamera通过显式解耦场景内容与相机运动,实现灵活的视频生成,提出混合数据集和双阶段课程协同训练策略,提升多任务学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-21 cs.CV 版本更新 70%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14398 2026-08-21 cs.AI 版本更新 50%

ChronoAgentic: A Code-based Multi-Agent World Simulator for Physically Grounded Simulation Construction

编码智能体作为世界模拟器

Hongyu Wang, Jingquan Wang, Ashvin Anilkumar, Bocheng Zou, Radu Serban, Dan Negrut

机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)

专题命中 视频生成 :text-to-video(abstract)

AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2608.07932 2026-08-21 cs.CV 版本更新 79%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2605.06094 2026-08-21 cs.CV cs.AI 版本更新 83%

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2608.18607 2026-08-21 cs.CV 版本更新 57%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏