arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-21 至 2026-08-21 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2608.19737 2026-08-21 cs.CV cs.AI cs.CL 新提交 57%

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击

Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) East China Normal University(华东师范大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19646 2026-08-21 cs.CV 新提交 57%

PL-NBA: A Possession-level Universal Basketball Video Dataset Supporting Multiple Visual Understanding Tasks

PL-NBA:支持多种视觉理解任务的控球级通用篮球视频数据集

Yunhao Zhao, Haoying Sun, Jiarui Li, Zhuming Wang, Ya Jing, Xiangbo Shu, Lifang Wu, Changwen Chen

机构 * Beijing University of Technology(北京工业大学) Nanjing University of Science and Technology(南京理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文构建首个控球级篮球视频数据集PL-NBA,包含11000个进攻控球片段及31567个注释事件,在四项视觉理解任务上验证其挑战性,为体育视频理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2608.19583 2026-08-21 cs.CV cs.AI 新提交 79%

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2608.20308 2026-08-21 cs.CV 新提交 79%

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: this https URL (https://ggxxii.github.io/dreamhand/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20335 2026-08-21 cs.CV 新提交 57%

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

4DAnyone:从随意的单目视频中创建4D虚拟人物

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Robbyant Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 4DAnyone是一种从单目视频重建4D人体的框架,通过RCP和TCR解决多视图一致性问题,在相关数据集上优于现有方法且泛化性好。

Comments Project page: this https URL (https://4danyone.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19900 2026-08-21 cs.CV 新提交 57%

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

AvatarDynamizer:通过生成式动态纹理从静态化身到动态人类化身

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) EPFL(洛桑联邦理工学院) VIA Research Center(VIA研究中心)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 AvatarDynamizer是一种生成式方法,可将现成静态3D化身转为可控多视角一致4D化身,通过纹理空间动态嵌入实现真实表面动态,在视觉保真度上优于通用方法。

Comments Project page: this https URL (https://vcai.mpi-inf.mpg.de/projects/AvatarDynamizer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19556 2026-08-21 cs.CV cs.AI 新提交 57%

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Stream4D:面向流式自回归扩散视频模型的4D一致性

Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh

机构 * UCLA(加州大学洛杉矶分校) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 Stream4D用显式建模场景动力学的前馈4D重建奖励替代静态评判器,结合运动先验与感知锚,提升流式自回归扩散视频模型的4D重建质量、运动保留效果及人类对齐偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2608.19723 2026-08-21 cs.CV cs.CL 新提交 70%

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

StreamSoccer:用于流式足球解说的事件驱动记忆

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang

机构 * Migu Video Technology Co., Ltd.(咪咕视讯科技有限公司) South China University of Technology(华南理工大学) East China Normal University(华东师范大学)

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 本研究提出StreamSoccer,一种用于流式足球解说的事件驱动系统,通过建模事件生命周期实现多时间范围解说,在数据集评估中取得优异性能且计算开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏