arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-25 至 2026-02-25 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2602.20739 2026-02-25 cs.AI cs.CV 70%

PyVision-RL: Forging Open Agentic Vision Models via RL

通过强化学习构建开放代理视觉模型:PyVision-RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

机构 * Shanghai AI Lab(上海人工智能实验室) Rice University(里士满大学) Shanda AI Research, Tokyo(上海沙达人工智能研究东京)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 PyVision-RL通过强化学习框架解决多模态代理的交互崩溃问题,结合回放策略和累积奖励提升多轮推理能力,实现高效视频理解与处理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2602.21188 2026-02-25 cs.CV 83%

Human Video Generation from a Single Image with 3D Pose and View Control

从单张图像生成人类视频:结合3D姿态和视角控制

Tiantian Wang, Chun-Han Yao, Tao Hu, Mallikarjun Byrasandra Ramalinga Reddy, Ming-Hsuan Yang, Varun Jampani

机构 * Electrical Engineering and Computer Science, University of California, Merced, CA 95343, United States.(电子工程与计算机科学系,加州大学默塞德分校) Stability AI, Los Angeles, CA 90067, United States.(Stability AI)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出HVG模型,通过3D姿态和视角控制从单张图像生成高质量多视角人类视频,解决了衣物褶皱和时空一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17404 2026-02-25 cs.CV 79%

MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling

MoSA: 通过结构-外观解耦生成运动一致的人体视频

Haoyu Wang, Hao Tang, Donglin Di, Zhilu Zhang, Wangmeng Zuo, Feng Gao, Siwei Ma, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) School of Arts(艺术学院) Li Auto(力汽车) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoSA通过结构-外观解耦生成运动一致的人体视频,引入Human-Aware Dynamic Control模块和接触约束,提升细粒度控制与人-环境交互建模,实现更逼真的人体视频生成。

Comments Accepted by ICLR 2026. Project: https://hywang2002.github.io/MoSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08456 2026-02-25 cs.CV 57%

Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance

通过自适应低通引导改进图像到视频模型中的运动

June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee

机构 * KAIST(韩国科学技术院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本研究提出自适应低通引导方法,通过调整图像频率内容提升图像到视频生成的动态效果,同时保持图像质量和文本对齐度。

Comments Project page: http://choi403.github.io/ALG

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2602.20583 2026-02-25 cs.CV 79%

PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

PropFly: 通过预训练视频扩散模型的实时监督学习进行传播

Wonyong Seo, Jaeho Moon, Jaehyup Lee, Soo Ye Kim, Munchurl Kim

机构 * KAIST(韩国科学技术院) Kyungpook National University(庆北国立大学) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 PropFly通过预训练视频扩散模型的实时监督学习,实现基于传播的视频编辑,无需配对数据集,提升编辑质量和一致性。

Comments The first two authors contributed equally to this work (equal contribution)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 3 篇

2602.20159 2026-02-25 cs.CV cs.AI cs.LG cs.MM cs.RO 81%

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV、cs.MM

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: https://video-reason.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 57%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频数据与评测 :video language model(abstract);分类 cs.CV

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20354 2026-02-25 cs.CV 57%

3DSPA: A 3D Semantic Point Autoencoder for Evaluating Video Realism

3DSPA:一种用于评估视频真实性的3D语义点自编码器

Bhavik Chandna, Kelsey R. Allen

机构 * University of California, San Diego, CA, USA(加州大学圣迭戈分校) University of British Columbia, Vancouver, BC, Canada(不列颠哥伦比亚大学) Vector Institute, Toronto, ON, Canada(向量研究所)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 3DSPA通过整合3D语义与时空点轨迹,实现无需参考视频的视频真实性自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏