arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 41 信号源:cs.CV, eess.IV, cs.MM

1. 其他视频模型 41 篇

2511.16077 2025-11-21 cs.CV 57%

VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning

VideoSeg-R1: 通过强化学习进行视频对象分割的推理

Zishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Junxin Li

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

AI总结 VideoSeg-R1通过引入强化学习,首次实现了视频对象分割的推理任务,采用解耦架构和显式推理链提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20244 2025-10-24 cs.CV cs.LG 57%

Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding

Minseok Kang, Minhyeok Lee, Minjung Kim, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子)

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

Comments Comments: 28 pages, including appendix. 5 figures. Full version of the NeurIPS 2025 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10104 2025-10-14 cs.CV 57%

Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models

Minbin Huang, Runhui Huang, Chuanyang Zheng, Jingyao Li, Guoxuan Chen, Han Shi, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19000 2025-05-27 cs.CL cs.CV 57%

VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization

Yunxin Li, Xinyu Chen, Zitao Li, Zhenyu Liu, Longyue Wang, Wenhan Luo, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Alibaba International Group(阿里巴巴国际集团) Division of AMC and Department of ECE, HKUST(HKUST电子工程系与AMC division)

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

Comments 19 pages, 9 figures, Project Link: https://github.com/HITsz-TMG/VerIPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05936 2025-03-11 cs.CV 57%

CASP: Compression of Large Multimodal Models Based on Attention Sparsity

Mohsen Gholami, Mohammad Akbari, Kevin Cannons, Yong Zhang

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16058 2024-03-12 cs.CV 57%

Unmasked Teacher: Towards Training-Efficient Video Foundation Models

Kunchang Li, Yali Wang, Yizhuo Li, Yi Wang, Yinan He, Limin Wang, Yu Qiao

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08853 2022-11-23 cs.LG cs.AI cs.CL cs.CV 57%

MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge

Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, Anima Anandkumar

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

Comments Outstanding Paper Award at NeurIPS 2022. Project website: https://minedojo.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27083 2026-05-01 cs.LG 50%

Co-Evolving Policy Distillation

共进化策略蒸馏

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院)

专题命中 其他视频模型 :video reasoning(abstract)

AI总结 本文提出CoPD,通过并行训练专家并引入OPD,在专家RLVR训练过程中实现双向知识传递,提升多模态推理能力,优于现有方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08343 2025-06-19 cs.CL 50%

Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency

Chenlong Wang, Yuanning Feng, Dongping Chen, Zhaoyang Chu, Ranjay Krishna, Tianyi Zhou

机构 * University College London(伦敦大学学院) University of Washington(华盛顿大学)

专题命中 其他视频模型 :video reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15807 2025-03-21 cs.AI 50%

Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture

Cheng Li, Jiexiong Liu, Yixuan Chen, Yanqin Jia

专题命中 其他视频模型 :video-language(abstract)

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06133 2021-09-14 cs.AI cs.LG cs.NE cs.PF 50%

Neuro-Symbolic AI: An Emerging Class of AI Workloads and their Characterization

Zachary Susskind, Bryce Arden, Lizy K. John, Patrick Stockton, Eugene B. John

专题命中 其他视频模型 :video reasoning(abstract)

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏