arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-15 至 2026-04-15 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12582 2026-04-15 cs.CV 57%

Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models

缓解视频大语言模型幻觉的锚架主导问题

Zijian Liu, Sihan Cao, Pengcheng Zheng, Kuien Liu, Caiyan Qin, Xiaolin Qin, Jiwei Wei, Chaoning Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chengdu Institute of Computer Applications, Chinese Academy of Sciences, University of the Chinese Academy of Sciences(中国科学院成都计算机应用研究所,中国科学院大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出DTR方法,通过解码器侧时间再平衡缓解视频大语言模型在生成时的时间证据分配不均问题,提升幻觉鲁棒性并保持视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12346 2026-04-15 cs.CV 57%

Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization

解锁 grounding dino 在视频中的潜力:针对小数据空间-时间定位的参数高效适应

Zanyi Wang, Fan Li, Dengyang Jiang, Liuzhuozheng Li, Yunhua Zhong, Guang Dai, Mengmeng Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室,国家电网公司) University of HongKong(香港大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ST-GD框架,通过冻结基础模型并注入轻量适配器,有效解决小数据下的视频空间时间定位问题,在HC-STVG v1/v2基准和VidSTG数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏