arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 4 篇

2603.21366 2026-03-24 cs.CV 89%

Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation

放松强制:用于一致长视频生成的放松KV内存

Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学) Imperial College London(伦敦帝国学院)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Relax Forcing机制,通过结构化时间内存提升长视频生成的运动动态和时间一致性,减少注意力开销。

Comments Project page: see https://zengqunzhao.github.io/Relax-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12469 2026-03-24 cs.CV 79%

Unleashing Video Language Models for Fine-grained HRCT Report Generation

释放视频语言模型以生成细粒度HRCT报告

Yingying Fang, Huichi Zhou, KinHei Lee, Yijia Wang, Zhenxuan Zhang, Jiahao Huang, Guang Yang

机构 * Bioengineering Department, Imperial College London, London, UK School of Biomedical Engineering \& lmaging Sciences, King's College London, London,UK

专题命中 长视频与时序推理 :video language model(title,abstract);分类 cs.CV

AI总结 本文提出AbSteering框架,通过异常中心方案和直接偏好优化目标,提升视频语言模型在HRCT报告生成中的精度与细粒度区分能力,优于现有领域特定CT基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21436 2026-03-24 cs.CV 79%

PAS3R: Pose-Adaptive Streaming 3D Reconstruction for Long Video Sequences

PAS3R:面向长视频序列的姿态自适应流式3D重建

Lanbo Xu, Liang Guo, Caigui Jiang, Cheng Wang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University, China(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学,中国) University of East Anglia, Norwich, NR47TJ, United Kingdom(东安格利亚大学,诺里奇,英国)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 PAS3R通过动态调节状态更新机制,解决流式3D重建中视角变化与结构稳定性矛盾,提升长视频序列的轨迹精度和点云重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20354 2026-03-24 cs.MM cs.AI 70%

Leum-VL Technical Report

Leum-VL 技术报告

Yuxuan He, Chaiming Huang, Yifan Wu, Hongjun Wang, Chenkui Shen, Jifan Zhang, Long Li

机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.MM

AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏