arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-09 至 2026-04-09 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 1 篇

2604.06789 2026-04-09 cs.CV cs.CL 57%

Video-guided Machine Translation with Global Video Context

基于全局视频上下文的视频引导机器翻译

Jian Chen, JinZe Lv, Zi Long, XiangHua Fu

机构 * Shenzhen University(深圳大学) Shenzhen Technology University(深圳技术大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏