arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 其他视频模型 1 篇

2510.08138 2026-03-24 cs.CV cs.AI cs.MM 81%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV、cs.MM

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏