AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring
AVA-VLM:用于野外建筑工地监测的自适应视觉注意力视觉语言模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; AI+KCIR Global Resilience Research Center(人工智能与韩国气候变化影响韧性研究中心) ; SmartInside AI Co., Ltd.(思玛特因赛德人工智能有限公司) ; Sungkyunkwan University(成均馆大学)
AI总结 针对野外建筑工地监测,提出AVA-VLM自适应视觉注意力视觉语言模型,遵循粗到细推理策略,先对低分辨率全局图像推理,按需请求高分辨率局部裁剪,并引入区域感知思维链数据集,提升了低分辨率下的可靠性并减少视觉令牌使用。