arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-20 至 2026-03-20 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.18850 2026-03-20 cs.CV 83%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 79%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 视觉问答 :visual language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI 70%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18448 2026-03-20 cs.LG 70%

Seeking Universal Shot Language Understanding Solutions

寻找通用短语语言理解解决方案

Haoxin Liu, Harshavardhan Kamarthi, Zhiyuan Zhao, Hongjie Chen, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出SLU-SUITE框架,通过49万人工标注数据揭示VLM在SLU任务中的瓶颈,提出UniShot和AgentShots两种通用解决方案,实验显示在领域内任务优于专用模型,在领域外任务超越商业VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏