arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-13 至 2026-07-13 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2510.18346 2026-07-13 cs.CV 版本更新 79%

AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering

AV-Master:双路径综合感知实现更优的音频视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu

机构 * Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Nankai University(南开大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 75%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏