Grounding Answers for Visual Questions Asked by Visually Impaired People
专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Computer Vision and Pattern Recognition
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Computer Vision and Pattern Recognition
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV
Comments Accepted by ICME 2022
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV
Comments Published to ICCV2021
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments 14 pages
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV
Comments 16 pages, 11 figures, Accepted as a Long Paper at NAACL-HLT 2021
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments 14 pages, 8 figures
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV
Comments NIPS 2018. 11 pages ( with references ), 4 figures, 2 tables
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV
Comments European Conference on Computer Vision
BeamVLM 用于低空经济:通过视觉-语言模型进行生成式波束预测
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract)
AI总结 BeamVLM 通过视觉-语言模型实现生成式波束预测,提升无人机与地面基站间通信的准确性和泛化能力。
Comments We propose a novel end-to-end generative framework for beam prediction by using vision-language models
专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by CVPR 2025. Code: https://github.com/Hoar012/RAP-MLLM
用于视觉-语言-动作模型长程规划的显式语言记忆
机构 * Fudan University(复旦大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。
Comments 11 pages, 4 figures
CARE-X:借助辅助监督、奖励对齐学习与工具增强测量实现临床可用的放射学视觉语言模型
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
AI总结 CARE-X是一款胸部X射线视觉语言模型,通过辅助监督、奖励对齐学习及工具增强测量,在多个医学影像任务上实现了优于基线的性能,缩小了放射科医生需求与现有生成模型间的差距。
测量和提高内窥镜视觉问答中复杂原子答案的一致性
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 研究内窥镜VQA中复杂问题答案一致性,引入EndoCA基准,评估11个VLM,发现部分模型复杂答案准确率高但原子答案准确率及复杂-原子答案一致性低,提出ASR机制,能在选定模型上提高配对复杂-原子正确性及已回答案例准确性。
Comments 7 pages, 5 figures, 6 tables
MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型
机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) ; Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) ; Beijing University of Technology, China(北京理工大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。
Comments accept by iclm2026, add github link
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)
面向通用视觉-语言-动作策略的通用姿态预训练
机构 * Tencent Robotics X(腾讯机器人X) ; Futian Laboratory(福田实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。
Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA
Journal ref Robotics: Science and Systems, 2026
HiMu: 面向长视频问答的分层多模态帧选择
机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) ; Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)
专题命中 视觉问答 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。
Robusto-2: 在利马与纽约市对自动驾驶中人类与VLM的基准测试
机构 * Artificio Lima, Peru
专题命中 视觉问答 :VLM(title_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本研究通过视觉问答范式,比较人类驾驶员(来自利马和纽约)与视觉语言模型在利马和纽约的驾驶场景中的表现,发现人类与模型在回答事实、评级、反事实和推理四类问题时存在差异,但地理因素影响不显著。
Comments 11 pages main body. 42 pages total. Data publicly available online
Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成
机构 * RGA Inc.(RGA公司)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。
Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip
OmniTraffic:面向时空交通推理的可控生成流水线与基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai AI Lab(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。
Comments 34 pages, 28 figures
Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试
机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; New York University(纽约大学) ; Cambridge University(剑桥大学) ; The University of Hong Kong(香港大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。
当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏
机构 * Tsinghua University(清华大学) ; DISCOVER Robotics
专题命中 视觉问答 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。
Comments 16 pages, 4 figures, 4 tables
UniCAD:面向多模态多任务CAD的统一基准与通用模型
机构 * SenseTime Research and Tetras.AI(秒速科技研究院和Tetras.AI)
专题命中 视觉问答 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对CAD领域缺乏统一多模态基准的问题,提出UniCAD基准和UniCAD-MLLM通用多模态大语言模型,在点云到CAD重建、文本/图像到CAD生成和CAD问答等任务上实现端到端统一处理,并在多个基准上取得最优性能。
描述:距离标注的交通感知问答(DTPQA)
机构 * Department of Electronic and Computer Engineering, University of Limerick(利默尼克大学电子与计算机工程系) ; Data Driven Computer Engineering Research Centre, University of Limerick(利默尼克大学数据驱动计算机工程研究中心) ; Lero, The Irish Software Research Centre, University of Limerick(利默尼克大学Lero爱尔兰软件研究中心) ; Valeo Vision Systems(瓦莱奥视觉系统)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出DTPQA基准,用于评估视觉语言模型在交通场景中的感知能力,包含合成和真实数据集,通过距离标注分析模型在远距离下的表现。
Journal ref IEEE Data Descriptions, 2026
Instruct-ICL:基于指令的上下文学习用于灾后损害评估
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。
Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)
LatentRouter: 在看到答案之前,我们能否选择合适的多模态模型?
机构 * Department of Computer Science(计算机科学系)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 LatentRouter通过多模态效用预测实现多模态大语言模型的路由,通过隐式通信和胶囊修正提升模型选择准确性,在MMR-Bench和VL-RouterBench实验中优于基线方法。
ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试
机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) ; Datadog AI Research(Datadog AI研究) ; Amazon Web Services(亚马逊网络服务)
专题命中 视觉问答 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。
Comments Updated author affiliation
mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。
Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia
BridgeEQA:用于真实桥梁检查的虚拟具身代理
机构 * University of Houston(德克萨斯大学休斯顿分校)
专题命中 视觉问答 :visual reasoning(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。
M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用
机构 * DEEPNOID Inc.(DEEPNOID公司)
专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。
Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025