Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li
机构
*
New York University, New York, USA(纽约大学)
;
Tsinghua University, Beijing, China(清华大学)
;
Columbia University, New York, USA(哥伦比亚大学)
;
University of Michigan, Ann Arbor, USA(密歇根大学)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
MedLVR: 基于潜在视觉推理的可靠医学视觉问答
Suyang Xi, Songtao Hu, Yuxiang Lai, Wangyun Dan, Yaqi Liu, Shansong Wang, Xiaofeng Yang
机构
*
Department of Radiation Oncology and Winship Cancer Institute, Emory University School of Medicine(埃默里大学医学院放射肿瘤学系与温希普癌症研究所)
;
Department of Biostatistics and Bioinformatics, Emory University(埃默里大学生物统计学与生物信息学系)
VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉
Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun
机构
*
School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)
;
School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院)
;
Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)
机构
*
Kyoto University(京都大学)
;
NII LLMC(国立信息学研究所LLMC)
;
Waseda University(早稻田大学)
;
Institute of Science Tokyo(东京科学大学)
;
NII(国立信息学研究所)
;
Aichi Institute of Technology(爱知工业大学)
;
Institute of Physical and Chemical Research(理化学研究所)
机构
*
School of iOPEN, Northwestern Polytechnical University(iOPEN学院,西北工业大学)
;
The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院)
;
College of Mechanical Engineering, Tongji University(同济大学机械工程学院)
Comments8 pages, 4 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://radar-iros.netlify.app/
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)
;
Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科)
;
Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)
When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs
当话语压力冲突时:视觉-语言模型输出中的信息结构
Marcell Fekete, Johannes Bjerva, Tamás Káldi
机构
*
Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系)
;
Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系)
;
ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)
Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain
医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测
Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli
机构
*
Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学)
;
Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学)
;
Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学)
;
Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学)
;
Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学)
;
Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)
专题命中
视觉问答
:MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学)
;
University of Science and Technology Beijing(北京科技大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中
视觉问答
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院)
;
Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所)
;
Beijing University of Technology, China(北京理工大学)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
面向通用视觉-语言-动作策略的通用姿态预训练
Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu
机构
*
Tencent Robotics X(腾讯机器人X)
;
Futian Laboratory(福田实验室)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)
机构
*
GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟))
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
New York University(纽约大学)
;
Cambridge University(剑桥大学)
;
The University of Hong Kong(香港大学)