Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li
机构
*
New York University, New York, USA(纽约大学)
;
Tsinghua University, Beijing, China(清华大学)
;
Columbia University, New York, USA(哥伦比亚大学)
;
University of Michigan, Ann Arbor, USA(密歇根大学)
Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models
线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试
Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer
机构
*
Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门)
;
Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系)
;
Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组)
;
Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院)
;
Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心)
;
Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)
CommentsV1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk