Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
Hector Zenil, Luan Ozelim
机构
*
Oxford Immune Algorithmics(牛津免疫算法学公司)
;
Oxford University Innovation(牛津大学创新公司)
;
London Institute for Healthcare Engineering(伦敦医疗工程研究所)
;
King’s College London(伦敦国王学院)
CommentsThis paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented
Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities
大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析
Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li
机构
*
Adelaide University(阿德莱德大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Amap, Alibaba Group(阿里巴巴集团高德地图)
;
Beihang University(北京航空航天大学)
Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
机构
*
Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院)
;
Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院)
;
Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院)
;
System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院)
;
Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学)
;
RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
;
Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学)
;
Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学)
;
School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学)
;
Hospital of the University of Pennsylvania(宾夕法尼亚大学医院)
;
Children’s Hospital of Philadelphia (CHOP)(费城儿童医院)
;
Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院)
;
Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校)
;
Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪
Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du
机构
*
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Zhejiang University(浙江大学)
;
Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)
Enhancing LLMs' Clinical Reasoning with Real-World Data from a Nationwide Sepsis Registry
利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力
Junu Kim, Chaeeun Shim, Sungjin Park, Su Yeon Lee, Gee Young Suh, Chae-Man Lim, Seong Jin Choi, Song Mi Moon, Kyoung-Ho Song, Eu Suk Kim, Hong Bin Kim, Sejoong Kim, Chami Im, Dong-Wan Kang, Yong Soo Kim, Hee-Joon Bae, Sung Yoon Lim, Han-Gil Jeong, Edward Choi
机构
*
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
Microsoft(微软)
;
Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心)
;
Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心)
;
Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)
G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis
G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架
Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang
机构
*
Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院)
;
National Key Laboratory of Human Factors Engineering(人因工程重点实验室)
;
Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)
Information-seeking failures of large language models in agentic clinical reasoning
大语言模型在代理临床推理中的信息获取失败
Krischan Braitsch, Laura K. Schmalbrock, Theresa Weltermann, Andrew F. Berdel, Isabella Miller, Kai Tran, Michael Heider, Sabrina Kraus, Florian Bassermann, Jacqueline Lammert, Sebastian Ziegelmayer, Marcus Makowski, Lisa C. Adams, Keno K. Bressem