Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
Honghao Chen, Xingzhou Lou, Xiaokun Feng, Kaiqi Huang, Xinlong Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
CommentsConference on Robot Learning (CoRL) 2025. 50 pages and 30 figures. v2 is the camera-ready and includes a few more new experiments compared to v1
PathMR: Multimodal Visual Reasoning for Interpretable Pathology Diagnosis
Ye Zhang, Yu Zhou, Jingwen Qi, Yongbing Zhang, Simon Puettmann, Finn Wichmann, Larissa Pereira Ferreira, Lara Sichward, Julius Keyl, Sylvia Hartmann, Shuo Zhao, Hongxiao Wang, Xiaowei Xu, Jianxu Chen
机构
*
School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
;
Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V.(莱比锡分析科学研究所(ISAS))
;
Department of Pathology, The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院病理科部)
;
Institute of Pathology, University Hospital Essen(埃森大学医院病理科研究所)
;
Academy for Multidisciplinary Studies, Capital Normal University(首都师范大学多学科研究学院)
机构
*
Shandong University, School of Control Science
;
Rutgers University, Department of Computer Science 110 Frelinghuysen Road Piscataway New Brunswick NJ USA 08854
;
University of California, Santa Barbara 1210 Cheadle Hall Santa Barbara California USA 93106
;
University of Michigan, School of Information 500 S State St Ann Arbor Michigan USA 48109
;
The Chinese University of Hong Kong, Department of Computer Science
;
The College of William \& Mary, School of Computing, Data Sciences \& Physics 200 Stadium Dr Williamsburg Virginia USA 23185
;
The Chinese University of Hong Kong, Department of Psychiatry 9 Chuen On Rd Tai Po New Territories Hong Kong SAR, China 999077
;
Rutgers University, Department of Computer Science
;
University of California, Santa Barbara
;
University of Michigan, School of Information
;
The College of William \& Mary, School of Computing, Data Sciences \& Physics
;
The Chinese University of Hong Kong, Department of Psychiatry
Probing Mechanical Reasoning in Large Vision Language Models
Haoran Sun, Qingying Gao, Haiyun Lyu, Dezhi Luo, Yijiang Li, Hokin Deng
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校)
;
University of Michigan(密歇根大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Carnegie Mellon University(卡内基梅隆大学)
专题命中
视觉推理
:vision language model(title,abstract);分类 cs.AI
CommentsPublished at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)
Vision Language Models See What You Want but not What You See
Qingying Gao, Yijiang Li, Haiyun Lyu, Haoran Sun, Dezhi Luo, Hokin Deng
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
University of Michigan(密歇根大学)
;
Carnegie Mellon University(卡内基梅隆大学)
专题命中
视觉推理
:vision language model(title,abstract);分类 cs.AI
CommentsPublished at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)
GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models
Ashutosh Bandooni, Brindha Subburaj
专题命中
视觉推理
:vision language model(title,abstract);分类 cs.AI
Comments6 pages, 3 figures. Accepted, Presented and Published as part of Proceedings of the 6th International Conference on Recent Advantages in Information Technology (RAIT) 2025
Journal ref2025 6th International Conference on Recent Advances in Information Technology (RAIT), Dhanbad, India, 2025, pp. 1-6
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
Ji Ma, Wei Suo, Peng Wang, Yanning Zhang
机构
*
Northwestern Polytechnical University(西北工业大学)
;
National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室)
DiagR1: A Vision-Language Model Trained via Reinforcement Learning for Digestive Pathology Diagnosis
Minxi Ouyang, Lianghui Zhu, Yaqing Bao, Qiang Huang, Jingli Ouyang, Tian Guan, Xitong Ling, Jiawen Li, Song Duan, Wenbin Dai, Li Zheng, Xuemei Zhang, Yonghong He
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Department of Pathology, Liuzhou People’s Hospital Affiliated to Guangxi Medical University(广西医科大学柳州市人民医院病理科)
;
Department of Immunology, College of Basic Medical Sciences, China Medical University(中国医科大学基础医学学院免疫科)
;
Greater Bay Area Center for Medical Device Evaluation and Inspection.NMPA(粤港澳大湾区医疗器械评价和检验中心.NMPA)
;
Shenzhen Shengqiang Technology Co., Ltd.(深圳盛强科技有限公司)
;
Department of Pathology, Chongqing University Affiliated Three Gorges Hospital(重庆大学附属第三人民医院病理科)
专题命中
视觉推理
:vision-language model(title);vision language model(abstract);分类 cs.CV