Ruiqi Wu, Yuang Yao, Tengfei Ma, Chenran Zhang, Na Su, Tao Zhou, Geng Chen, Wen Fan, Yi Zhou
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科学系)
;
School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
;
School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
RefBench-PRO:面向感知与推理的指称表达理解基准
Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室)
;
National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心)
;
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)
;
Xi’an Jiaotong University(西安交通大学)
;
Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))
;
China Telecom(中国电信)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Science and Technology Beijing(北京科技大学)
Enhancing Pathological VLMs with Cross-scale Reasoning
增强病理视觉语言模型的跨尺度推理能力
Chi Phan, Tianyi Zhang, Qiaochu Xue, Yufeng Wu, Dan Hu, Zeyu Liu, Sudong Wang, Yueming Jin
机构
*
Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
;
PuzzleLogic Pte Ltd(PuzzleLogic私人有限公司)
;
Department of Pathology, Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院病理科暨福建省肿瘤医院)
BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science
BioProBench: 一个全面的数据集和生物协议理解与推理基准
Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian
机构
*
School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
;
School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)
机构
*
Ant Group(蚂蚁集团)
;
Nanyang Technological University(南洋理工大学)
;
CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)
Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches
Reasoning4Sciences:将推理语言模型桥接到所有科学分支
Teddy Ferdinan, Bartłomiej Koptyra, Mikołaj Langner, Tomasz Adamczyk, Łukasz Radliński, Maciej Markiewicz, Aleksander Szczęsny, Stanisław Woźniak, Tymoteusz Romanowicz, Dzmitry Pihulski, Mateusz Zbrocki, Mateusz Śmigielski, Michał Rajkowski, Mateusz Biedka, Konrad Kiełczyński, Konrad Wojtasik, Jacek Duszenko, Jan Eliasz, Piotr Matys, Michał Bernacki-Janson, Maria Bellaniar Ismiati, Latius Hermawan, Wiktoria Mieleszczenko-Kowszewicz, Anna Kubicka-Sowińska, Grzegorz Chodak, Karol Postawa, Paweł Zyblewski, Tomasz Szandała, Łukasz Sterczewski, Adrian Chajec, Paweł Niewiadomski, Piotr Gruber, Marcin Wdowikowski, Sławomir Czarnecki, Bartłomiej Kryszak, Dominik Drabik, Tomasz Kajdanowicz, Kamil Mamak, Paweł Preś, Katarzyna Paczkowska, Joachim Sobczuk, Tomasz Zięba, Jan Kocoń, Maciej Piasecki, Przemysław Kazienko
机构
*
Poznan University of Technology(波兹南理工大学)
;
National Cheng Kung University(国立成功大学)
;
Universitas Katolik Musi Charitas Palembang(Palembang 巴厘岛天主教大学)
AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准
Qijie You, Wenkai Yu, Wentao Zhang
机构
*
University of Science and Technology Beijing(北京科技大学)
;
Peking University(北京大学)
;
Zhongguancun Academy(中关村学院)
;
Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))
Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol
面向LLM推理的定向测试:一种受审计约束的协议
Hongmin Li
机构
*
School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所)
;
Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)
CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs
CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯
Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang
DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning
DecompSR:用于组合多跳空间推理分解分析的数据集
Lachlan McPheat, Navdeep Kaur, Robert Blackwell, Alessandra Russo, Anthony G. Cohn, Pranava Madhyastha
机构
*
The Alan Turing Institute(艾伦·图灵研究所)
;
Imperial College London(帝国理工学院伦敦分校)
;
The University of Leeds(利兹大学)
;
City St George’s University of London(伦敦城市圣乔治大学)