IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
IMProofBench:在研究级数学证明生成上对人工智能进行基准测试
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Aarhus University(奥胡斯大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL
Commentsv2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated
机构
*
Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院)
;
Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所)
;
Beijing University of Technology, China(北京理工大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation
Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, Hongmei Fei, Xiwen Cao, Ting Xiao, Qi Wang, Huanbo Jin, Jiaming Gu, Quan Lu, Zhe Liu
机构
*
Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education, East China University of Science and Technology, Shanghai, CN(能源化工过程智能制造教育部重点实验室,东华大学,上海,中国)
;
Department of Computer Science and Engineering, East China University of Science and Technology, Shanghai, CN(东华大学计算机科学与工程系,上海,中国)
;
Department of Laboratory Medicine, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, CN(复旦大学附属瑞金医院检验医学科,上海,中国)
;
School of Information Science and Technology, Shihezi University, Shihezi, CN(石河子大学信息科学与技术学院,石河子,中国)
机构
*
Purdue University(普渡大学)
;
Baruch College, City University of New York(纽约市立大学巴鲁克学院)
;
The Ohio State University(俄亥俄州立大学)
;
AI Agent Lab(AI Agent实验室)
;
Appcubic
;
Emory University(埃默里大学)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
通过群体相对策略优化在结构因果模型中 grounding 多跳推理
Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo
机构
*
School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国)
;
Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国)
;
Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
IfcLLM: Natural Language Querying of IFC Models through Complementary Relational and Graph Representations
一种融合关系和图表示的IFC模型自然语言查询混合框架
Rabindra Lamsal, Sisi Zlatanova, Haowen Xu, Yafei Sun, Johnson Xuesong Shen
机构
*
GRID Lab, School of Built Environment, The University of New South Wales(建筑环境学院,新南威尔士大学GRID实验室)
;
School of Civil and Environmental Engineering, The University of New South Wales(土木与环境工程学院,新南威尔士大学)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
EndoCoT:扩散模型中的内生思维链推理扩展
Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu, Beichen Zhang, Kai Chen, Yuhang Zang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Xi’an Jiaotong University(西安交通大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Jiaotong University(上海交通大学)
;
Fudan University(复旦大学)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL
CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs
CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯
Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang
机构
*
Stanford University(斯坦福大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
CommentsLNCS Proceedings Submitted Version. 17 pages. Accepted and presented at VERIFAI-2026: The Interplay between Artificial Intelligence and Software Verification LASER center, Villebrumier, France, March 8-11, 2026
Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design
通过奖励设计解耦多模态大语言模型中的感知与推理
Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng
机构
*
Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系)
;
Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)
;
Independent Researcher(独立研究者)
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
North Automatic Control Technology Institute(北自动控制技术研究所)
;
Shenzhen Institute for Advanced Study, UESTC(深圳先进研究 institute, 电子科技大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI