IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
IMProofBench:在研究级数学证明生成上对人工智能进行基准测试
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Aarhus University(奥胡斯大学)
Commentsv2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated
Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework
我们能信任大语言模型的逻辑吗?通过基于图的框架量化不确定性、连贯性和鲁棒性
Riccardo Revalor, Jalees Rehman, Debjit Pal
机构
*
Department of Electrical and Computer Engineering(电气与计算机工程系)
;
Department of Biochemistry and Molecular Genetics(生物化学与分子遗传学系)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
玩禅道世界:在主动视觉概念归纳中挑战人工智能代理
Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting
机构
*
AIML Lab, TU Darmstadt(人工智能机器学习实验室,达姆施塔特工业大学)
;
Hessian Center for AI (hessian.AI)(黑森州人工智能中心)
;
Psychology of Information Processing, TU Darmstadt(信息处理心理学,达姆施塔特工业大学)
;
Centre for Cognitive Science, TU Darmstadt(认知科学中心,达姆施塔特工业大学)
;
Cornell University(康奈尔大学)
;
Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所,SIC组)
;
German Center for AI (DFKI)(德国人工智能研究中心)
Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability
Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
Switch-Reasoner:通过强化学习在多任务混合中学习何时思考
Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye
机构
*
Wuhan University(武汉大学)
;
Xiaomi Inc(小米公司)
;
Wuhan University of Technology(武汉理工大学)
;
Nanyang Technological University(南洋理工大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction
用于多模态肺癌生存预测的CT-CLIP表示
Sofie Allgöwer, Mikael Johansson, Andreas Hallqvist, Jonas Andersson, Åse Johnsson, Ida Häggström, Jennifer Alvén
机构
*
Chalmers University of Technology(查尔姆斯理工大学)
;
Umeå University(于默奥大学)
;
Sahlgrenska University Hospital(萨尔格伦斯卡大学医院)
;
Sahlgrenska Academy at Gothenburg University(哥德堡大学萨尔格伦斯卡学院)
Search-based Testing of Vision Language Models for In-Car Scene Understanding
基于搜索的车内场景理解视觉语言模型测试
Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco
机构
*
BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)