Less Is More: Reducing Token Counts Without Compromising Performance
少即是多:在不影响性能的情况下减少词元数量
Gyeongje Cho, Yeonkyoung So, Sangmin Lee, Jaejin Lee
机构
*
Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)
;
Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure
通过整合因果结构改进TabPFN的合成数据生成
Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà
机构
*
Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系)
;
University of Trieste(特里este大学)
;
Department of Engineering and Architecture(工程与建筑系)
;
InSilicoTrials Technologies BV(InSilicoTrials技术公司)
;
Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所)
;
University of Amsterdam(阿姆斯特丹大学)
Comments8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop
CommentsWe found a critical flaw in the prompt complexity metric, which affects the 2D curriculum grid construction and leads to potentially invalid comparisons. Since this undermines our main conclusions, we are withdrawing the paper and will revise the methodology before resubmission
机构
*
School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院)
;
Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)
;
Microsoft Research Asia, Beijing, China(微软亚洲研究院)
;
Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)
专题命中
长上下文与记忆
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Predicting Scale-Up of Metal-Organic Framework Syntheses with Large Language Models
利用大语言模型预测金属有机框架合成的可扩展性
Peter Walther, Hongrui Sheng, Xinxin Liu, Bin Feng, Reid Coyle, Xinhua Yan, Kyle Smith, Harrison Kayal, Shyam Chand Pal, Zhiling Zheng
机构
*
Department of Chemistry, Washington University(华盛顿大学化学系)
;
Fudan University(复旦大学)
;
Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)
;
College of Chemistry and Materials Science, Fujian Normal University(福建师范大学化学与材料科学学院)
;
Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
IMProofBench:在研究级数学证明生成上对人工智能进行基准测试
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Aarhus University(奥胡斯大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL
Commentsv2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器
Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He
机构
*
Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)
;
University of Pittsburgh(匹兹堡大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of Connecticut(康涅狄格大学)
专题命中
评测与基准
:LLM(title,abstract);language model(title,abstract);small language model(title);large language model(abstract)
Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings
丢弃少量偏好可以改变大型语言模型的排名
Jenny Y. Huang, Yunyi Shen, Dennis Wei, Tamara Broderick
机构
*
Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
;
IBM Research(IBM研究院)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG