arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2602.09276 2026-06-01 cs.CL cs.AI cs.LG 87%

Effective Reasoning Chains Reduce Intrinsic Dimensionality

有效推理链降低内在维度

Archiki Prasad, Mandar Joshi, Kenton Lee, Mohit Bansal, Peter Shaw

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过内在维度量化推理链有效性,发现有效推理策略能降低任务内在维度,并在GSM8K上验证其与泛化性能的强负相关。

Comments ICML (spotlight) camera-ready; 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30757 2026-06-01 cs.LG 83%

Chain-of-Thought and Compressed Looped Transformers: A Memory-Budget Separation

思维链与压缩循环Transformer:记忆预算分离

Haozhou Zhang

机构 * Department of Mathematics and Statistics(数学与统计学系)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文通过比较三种记忆机制(压缩潜在循环、全序列状态循环和思维链暂存区),证明压缩循环Transformer的记忆预算限制其推理能力,而思维链通过扩展上下文实现更强的问题求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30713 2026-06-01 cs.LG cs.CV cs.MM 83%

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

多样性至关重要:重新审视视觉-语言模型中的测试时计算

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30451 2026-06-01 cs.LG 83%

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

VeriGate: 验证器门控的步骤级监督用于GRPO

Aakriti Agrawal, Minghui Liu, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出VeriGate方法,通过验证器门控的步骤级监督扩展GRPO,解决稀疏奖励和信用分配问题,在多个推理基准上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19049 2026-06-01 cs.CL cs.LG 81%

IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning

IAPO:面向令牌高效推理的信息感知策略优化

Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su, Xiaoqing Wang, Qi Guo, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) LinkedIn Inc.(LinkedIn公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出信息感知策略优化框架IAPO,通过基于条件互信息的令牌级优势塑造,在提升推理准确率的同时将推理长度减少高达36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27255 2026-06-01 cs.CL cs.AI 79%

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

Pair-In, Pair-Out: 面向高效LLM的潜在多令牌预测

Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Platform, Xiaohongshu Inc.(小红书人工智能平台) University of Electronic Science and Technology of China(电子科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出Pair-In, Pair-Out (PIPO)方法,通过统一潜在压缩和多令牌预测,并训练轻量级置信度头消除验证器开销,在保持可靠性的同时实现推理加速。

Comments Project Page: GitHub.com/RedAI-Infra/PIPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19262 2026-06-01 cs.CL cs.AI 79%

Empirical Characterization of Inference-Time Elicited Probability Transformations in Large Language Models

大型语言模型中推理时引发的概率变换的经验表征

Mike Farmer, Abhinav Kochar, Yugyung Lee

机构 * Bloch School of Management, Regnier Institute for Entrepreneurship & Innovation, University of Missouri–Kansas City(布洛赫管理学院、雷尼创业与创新研究所、密苏里大学堪萨斯城分校) Department of Computer Science, School of Science and Engineering, University of Missouri–Kansas City(计算机科学系、科学与工程学院、密苏里大学堪萨斯城分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过经验观察发现,在多种推理时流程(如思维链、自我细化、检索增强和验证器引导修订)下,候选答案的概率变换遵循近似的对数比率关系,并分析了其系数变化和鲁棒性。

Comments 22 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02919 2026-06-01 cs.CL 77%

Self-Reflective Generation at Test Time

测试时的自反生成

Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出SRGen框架,通过动态熵阈值识别高不确定性token并训练校正向量,在测试时进行自反生成以纠正概率分布,提升大模型推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31561 2026-06-01 cs.CL 70%

What Am I Missing? Question-Answering as Hidden State Probing

我遗漏了什么?将问答作为隐藏状态探测

Chu Fei Luo, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电子与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出将问答作为推理时干预手段,通过学生-教师框架探测隐藏状态,发现提问前的隐藏状态可预测最终正确性,并设计门控策略优化提问时机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31126 2026-06-01 cs.CL cs.AI cs.LG 67%

Not All Synthetic Data Is Yours to Learn From

并非所有合成数据都适合学习

Sina Alemohammad, Li Chen, Richard G. Baraniuk, Zhangyang Wang

机构 * ECE Department(电子工程系) Apple(苹果公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Rice University(里奇大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究无提示、无教师、无验证器、无奖励模型的自训练中,语言模型能否从自身生成的文本中学习,发现合成数据与学生之间的兼容性是关键,并揭示了能力与逐字记忆可分离的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31176 2026-06-01 cs.LG cs.DS 57%

Retriever Portfolios: A Principled Approach to Adaptive RAG

检索器组合:一种自适应RAG的原则性方法

Miltiadis Stouras, Vincent Cohen-Addad, Silvio Lattanzi, Ola Svensson

机构 * EPFL(瑞士联邦理工学院) Google Research(谷歌研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 提出从大量候选检索器中自动选择小型多样子集(组合)的方法,通过期望最优k目标优化查询分布,实现自适应RAG,在多个QA基准上优于单检索器和朴素多检索器基线,并降低延迟和令牌成本。

Comments Accepted at ICML 2026. Code available at: https://github.com/mstou/retriever-portfolios

详情

展开后加载摘要…

URL PDF HTML 收藏