arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-19 至 2026-05-19 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 21 篇

2605.17672 2026-05-19 cs.CL 85%

Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

停止当推理收敛:用于推理模型的语义保留早退出

Dehai Min, Giovanni Vaccarino, Huiyi Chen, Yongliang Wu, Gal Yona, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Google Research(谷歌研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Politecnico di Milano(米兰理工学院)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出PUMA框架,通过识别推理层面的语义冗余信号,实现语义保留的早退出,从而在保持准确性和推理链完整性的同时减少token消耗。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15177 2026-05-19 cs.AI 85%

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink: 通过布拉德利-蒂尔利聚合实现并行推理

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究提出OpenDeepThink框架,通过布拉德利-蒂尔利聚合方法在测试时扩展计算资源,以提高大语言模型的推理能力,通过并行选择候选方案并消除选择瓶颈,从而提升模型在Codeforces等领域的表现。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01857 2026-05-19 cs.AI 85%

Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning

通过逆强化学习学习推理奖励从专家示范

Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 测试时计算 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本文提出了一种名为Reasoning Adversarial Inverse Reinforcement Learning (R-AIRL)的方法,通过逆强化学习从专家示范中学习推理奖励,以克服传统监督微调的局限性,并在多个数据集上展示了其在训练和推理过程中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14004 2026-05-19 cs.CL 84%

Early Stopping Chain-of-thoughts in Large Language Models

大语言模型中的早期停止思维链

Minjia Mao, Bowen Yin, Yu Zhu, Xiao Fang

机构 * University of Delaware(德克萨斯大学) Peking University(北京大学)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07292 2026-05-19 cs.AI cs.CL cs.CV 84%

EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis

EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断

Yi Tang, Kai-Ni Wang, Yang Chen, Xiaopu He, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。

Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE 79%

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22297 2026-05-19 cs.CL 79%

Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate

从自我辩论中学习:为多智能体辩论准备推理模型

Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SDRL框架,通过自我辩论训练使模型具备独立问题解决能力和多智能体辩论中的多样化推理处理能力,实验表明其在多辩论协议和智能体配置下均能提升多智能体辩论性能和单模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17104 2026-05-19 cs.AI 79%

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

具有科学逻辑性的方法论:LLM推理的实践:物理学

Zhaoxin Yu, Nan Xu, Kun Chen, Jiahao Zhao, Lei Wang, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China Beijing Wenge Technology Co., Ltd, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16899 2026-05-19 cs.CV 78%

LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map

LASAR:迈向基于潜在认知图的时空推理

Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出LASAR架构,通过双记忆系统维护事件经历和语义认知图,并引入ST-CRL对比目标训练该架构,以提升长距离碎片化经验中对细粒度空间关系的编码能力,在标准VLN-CE和VSI-Bench基准上实现了零样本泛化能力的2%-3.5%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-05-19 cs.AI cs.CL cs.LG 75%

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 56 pages, 27 figures, 4 tables. Code: https://github.com/facebookresearch/gim ; Dataset: https://huggingface.co/datasets/facebook/gim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02218 2026-05-19 cs.LG cs.AI cs.CL cs.IT math.IT 75%

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

仅在自我合成管道确保可学习信息增益时,自我博弈才会进化

Wei Liu, Siya Qi, Yali Du, Yulan He

机构 * King's College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实验揭示可持续自我进化需要可学习信息递增的自我合成数据管道,提出自我进化LLM的三重角色及系统设计,解决自我博弈停滞问题。

Comments 10 pages, 6 figures, 7 formulas, accepted by ICML 2026 position paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18703 2026-05-19 cs.CL cs.LG 62%

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体

Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang, Xiao Zhu, Yinhong Liu, Boyu Zhu, Baiyu Huang, Chao Chen, Heyuan Deng, Fei Mi, Lifeng Shang, Xingshan Zeng, Zhijiang Guo

机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) University of Cambridge(剑桥大学) UCL(伦敦大学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18374 2026-05-19 cs.LG cs.AI 62%

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

超越推理时间搜索:强化学习合成可重用求解器

Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

机构 * ETH Zürich(苏黎世联邦理工学院) University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了强化学习能否将组合优化的推理成本转移到代码LLM的权重中,从而合成可重用的求解器。通过Synergistic Dependency Selection问题,研究发现强化学习能有效生成约束感知的模拟退火模板,并在多个领域展示出更高的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL 62%

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16787 2026-05-19 cs.LG cs.CL 62%

The Unlearnability Phenomenon in RLVR for Language Models

在语言模型中RLVR的不可学习现象

Yulin Chen, He He, Chen Zhao

机构 * New York University(纽约大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了RLVR在提升大语言模型推理能力中的学习动态,发现即使存在正确回放,某些难例仍无法学习,揭示了当前RL方法在推理任务中的根本限制。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08141 2026-05-19 cs.LG 57%

SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training

SCOPE-RL: 稳定和定量控制强化学习后训练中的策略熵

Chen Wang, Zhaochun Li, Jionghao Bai, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SCOPE-RL框架,通过温度自适应的正样本构造正则化项,稳定并定量控制强化学习后训练中的策略熵,实验表明其在Pass@1和Pass@$k$任务上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18031 2026-05-19 quant-ph cs.AI 57%

Quantum Sidecar Architectures for Hybrid AI Training and Inference: Stateful Protected Registers, Stateless Reset-and-Reprepare Circuits and Quantum Weight-State Outlook

用于混合AI训练和推理的量子Sidecar架构:状态保护寄存器、无状态重置和重新准备电路以及量子权重状态展望

Y. Mo, G. D. Su

机构 * Independent Researcher(独立研究者;BroadLink公司) BroadLink Co., Ltd.(杭州电子科技大学副教授) Associate Professor, Hangzhou Dianzi University

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于未来混合AI训练和推理的量子Sidecar架构家族,通过状态保护寄存器和无状态重置和重新准备模式,为优化器侧采样、适配器或专家选择、检索、路由和推理路径提案提供有界信号生成器,并引入了量子权重状态Sidecar作为受限的量子表示。

Comments 14 pages, 8 figures. Architecture and small-scale simulation study; no hardware experiment or quantum-advantage claim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 57%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16462 2026-05-19 cs.CR cs.AI 57%

Asking Back: Interaction-Layer Antidistillation Watermarks

反向提问:交互层反知识蒸馏水印

Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出交互层反知识蒸馏水印,通过教师模型的行为特征进行水印,验证其在不同模型上的有效性与鲁棒性。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18311 2026-05-19 cs.HC 50%

Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?

LLM模拟偏好中的扭曲视角:AI是否能误导设计?

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 测试时计算 :reasoning(abstract)

AI总结 本研究探讨了LLM驱动的模拟方法所表达的设计偏好与真实用户偏好的一致性,发现LLM模拟在多个操纵下均存在系统性差异,其合成解释缺乏真实深度和细微差别,主要通过关注通用属性、特定元素、详述和过度赞扬等模式来替代。

详情

展开后加载摘要…

URL PDF HTML 收藏