arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2601.18730 2026-01-27 cs.CL cs.LG 81%

Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale

Reflect: 为大规模宪法对齐的透明原则引导推理

Henry Bell, Caroline Zhang, Mohammed Mobasserul Haque, Dhaval Potdar, Samia Zaman, Brandon Fain

机构 * Duke University(杜克大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 Reflect通过透明推理框架在不需训练数据的情况下提升大语言模型对多样原则的对齐能力,增强安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17627 2026-01-14 cs.CL cs.AI 81%

The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis

思维的演变:通过推理动态分析追踪LLM过度思考

Zihao Wei, Liang Pang, Jiahao Liu, Wenjie Shi, Jingcheng Deng, Shicheng Xu, Zenghao Duan, Fei Sun, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety,Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过分析推理动态,提出RCPD方法以识别LLM推理完成点,减少token使用量同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08098 2026-01-12 cs.CL cs.AI 81%

The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models

思考的成本:多语言下大型语言模型谈判能力、表现与成本的分析

Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩-博兹恩大学语言学系) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Free University of Bozen-Bolzano(博兹恩-博尔扎诺自由大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了多语言环境下大型语言模型谈判能力的表现与成本,发现启用推理能提升谈判效果但增加计算成本,且开源模型在多语言谈判中倾向于使用英语推理。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04254 2026-01-09 cs.AI cs.LG 81%

Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models

中等规模语言模型中多跳上下文推理的扩展趋势

Brady Steele, Micah Katz

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比不同模型的多跳推理能力,发现多代理系统在推理任务中表现优于规则方法,且模型基础能力影响放大效果。

Comments 18 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01332 2026-01-06 cs.CL cs.LG 81%

FLOP-Efficient Training: Early Stopping Based on Test-Time Compute Awareness

高效计算训练:基于测试时间计算意识的提前停止

Hossam Amer, Maryam Dialameh, Hossein Rajabzadeh, Walid Ahmed, Weiwei Zhang, Yang Liu

机构 * Ascend Team, Huawei Technologies, Toronto, Canada(华为技术有限公司,多伦多,加拿大) University of Waterloo, Waterloo, Canada(滑铁卢大学,滑铁卢,加拿大)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于测试时间计算意识的高效训练方法,通过提前停止算法减少训练计算量,同时保持或提升模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01006 2026-01-05 cs.CV cs.AI cs.LG 81%

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Haochen Li, Jiale Zhu, Jiali Chen, Jiaxing Xu, Jiazheng Xu, Jing Chen, Jinghao Lin, Jinhao Chen, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Ruiliang Lyu, Shangqin Tu, Sheng Yang, Shengbiao Meng, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wei Jia, Wenkai Li, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyu Zhang, Xinyue Fan, Xuancheng Huang, Yadong Xue, Yanfeng Wang, Yanling Wang, Yanzi Wang, Yifan An, Yifan Du, Yiheng Huang, Yilin Niu, Yiming Shi, Yu Wang, Yuan Wang, Yuanchang Yue, Yuchen Li, Yusen Liu, Yutao Zhang, Yuting Wang, Yuxuan Zhang, Zhao Xue, Zhengxiao Du, Zhenyu Hou, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06415 2026-01-01 cs.CL cs.LG 81%

PERK: Long-Context Reasoning as Parameter-Efficient Test-Time Learning

PERK:长上下文推理作为参数高效测试时学习

Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PERK通过参数高效测试时学习方法,实现对长上下文的高效推理,显著提升模型性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 81%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10501 2025-12-22 cs.AI cs.LG 81%

PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning

基于概率代理超网采样的可解释和自适应胸片推理系统

Yushi Feng, Junye Du, Yingying Hong, Qifan Wang, Lequan Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15274 2025-12-18 cs.CL cs.AI 81%

Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning

开篇即胜,半途而废:基于前缀优化的强化学习用于大语言模型推理

Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, Chen Gong

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PPPO通过优化LLM推理的前缀部分,提升推理能力,实验显示其在推理任务中表现更优。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25101 2025-11-19 cs.AI cs.CL 81%

KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA

Zhuo Chen, Fei Wang, Zixuan Li, Zhao Zhang, Weiwei Ding, Chuanguang Yang, Yongjun Xu, Xiaolong Jin, Jiafeng Guo

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) School of Computer Science, University of Chinese Academy of Sciences(中国科学院大学计算机科学学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08305 2025-11-12 cs.LG cs.AI 81%

Test-time Diverse Reasoning by Riemannian Activation Steering

Ly Tran Ho Khanh, Dongxuan Zhu, Man-Chung Yue, Viet Anh Nguyen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 19 pages, 6 figures. Accepted for publication at AAAI 2026 (40th AAAI Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07483 2025-11-12 cs.AI cs.LG 81%

Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning

Qianxi He, Qingyu Ren, Shanzhe Lei, Xuhong Wang, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06739 2025-11-11 cs.LG cs.AI 81%

Rank-1 LoRAs Encode Interpretable Reasoning Signals

Jake Ward, Paul Riechers, Adam Shai

机构 * MATS

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12767 2025-11-11 cs.CL cs.AI 81%

R2-KG: General-Purpose Dual-Agent Framework for Reliable Reasoning on Knowledge Graphs

Sumin Jo, Junseong Choi, Jiho Kim, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00079 2025-11-06 cs.CL cs.AI 81%

PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems

Oshayer Siddique, J. M Areeb Uzair Alam, Md Jobayer Rahman Rafy, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in Findings of the Association for Computational Linguistics: IJCNLP-AACL 2025, 23 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20241 2025-11-05 cs.LG cs.AI 81%

DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning

Qi Cao, Ruiyi Wang, Ruiyi Zhang, Sai Ashish Somayajula, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 28 pages, 10 figures, to appear in NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23794 2025-10-27 cs.CL cs.AI 81%

R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning

Yuan Li, Qi Luo, Xiaonan Li, Bufan Li, Qinyuan Cheng, Bo Wang, Yining Zheng, Yuxin Wang, Zhangyue Yin, Xipeng Qiu

机构 * School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20867 2025-10-27 cs.LG cs.AI 81%

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

Jiajun Fan, Roger Ren, Jingyuan Li, Rahul Pandey, Prashanth Gurunath Shivakumar, Ivan Bulyko, Ankur Gandhe, Ge Liu, Yile Gu

机构 * Amazon(亚马逊) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04210 2025-10-24 cs.AI cs.CL 81%

Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models

Soumya Suvra Ghosal, Souradip Chakraborty, Avinash Reddy, Yifu Lu, Mengdi Wang, Dinesh Manocha, Furong Huang, Mohammad Ghavamzadeh, Amrit Singh Bedi

机构 * University of Maryland(马里兰大学) Princeton University(普林斯顿大学) Capital One(Capital One公司) Amazon AGI University of Central Florida(佛罗里达中央大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15275 2025-10-24 cs.AI cs.LG 81%

Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning

Jie Cheng, Gang Xiong, Ruixi Qiao, Lijun Li, Chao Guo, Junle Wang, Yisheng Lv, Fei-Yue Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tencent(腾讯) Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院) DeSci Center of Parallel Intelligence, Obuda University(并行智能德Sci中心,奥布达大学) Research Center for Chinese Economics and Social Security, University of Chinese Academy of Sciences(中国经济社会安全研究中心,中国科学院大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15674 2025-10-20 cs.LG cs.AI 81%

CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning

Yung-Chen Tang, Pin-Yu Chen, Andrea Cavallaro

机构 * EPFL(瑞士联邦理工学院) Idiap Research Institute(Idiap研究所) IBM Research(IBM研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15444 2025-10-20 cs.LG cs.AI 81%

A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning

Zhi Zhou, Yuhao Tan, Zenan Li, Yuan Yao, Lan-Zhe Guo, Yu-Feng Li, Xiaoxing Ma

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系,瑞士) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07685 2025-10-10 cs.LG cs.CL 81%

LiveThinking: Enabling Real-Time Efficient Reasoning for AI-Powered Livestreaming via Reinforcement Learning

Yuhan Sun, Zhiwei Huang, Wanqing Cui, Shaopan Xiong, Yazhi Guo, Meiguang Jin, Junfeng Ma

机构 * Taobao \& Tmall Group of Alibaba Hangzhou Zhejiang China Taobao \& Tmall Group of Alibaba Beijing China ROLL Team of Alibaba Hangzhou Zhejiang China Taobao \& Tmall Group of Alibaba ROLL Team of Alibaba

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04028 2025-10-07 cs.LG cs.AI 81%

The Debate on RLVR Reasoning Capability Boundary: Shrinkage, Expansion, or Both? A Two-Stage Dynamic View

Xinhao Yao, Lu Yu, Xiaolin Hu, Fengwei Teng, Qing Cui, Jun Zhou, Yong Liu

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团) Xiamen University(厦门大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01459 2025-10-03 cs.LG cs.CL 81%

LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning

Weizhe Chen, Sven Koenig, Bistra Dilkina

机构 * University of Southern California(南加州大学) University of California, Irvine(加州大学尔湾分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00768 2025-10-03 cs.AI cond-mat.mtrl-sci cs.CL 81%

Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling

Lee Hyun, Sohee Yoon, Jinwoo Park, Sue In Chae, Seongeon Park, Jooyeon Ahn, Yebin Jung, Youjung Chung, Hogeun Chang, Sujin Park, Myeonginn Kang, Jina Kim, Ho-Gyeong Kim, Myeonghun Jeong

机构 * Materials AI Lab (AI Center), Samsung Electronics(材料AI实验室(AI中心),三星电子) Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所(SAIT))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25604 2025-10-01 cs.CL cs.LG 81%

RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance

Tianlang Chen, Minkai Xu, Jure Leskovec, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments 27 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18535 2025-09-30 cs.CL cs.LG 81%

TRACE Back from the Future: A Probabilistic Reasoning Approach to Controllable Language Generation

Gwen Yidou Weng, Benjie Wang, Guy Van den Broeck

机构 * ucla(美国加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 42nd International Conference on Machine Learning (ICML). 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23291 2025-09-30 cs.CL cs.LG 81%

Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces

Joseph Marvin Imperial, Harish Tayyar Madabushi

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏