arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2502.12663 2025-09-29 cs.CL 79%

Demystifying Multilingual Chain-of-Thought in Process Reward Modeling

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Monash University(墨尔本大学)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11474 2025-09-23 cs.CL 79%

Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards

Jaehoon Yun, Jiwoong Sohn, Jungwoo Park, Hyunjae Kim, Xiangru Tang, Yanjun Shao, Yonghoe Koo, Minhyeok Ko, Qingyu Chen, Mark Gerstein, Michael Moor, Jaewoo Kang

机构 * Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院) Yale University(耶鲁大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰雅大学医学院) University of Ulsan College of Medicine(釜山大学医学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15512 2025-09-10 cs.CL 79%

Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models

Kaiyan Chang, Yonghao Shi, Chenglong Wang, Hang Zhou, Chi Hu, Xiaoqian Liu, Yingfeng Luo, Yuan Ge, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) ByteDance(字节跳动)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025. Code: https://github.com/Lucky-259/Hybrid_TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02401 2025-09-03 cs.AI 79%

Towards Agents That Know When They Don't Know: Uncertainty as a Control Signal for Structured Reasoning

Josefa Lia Stoisser, Marc Boubnovski Martell, Lawrence Phillips, Gianluca Mazzoni, Lea Mørch Harder, Philip Torr, Jesper Ferkinghoff-Borg, Kaspar Martens, Julien Fauqueur

机构 * Novo Nordisk(诺和制药) University of Oxford(牛津大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00258 2025-08-26 cs.AI 79%

Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs

Qianqi Yan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) eBay

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15202 2025-08-22 cs.CL 79%

Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models

Yuanchen Zhou, Shuo Jiang, Jie Zhu, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云量子金融团队)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09968 2025-08-14 cs.LG cs.CV 79%

Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models

Luca Eyring, Shyamgopal Karthik, Alexey Dosovitskiy, Nataniel Ruiz, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center of Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑 Helmholtz 中心) University of Tübingen(图宾根大学) Inceptive(Inceptive 公司) Google(谷歌公司)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.LG

Comments Project page: https://noisehypernetworks.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23170 2025-08-05 cs.LG 79%

BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning

Jinan Zhou, Rajat Ghosh, Vaishnavi Bhargava, Debojyoti Dutta, Aryan Singhal

机构 * Nutanix

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15428 2025-07-22 cs.CV cs.AI 79%

EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent

Jiaao Li, Kaiyuan Li, Chen Gao, Yong Li, Xinlei Chen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06829 2025-07-10 cs.CL 79%

Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework

Zenan Xu, Zexuan Qiu, Guanhua Huang, Kun Li, Siheng Li, Chenchen Zhang, Kejiao Li, Qi Yi, Yuhao Jiang, Bo Zhou, Fengzong Lian, Zhanhui Kang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 13 pages, 5 fiures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01921 2025-07-03 cs.CL 79%

NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks

Yang Li, Youssef Emad, Karthik Padthe, Jack Lanchantin, Weizhe Yuan, Thao Nguyen, Jason Weston, Shang-Wen Li, Dong Wang, Ilia Kulikov, Xian Li

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06737 2025-06-30 cs.LG 79%

VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data

Thomas Zeng, Shuibai Zhang, Shutong Wu, Christian Classen, Daewon Chae, Ethan Ewer, Minjae Lee, Heeju Kim, Wonjun Kang, Jackson Kunde, Ying Fan, Jungtaek Kim, Hyung Il Koo, Kannan Ramchandran, Dimitris Papailiopoulos, Kangwook Lee

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12928 2025-06-17 cs.AI 79%

Scaling Test-time Compute for LLM Agents

King Zhu, Hanhao Li, Siwei Wu, Tianshun Xing, Dehua Ma, Xiangru Tang, Minghao Liu, Jian Yang, Jiaheng Liu, Yuchen Eleanor Jiang, Changwang Zhang, Chenghua Lin, Jun Wang, Ge Zhang, Wangchunshu Zhou

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00027 2025-06-03 cs.CL 79%

From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling

Zhengyu Chen, Yudong Wang, Teng Xiao, Ruochen Zhou, Xuesheng Yang, Wei Wang, Zhifang Sui, Jingang Wang

机构 * Meituan Inc.(美团公司) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Pennsylvania State University(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24863 2025-06-02 cs.CL 79%

AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time

Junyu Zhang, Runpei Dong, Han Wang, Xuying Ning, Haoran Geng, Peihao Li, Xialin He, Yutong Bai, Jitendra Malik, Saurabh Gupta, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(伯克利加州大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17667 2025-05-28 cs.CL 79%

QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning

Fanqi Wan, Weizhou Shen, Shengyi Liao, Yingcheng Shi, Chenliang Li, Ziyi Yang, Ji Zhang, Fei Huang, Jingren Zhou, Ming Yan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17218 2025-05-26 cs.AI 79%

Effective Reinforcement Learning for Reasoning in Language Models

Lianghuan Huang, Shuo Li, Sagnik Anupam, Insup Lee, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14432 2025-05-21 cs.IR cs.CL 79%

Rank-K: Test-Time Reasoning for Listwise Reranking

Eugene Yang, Andrew Yates, Kathryn Ricci, Orion Weller, Vivek Chari, Benjamin Van Durme, Dawn Lawrie

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11049 2025-05-19 cs.AI cs.CR 79%

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning

Yue Liu, Shengfang Zhai, Mingzhe Du, Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang, Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13292 2025-04-11 cs.CL 79%

Refining Answer Distributions for Improved Large Language Model Reasoning

Soumyasundar Pal, Didier Chételat, Yingxue Zhang, Mark Coates

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05345 2025-04-09 cs.LG cs.DB 79%

ZeroED: Hybrid Zero-shot Error Detection through Large Language Model Reasoning

Wei Ni, Kaihang Zhang, Xiaoye Miao, Xiangyu Zhao, Yangyang Wu, Yaoshu Wang, Jianwei Yin

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23395 2025-04-01 cs.SD cs.AI eess.AS 79%

Scaling Auditory Cognition via Test-Time Compute in Audio Language Models

Ting Dang, Yan Gao, Hong Jia

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21295 2025-03-28 cs.CL 79%

R-PRM: Reasoning-Driven Process Reward Modeling

Shuaijie She, Junxiao Liu, Yifeng Liu, Jiajun Chen, Xin Huang, Shujian Huang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments The project is available at https://github.com/NJUNLP/R-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18205 2025-03-27 cs.SE cs.AI 79%

Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging

Wei Zhang, Xiangyuan Guan, Lu Yunhong, Jie Zhang, Shuangyong Song, Xianfu Cheng, Zhenhe Wu, Zhoujun Li

专题命中 测试时计算 :chain-of-thought(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21321 2025-03-25 cs.CL cs.CV 79%

LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Komal Kumar, Tajamul Ashraf, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Mubarak Shah, Ming-Hsuan Yang, Phillip H. S. Torr, Fahad Shahbaz Khan, Salman Khan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 32 pages, 7 figures, 3 tables, 377 references. Github Repo: https://github.com/mbzuai-oryx/Awesome-LLM-Post-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10291 2025-03-14 cs.CV cs.CL 79%

VisualPRM: An Effective Process Reward Model for Multimodal Reasoning

Weiyun Wang, Zhangwei Gao, Lianjie Chen, Zhe Chen, Jinguo Zhu, Xiangyu Zhao, Yangzhou Liu, Yue Cao, Shenglong Ye, Xizhou Zhu, Lewei Lu, Haodong Duan, Yu Qiao, Jifeng Dai, Wenhai Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08551 2025-03-12 cs.AI 79%

Reasoning and Sampling-Augmented MCQ Difficulty Prediction via LLMs

Wanyong Feng, Peter Tran, Stephen Sireci, Andrew Lan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02875 2025-03-05 cs.CL 79%

The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models

Ke Ji, Jiahao Xu, Tian Liang, Qiuzhi Liu, Zhiwei He, Xingyu Chen, Xiaoyuan Liu, Zhijie Wang, Junying Chen, Benyou Wang, Zhaopeng Tu, Haitao Mi, Dong Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20379 2025-02-28 cs.AI 79%

Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers

Shalev Lifshitz, Sheila A. McIlraith, Yilun Du

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09955 2025-02-17 cs.AI 79%

Diverse Inference and Verification for Advanced Reasoning

Iddo Drori, Gaston Longhitano, Mao Mao, Seunghwan Hyun, Yuke Zhang, Sungjun Park, Zachary Meeks, Xin-Yu Zhang, Ben Segev, Howard Yong, Nakul Verma, Avi Shporer, Alon Amit, Madeleine Udell

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments 165 pages

详情

展开后加载摘要…

URL PDF HTML 收藏