arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2510.17028 2025-10-21 cs.CL cs.LG 62%

Mapping from Meaning: Addressing the Miscalibration of Prompt-Sensitive Language Models

Kyle Cox, Jiawei Xu, Yikun Han, Rong Xu, Tianhao Li, Chi-Yang Hsu, Tianlong Chen, Walter Gerych, Ying Ding

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence. 39, 22 (Apr. 2025), 23696-23703

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15707 2025-10-21 cs.LG cs.AI 62%

Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling

Xinglin Wang, Yiwei Li, Shaoxiong Feng, Peiwen Yuan, Yueqi Zhang, Jiayi Shi, Chuyi Tan, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学) Xiaohongshu Inc(小红书公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15502 2025-10-20 cs.LG cs.AI 62%

The Road Less Traveled: Enhancing Exploration in LLMs via Sequential Sampling

Shijia Kang, Muhan Zhang

机构 * Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08892 2025-10-13 cs.CL cs.AI 62%

Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR

Haomin Zhuang, Yujun Zhou, Taicheng Guo, Yue Huang, Fangxu Liu, Kai Song, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) ByteDance(字节跳动)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07535 2025-10-10 cs.CL cs.AI 62%

OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs

Jaeseong Lee, seung-won hwang, Aurick Qiao, Gabriele Oliaro, Ye Wang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03540 2025-10-09 cs.CL cs.AI 62%

Improving Factuality in LLMs via Inference-Time Knowledge Graph Construction

Shanglin Wu, Lihui Liu, Jinho D. Choi, Kai Shu

机构 * Emory University(埃默里大学) Wayne State University(韦恩州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05251 2025-10-08 cs.CL cs.LG 62%

Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning

Chenghao Yang, Lin Gui, Chenxiao Yang, Victor Veitch, Lizhu Zhang, Zhuokai Zhao

机构 * Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Department of Statistics, University of Chicago(芝加哥大学统计系) Toyota Technological Insitute at Chicago(芝加哥丰田技术研究所) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Meta AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Codebase: https://github.com/yangalan123/EAD-RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03275 2025-10-07 cs.LG cs.AI cs.CV 62%

SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size

Junhao Xia, Ming Zhao, Limin Xiao, Xiujun Zhang

机构 * Dept of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学与技术国家研究中心,北京,中国)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17251 2025-10-02 cs.LG cs.AI 62%

Training-free LLM Verification via Recycling Few-shot Examples

Dongseok Lee, Jimyung Hong, Dongyoung Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20162 2025-09-30 cs.CL cs.AI 62%

Embedding Domain Knowledge for Large Language Models via Reinforcement Learning from Augmented Generation

Chaojun Nie, Jun Zhou, Guanxiang Wang, Shisong Wu, Zichen Wang

机构 * Laboratory of Speech and Intelligent Information Processing, Institute of Acoustics, Chinese Academy of Sciences(语音与智能信息处理实验室,声学研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) China Southern Power Grid Artificial Intelligence Technology Co., Ltd.(中国南方电网人工智能技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Corrected author name spelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21403 2025-09-29 cs.LG cs.CL 62%

LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?

Rushil Gupta, Jason Hartford, Bang Liu

机构 * DIRO, Université de Montréal & Institut Courtois(蒙特利尔大学DIRO与Courtois研究所) Mila - Quebec AI Institute(魁北克人工智能研究所) The University of Manchester(曼彻斯特大学) Valence Labs(Valence实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19676 2025-09-25 cs.SD cs.AI cs.LG eess.AS 62%

Thinking While Listening: Simple Test Time Scaling For Audio Classification

Prateek Verma, Mert Pilanci

机构 * Department of Electrical Engineering Stanford University Stanford, CA 94305, USA(电气工程系 斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 3 figures, 2 Tables, ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11006 2025-09-22 cs.LG cs.CL 62%

Entropy-Regularized Process Reward Model

Hanning Zhang, Pengcheng Wang, Shizhe Diao, Yong Lin, Rui Pan, Hanze Dong, Dylan Zhang, Pavlo Molchanov, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) NVIDIA(英伟达) Princeton University(普林斯顿大学) Salesforce Research(Salesforce研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Upate TMLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10857 2025-09-18 cs.CL cs.AI 62%

Mirror-Consistency: Harnessing Inconsistency in Majority Voting

Siyuan Huang, Zhiyuan Ma, Jintao Du, Changhua Meng, Weiqiang Wang, Zhouhan Lin

机构 * Shanghai Jiaotong University(上海交通大学) Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13305 2025-09-17 cs.LG cs.CL 62%

WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning

Kuan Li, Zhongwang Zhang, Huifeng Yin, Rui Ye, Yida Zhao, Liwen Zhang, Litu Ou, Dingchu Zhang, Xixi Wu, Jialong Wu, Xinyu Wang, Zile Qiao, Zhen Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12886 2025-09-17 cs.CL cs.AI 62%

The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations

Yubo Zhu, Dongrui Liu, Zecheng Lin, Wei Tong, Sheng Zhong, Jing Shao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07098 2025-09-10 cs.AI cs.CL 62%

Instruction Agent: Enhancing Agent with Expert Demonstration

Yinheng Li, Hailey Hultquist, Justin Wagle, Kazuhito Koishida

机构 * Microsoft(微软公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05007 2025-09-09 cs.AI cs.CL 62%

Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework

Jie Chen, Jinhao Jiang, Yingqian Min, Zican Dong, Shijie Wang, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05735 2025-09-09 cs.LG cs.AI 62%

Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies

Jiaqi Chen, Ji Shi, Cansu Sancaktar, Jonas Frey, Georg Martius

专题命中 测试时计算 :self-correction(abstract);分类 cs.AI、cs.LG

Comments Accepted at Reinforcement Learning Conference (RLC 2025); Code available at: https://github.com/swsychen/Offline_vs_Online_in_MBRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05385 2025-09-09 cs.CL cs.AI 62%

A Lightweight Framework for Trigger-Guided LoRA-Based Self-Adaptation in LLMs

Jiacheng Wei, Faguo Wu, Xiao Zhang

机构 * SAGE: A Lightweight Framework for Trigger-Guided LoRA-Based Self-Adaptation in LLMs(SAGE:轻量级框架)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21228 2025-09-01 cs.CL cs.AI 62%

Decoding Memories: An Efficient Pipeline for Self-Consistency Hallucination Detection

Weizhi Gao, Xiaorui Liu, Feiyi Wang, Dan Lu, Junqi Yin

机构 * ORNL(橡树岭国家实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17445 2025-08-26 cs.LG cs.CL 62%

TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling

Yizhi Li, Qingshui Gu, Zhoufutu Wen, Ziniu Li, Tianshun Xing, Shuyue Guo, Tianyu Zheng, Xin Zhou, Xingwei Qu, Wangchunshu Zhou, Zheng Zhang, Wei Shen, Qian Liu, Chenghua Lin, Jian Yang, Ge Zhang, Wenhao Huang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15790 2025-08-25 cs.CL cs.AI 62%

KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration

Nan Wang, Yongqi Fan, yansha zhu, ZongYu Wang, Xuezhi Cao, Xinyan He, Haiyun Jiang, Tong Ruan, Jingping Liu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10995 2025-08-19 cs.CL cs.LG 62%

Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling

Tejomay Kishor Padole, Suyash P Awate, Pushpak Bhattacharyya

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Bombay(计算机科学与工程系,印度理工学院,孟买)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

Comments Accepted as a main conference submission in the European Conference on Artificial Intelligence (ECAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17988 2025-08-06 cs.LG cs.AI 62%

Towards Revealing the Effectiveness of Small-Scale Fine-tuning in R1-style Reinforcement Learning

Yutong Chen, Jiandong Gao, Ji Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20131 2025-08-05 cs.LG cs.AI cs.IT math.IT 62%

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Preprint (draft)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01951 2025-07-10 cs.LG cs.CL 62%

Test-Time Scaling with Reflective Generative Model

Zixiao Wang, Yuxin Wang, Xiaorui Wang, Mengting Xing, Jie Gao, Jianjun Xu, Guangcan Liu, Chenhui Jin, Zhuo Wang, Shengzhuo Zhang, Hongtao Xie

机构 * MetaStone-AI USTC

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06444 2025-07-10 cs.LG cs.AI cs.CR 62%

Saffron-1: Safety Inference Scaling

Ruizhong Qiu, Gaotang Li, Tianxin Wei, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Previous title: "Saffron-1: Towards an Inference Scaling Paradigm for LLM Safety Assurance"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17670 2025-07-09 cs.LG cs.AI 62%

Towards General Continuous Memory for Vision-Language Models

Wenyi Wu, Zixuan Song, Kun Zhou, Yifei Shao, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01327 2025-07-03 cs.LG cs.AI 62%

Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy

Xiaoyun Zhang, Jingqing Ruan, Xing Ma, Yawen Zhu, Jiansong Chen, Ke Zeng, Xunliang Cai

机构 * Meituan(美团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 6 figures, submitted to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏