arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2602.03143 2026-02-04 cs.LG cs.AI cs.CL stat.ML 67%

Self-Hinting Language Models Enhance Reinforcement Learning

自我提示语言模型增强强化学习

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian

机构 * Microsoft Research(微软研究院) Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE通过注入自我提示提升GRPO在稀疏奖励下的表现,有效增强大语言模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 67%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04935 2026-02-03 cs.AI cs.CL cs.LG 67%

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

MARS: 通过多智能体强化学习进行多系统深度研究

Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 glowing 人工智能学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MARS通过多智能体强化学习共进化双认知系统,无需监督微调即可在知识密集型任务中取得显著性能提升。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00426 2026-02-03 cs.LG cs.AI cs.CL eess.SP 67%

LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference

基于注意力机制的高维非线性自回归模型:训练、对齐与推理

Vikram Krishnamurthy

机构 * Cornell University(康奈尔大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。

Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 67%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16648 2026-02-02 cs.AI cs.CL cs.LG 67%

FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs

FESTA:用于多模态大语言模型信任评估的功能等效采样

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FESTA通过功能等效采样技术提升多模态大语言模型的预测选择性性能,实现33.3%和29.6%的改进。

Comments Accepted in the Findings of EMNLP, 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00219 2026-02-02 cs.LG cs.AI cs.CL cs.NE 67%

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

Thoughtbubbles: 一种用于潜在空间中并行思维的无监督方法

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás

机构 * Department of Computer Science, Stanford University, Stanford, CA, United States(计算机科学系,斯坦福大学,斯坦福,CA,美国)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoughtbubbles是一种通过预训练学习并行自适应计算的转换器变体,能够在潜在空间中实现更高效的计算,提升模型的推理性能和零样本评估表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07981 2026-01-28 cs.CL cs.AI cs.LG stat.ML 67%

Why is Your Language Model a Poor Implicit Reward Model?

为什么你的语言模型是一个差的隐式奖励模型?

Noam Razin, Yong Lin, Jiarui Yao, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现隐式奖励模型(IM-RM)在泛化能力上劣于显式奖励模型(EX-RM),因其更依赖表面token级线索,而设计选择对模型泛化行为有显著影响。

Comments Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09668 2026-01-16 cs.CV 67%

STEP3-VL-10B Technical Report

STEP3-VL-10B 技术报告

Ailin Huang, Chengyuan Yao, Chunrui Han, Fanqi Wan, Hangyu Guo, Haoran Lv, Hongyu Zhou, Jia Wang, Jian Zhou, Jianjian Sun, Jingcheng Hu, Kangheng Lin, Liang Zhao, Mitt Huang, Song Yuan, Wenwen Qu, Xiangfeng Wang, Yanlin Lai, Yingxiu Zhao, Yinmin Zhang, Yukang Shi, Yuyang Chen, Zejia Weng, Ziyang Meng, Ang Li, Aobo Kong, Bo Dong, Changyi Wan, David Wang, Di Qi, Dingming Li, En Yu, Guopeng Li, Haiquan Yin, Han Zhou, Hanshan Zhang, Haolong Yan, Hebin Zhou, Hongbo Peng, Jiaran Zhang, Jiashu Lv, Jiayi Fu, Jie Cheng, Jie Zhou, Jisheng Yin, Jingjing Xie, Jingwei Wu, Jun Zhang, Junfeng Liu, Kaijun Tan, Kaiwen Yan, Liangyu Chen, Lina Chen, Mingliang Li, Qian Zhao, Quan Sun, Shaoliang Pang, Shengjie Fan, Shijie Shang, Siyuan Zhang, Tianhao You, Wei Ji, Wuxun Xie, Xiaobo Yang, Xiaojie Hou, Xiaoran Jiao, Xiaoxiao Ren, Xiangwen Kong, Xin Huang, Xin Wu, Xing Chen, Xinran Wang, Xuelin Zhang, Yana Wei, Yang Li, Yanming Xu, Yeqing Shen, Yuang Peng, Yue Peng, Yu Zhou, Yusheng Li, Yuxiang Yang, Yuyang Zhang, Zhe Xie, Zhewei Huang, Zhenyi Lu, Zhimin Fan, Zihui Cheng, Daxin Jiang, Qi Han, Xiangyu Zhang, Yibo Zhu, Zheng Ge

机构 * Multimodal Intelligence Team(多模态智能团队)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract)

AI总结 STEP3-VL-10B 是一个轻量级开源基础模型,通过统一预训练和强化学习策略,在紧凑规模下实现多模态智能,超越大规模模型并在复杂推理任务中表现优异。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06224 2026-01-14 cs.CV 67%

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

在所见之地接地:通过标题反馈、多样性感知采样和冲突正则化实现抗幻觉的MLLMs

Miao Pan, Wangjie Gan, Jintao Chen, Wenqi Zhang, Bing Sun, Jianwei Yin, Xuhong Zhang

专题命中 测试时计算 :reasoning(abstract);planning(abstract)

AI总结 本文提出抗幻觉的MLLMs方法,通过标题反馈、多样性感知采样和冲突正则化减少幻觉,提升推理准确性。

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22322 2026-01-07 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents

SmartSnap: 为自主代理的主动证据寻求

Shaofei Cai, Yulei Qin, Haojia Lin, Zihan Xu, Gang Li, Yuchen Shi, Zongyi Li, Yong Mao, Siqi Cai, Xiaoyu Tan, Yitao Liang, Ke Li, Xing Sun

机构 * Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SmartSnap通过主动证据寻求机制,使自主代理在复杂任务中实现高效自我验证,提升性能并增强可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG 67%

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18462 2025-12-23 cs.CL cs.AI cs.LG 67%

Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling

通过LLM合成的反事实和动态平衡采样缓解NLI中的虚假相关性

Christopher Román Jaimes

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种自动化流程,通过LLM合成反事实和动态平衡采样缓解NLI中的虚假相关性,提升了模型性能和领域内准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22376 2025-12-22 cs.LG cs.AI cs.CL 67%

OptScale: Probabilistic Optimality for Inference-time Scaling

OptScale: 推断时间缩放的概率最优性

Youkang Wang, Jian Wang, Rubing Chen, Xiao-Yong Wei

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptScale通过概率框架和动态样本决策,提升LLMs推理性能并减少采样开销。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15000 2025-12-18 cs.LG cs.AI cs.CL 67%

DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding

DreamPRM-Code: 一种基于函数作为步骤的进程奖励模型与标签校正用于LLM编码

Ruiyi Zhang, Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DreamPRM-Code通过链式函数提示策略和元学习校正机制,提升LLM在编码任务中的表现,达到LiveCodeBench的最高准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04996 2025-12-08 cs.LG cs.AI cs.CL stat.ML 67%

Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives

Reinforce-Ada: 非线性强化学习目标下的自适应采样框架

Wei Xiong, Chenlu Ye, Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian, Nan Jiang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Reinforce-Ada通过自适应采样框架提升大语言模型在非线性强化学习目标下的推理性能,有效恢复丢失信号并加速收敛。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02882 2025-12-03 cs.LG cs.AI cs.CL 67%

OptPO: Optimal Rollout Allocation for Test-time Policy Optimization

OptPO:测试时间策略优化的最优回放分配

Youkang Wang, Jian Wang, Rubing Chen, Tianyi Zeng, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02710 2025-12-03 cs.CE 67%

Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation

超越n-gram:一种面向临床意识的医疗报告生成层次奖励学习框架

Yuan Wang, Shujian Gao, Jiaxiang Liu, Songtao Jiang, Haoxiang Xia, Xiaotian Zhang, Zhaolu Kang, Yemin Wang, Zuozhu Liu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文提出HiMed-RL框架,通过层次化奖励学习提升医疗报告生成的临床质量与事实准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23115 2025-12-01 cs.CV 67%

Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning

超越视觉层面的图像分析:通过多情感描述进行图像情感分类

Zibo Zhou, Zhengjun Zhai, Huimin Chen, Wei Dai, Hansen Yang

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学) School of Cybersecurity, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于多情感描述的图像情感分类方法,通过文本捕捉图像情感信息,有效解决情感差距问题,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01457 2025-12-01 cs.LG cs.AI cs.CL 67%

Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback

超越内省:通过外部主义行为反馈强化思维

Diji Yang, Linda Zeng, Kezhen Chen, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DRR框架,通过外部主义行为反馈提升LLM推理质量,无需修改基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15287 2025-11-27 cs.CL cs.AI cs.LG 67%

Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models

为大型语言模型的最佳-N采样进行推理感知微调

Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Sridhar Thiagarajan, Craig Boutilier, Rishabh Agarwal, Aviral Kumar, Aleksandra Faust

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20067 2025-11-14 cs.AI cs.CL cs.LG 67%

PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training

Sarat Chandra Bobbili, Ujwal Dinesha, Dheeraj Narasimha, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯A&M大学) Inria(法国国家信息与自动化研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07384 2025-11-11 cs.CL cs.AI cs.LG 67%

Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence

Sean McLeish, Ang Li, John Kirchenbauer, Dayal Singh Kalra, Brian R. Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Jonas Geiping, Tom Goldstein, Micah Goldblum

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of North Carolina(北卡罗来纳大学) ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心) Columbia University(哥伦比亚大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments code: https://github.com/mcleish7/retrofitting-recurrence, models: https://huggingface.co/collections/tomg-group-umd/retrofitting-recurrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00413 2025-11-03 cs.CL cs.AI cs.LG cs.PF 67%

Accelerating Diffusion LLMs via Adaptive Parallel Decoding

Daniel Israel, Guy Van den Broeck, Aditya Grover

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08388 2025-10-30 cs.LG cs.AI cs.CL 67%

Reinforcement Learning Teachers of Test Time Scaling

Edoardo Cetin, Tianyu Zhao, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16751 2025-10-28 cs.CV 67%

Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling

Erik Riise, Mehmet Onurcan Kaya, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12535 2025-10-21 cs.CL cs.AI cs.LG 67%

CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features

Seonglae Cho, Zekun Wu, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 42 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15110 2025-10-20 cs.LG cs.AI cs.CL 67%

DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning

Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NVIDIA-Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14913 2025-10-17 cs.AI cs.CL cs.LG 67%

Budget-aware Test-time Scaling via Discriminative Verification

Kyle Montgomery, Sijun Tan, Yuqi Chen, Siyuan Zhuang, Tianjun Zhang, Raluca Ada Popa, Chenguang Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17238 2025-10-15 cs.AI cs.CL cs.LG 67%

MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE

Soheil Zibakhsh, Mohammad Samragh, Kumari Nishu, Lauren Hannah, Arnav Kundu, Minsik Cho

机构 * Apple(苹果公司) University of California San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Corrected typo in arxiv abstract

详情

展开后加载摘要…

URL PDF HTML 收藏