arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2608.03077 2026-08-05 cs.CL 新提交 77%

PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

PAMT:面向多领域机器翻译的过程对齐强化学习

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 针对多领域机器翻译中显式推理的偏差问题,提出过程对齐强化学习框架PAMT,结合长思维链监督与多维度奖励机制,在多种场景下表现优于基线模型。

Comments 23 pages, 10 figures, and 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23771 2026-07-28 cs.AI 新提交 77%

Training Language Models to Cooperate with Inference-Time Controllers

训练语言模型以与推理时控制器协作

Moumita Choudhury, Vanshaj Khattar, Jing Liu, Toshiaki Koike-Akino, Ankush Chakrabarty, Shlomo Zilberstein, Ye Wang

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 77%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新 77%

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02919 2026-06-01 cs.CL 77%

Self-Reflective Generation at Test Time

测试时的自反生成

Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出SRGen框架,通过动态熵阈值识别高不确定性token并训练校正向量,在测试时进行自反生成以纠正概率分布,提升大模型推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11657 2026-05-26 cs.CL 77%

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

扩展基于自然语言图结构的测试时计算用于自动定理证明

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu

机构 * Boston University Provadis School of International Management \& Technology Duke University Algoverse AI Research

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出KG-prover框架,利用从权威数学文本挖掘的知识图谱增强通用大语言模型,通过扩展图结构的测试时计算显著提升自动定理证明性能。

Comments Accepted to ICML AI4Math Workshop 2025, NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00136 2026-05-04 cs.AI 77%

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19395 2026-04-22 cs.CL 77%

Does Self-Consistency Improve the Recall of Encyclopedic Knowledge?

自洽性是否能提升百科知识的回忆能力?

Sho Hoshino, Ukyo Honda, Peinan Zhang

机构 * CyberAgent

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本文通过建立MMLU基准的百科知识回忆分割,验证了自洽性在符号推理和百科知识回忆中的提升效果,使用GPT-4o达到MMLU 89%的准确率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02315 2026-04-06 cs.AI 77%

Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

超越助手回合:用户回合生成作为语言模型交互意识的探测器

Sarath Shekkizhar, Romain Cosentino, Adam Earle

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出通过用户回合生成探测语言模型的交互意识,发现交互意识与任务准确性无关,且通过温度采样可提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07223 2026-03-10 cs.LG 77%

Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training

解锁金融数据价值:关于蒸馏和难度感知训练的研究

Chuxue Cao, Honglin Lin, Zhanping Zhong, Xin Gao, Mengzhang Cai, Conghui He, Sirui Han, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 77%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20408 2026-02-25 cs.CY cs.AI cs.HC 77%

Examining and Addressing Barriers to Diversity in LLM-Generated Ideas

检验和解决大语言模型生成想法中的多样性障碍

Yuting Deng, Melanie Brucks, Olivier Toubia

机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21604 2025-10-27 cs.CL 77%

RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models

Xueyuan Lin, Cehao Yang, Ye Ma, Ming Li, Rongjunchen Zhang, Yang Ni, Xiaojun Wu, Chengjin Xu, Jian Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research(IDEA研究院) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司) DataArc Tech Ltd(DataArc科技有限公司)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22101 2025-09-29 cs.CL 77%

Think Right, Not More: Test-Time Scaling for Numerical Claim Verification

Primakov Chungkham, V Venktesh, Vinay Setty, Avishek Anand

机构 * TU Delft(代尔夫特理工大学) Stockholm University(斯德哥尔摩大学) University of Stavanger(斯塔万内尔大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07827 2025-08-12 cs.CL 77%

Evaluating Large Language Models as Expert Annotators

Yu-Min Tseng, Wei-Lin Chen, Chung-Chi Chen, Hsin-Hsi Chen

机构 * National Taiwan University(台湾大学) Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) AIST, Japan(日本产业技术综合研究所) AINTU, Taiwan(台湾人工智能技术研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13888 2025-06-18 cs.CL cs.CV 77%

VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training

Jipeng Zhang, Kehao Miao, Renjie Pi, Zhaowei Wang, Runtao Liu, Rui Pan, Tong Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07961 2025-05-26 cs.LG 77%

Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement

Xuechen Zhang, Zijian Huang, Chenshun Ni, Ziyang Xiong, Jiasi Chen, Samet Oymak

机构 * University of Michigan(密歇根大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20271 2025-03-27 cs.CV cs.CL 77%

ViLBench: A Suite for Vision-Language Process Reward Modeling

Haoqin Tu, Weitao Feng, Hardy Chen, Hui Liu, Xianfeng Tang, Cihang Xie

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14286 2025-03-20 cs.LG 77%

Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs

Nicolas Le Roux, Marc G. Bellemare, Jonathan Lebensold, Arnaud Bergeron, Joshua Greaves, Alex Fréchette, Carolyne Pelletier, Eric Thibodeau-Laufer, Sándor Toth, Sam Work

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13550 2025-02-20 cs.CL 77%

STaR-SQL: Self-Taught Reasoner for Text-to-SQL

Mingqian He, Yongliang Shen, Wenqi Zhang, Qiuying Peng, Jun Wang, Weiming Lu

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11520 2025-02-18 cs.CL 77%

AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification

Xiaoyu Tan, Tianchu Yao, Chao Qu, Bin Li, Minghao Yang, Dakuan Lu, Haozhe Wang, Xihe Qiu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09996 2025-02-11 cs.CV cs.CL 77%

Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering

Rabiul Awal, Le Zhang, Aishwarya Agrawal

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Codes available at https://github.com/rabiulcste/vqazero

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16871 2024-12-24 cs.CL 77%

Teaching LLMs to Refine with Tools

Dian Yu, Yuheng Zhang, Jiahao Xu, Tian Liang, Linfeng Song, Zhaopeng Tu, Haitao Mi, Dong Yu

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11403 2026-08-13 cs.AI cs.CL cs.LG 新提交 76%

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

当自我一致性适得其反:对于小型大型语言模型,多数投票会损害大多数硬科学问题

Utkarsh Bahuguna

机构 * Scaler School of Technology(斯凯勒科技学院)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,多数投票的自我一致性方法会损害小型指令微调模型在多数硬科学问题上的准确率,其核心机制是置信度与正确性不匹配,且无验证器门控方法可提升该问题下的准确率。

Comments 9 pages, 4 figures, 3 tables. Accepted at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17691 2026-02-23 cs.LG cs.CL 76%

Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering

tethered Reasoning: 通过流形引导解耦熵与幻觉在量化大语言模型中

Craig Atkinson

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.LG

AI总结 HELIX 通过几何引导解耦量化大语言模型中的熵与幻觉,通过引导隐藏状态轨迹到预计算的诚实性流形,提高高温度下的输出质量与多样性。

Comments 16 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20315 2026-01-14 cs.CL cs.AI 76%

Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL

Arctic-Text2SQL-R1: 简单奖励,强推理的文本到SQL

Zhewei Yao, Guoheng Sun, Lukasz Borchmann, Gaurav Nuti, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He

机构 * Snowflake AI Research(Snowflake AI研究院) University of Maryland(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Arctic-Text2SQL-R1通过简单奖励机制和强化学习框架,在文本到SQL任务中实现高准确率和高效性,优于现有大型模型。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11519 2025-11-17 cs.AI cs.LG 76%

Experience-Guided Adaptation of Inference-Time Reasoning Strategies

Adam Stein, Matthew Trager, Benjamin Bowman, Michael Kleinman, Aditya Chattopadhyay, Wei Xia, Stefano Soatto

机构 * University of Pennsylvania(宾夕法尼亚大学) AWS AI(亚马逊AI)

专题命中 测试时计算 :reasoning(title);分类 cs.AI、cs.LG

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02377 2025-10-06 cs.CL cs.LG 76%

Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems

Aakriti Agrawal, Rohith Aralikatti, Anirudh Satheesh, Souradip Chakraborty, Amrit Singh Bedi, Furong Huang

机构 * University of Maryland(马里兰大学) Hilabs University of Central Florida(佛罗里达中央大学) Capital One

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05065 2025-07-08 cs.LG cs.AI 76%

Replacing thinking with tool usage enables reasoning in small language models

Corrado Rainone, Tim Bakker, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 测试时计算 :reasoning(title);分类 cs.AI、cs.LG

Comments 23 pages, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06690 2018-07-10 cs.CL cs.AI 76%

DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning

Wenhan Xiong, Thien Hoang, William Yang Wang

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI

Comments EMNLP 17

详情

展开后加载摘要…

URL PDF HTML 收藏