arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2608.01463 2026-08-05 cs.AI cs.MA 版本更新 74%

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title);分类 cs.AI

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08700 2026-07-10 cs.CL 新提交 74%

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

深度研究源归因的基准测试:评估用于验证引用的前沿模型

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)

专题命中 测试时计算 :verifier(title);分类 cs.CL

AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 74%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15005 2026-02-17 cs.CL cs.IR 74%

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

通过推理和蒸馏学习用户兴趣以实现跨领域新闻推荐

Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

机构 * Microsoft(微软公司) Emory University(埃默里大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 本文提出通过推理和蒸馏学习用户兴趣的方法,提升跨领域新闻推荐的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09770 2026-02-13 cs.CL 74%

GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning

黄金矿砂:用于针叶堆寻针推理的战略上下文洗牌

Adam Byerly, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 GOLD PANNING通过战略上下文洗牌方法,在针叶堆推理中以更少的查询实现高效目标识别,利用信号锚定技术提升模型性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22803 2026-02-02 cs.AI cs.SE 74%

CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning

CVeDRL: 一种通过难度感知强化学习实现的高效代码验证器

Ji Shi, Peiming Guo, Meishan Zhang, Miao Zhang, Xuebo Liu, Min Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 CVeDRL通过难度感知强化学习提升代码验证效率,实现更高通过率和分支覆盖,参数更少,推理更快。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11769 2025-11-18 physics.chem-ph cs.LG q-bio.QM stat.ME 74%

Socrates-Mol: Self-Oriented Cognitive Reasoning through Autonomous Trial-and-Error with Empirical-Bayesian Screening for Molecules

Xiangru Wang, Zekun Jiang, Heng Yang, Cheng Tan, Xingying Lan, Chunming Xu, Tianhang Zhou

机构 * State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing), Beijing 102249, China(石油加工国家重点实验室,中国石油大学(北京)) Shanghai AI Laboratory,L1 Building, International Media Port, No. 129 Longwen Road, Xuhui District, Shanghai(上海人工智能实验室) College of Energy Innovation, China University of Petroleum (Beijing), Beijing 102249, China(能源创新学院,中国石油大学(北京))

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13651 2025-10-16 cs.LG math.OC 74%

What is the objective of reasoning with reinforcement learning?

Damek Davis, Benjamin Recht

机构 * Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃森商学院,宾夕法尼亚大学) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23324 2025-09-30 cs.DC cs.AI 74%

Scaling LLM Test-Time Compute with Mobile NPU on Smartphones

Zixu Hao, Jianyu Wei, Tuowei Wang, Minxing Huang, Huiqiang Jiang, Shiqi Jiang, Ting Cao, Ju Ren

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 测试时计算 :test-time compute(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22275 2025-03-31 eess.AS cs.AI cs.SD 74%

Make Some Noise: Towards LLM audio reasoning and generation using sound tokens

Shivam Mehta, Nebojsa Jojic, Hannes Gamper

专题命中 测试时计算 :reasoning(title);分类 cs.AI

Comments 5 pages, 2 figures, Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00369 2024-07-02 cs.CL 74%

How to Train Your Fact Verifier: Knowledge Transfer with Multimodal Open Models

Jaeyoung Lee, Ximing Lu, Jack Hessel, Faeze Brahman, Youngjae Yu, Yonatan Bisk, Yejin Choi, Saadia Gabriel

专题命中 测试时计算 :verifier(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15610 2024-06-14 cs.CL 74%

Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning

Tejas Srinivasan, Jack Hessel, Tanmay Gupta, Bill Yuchen Lin, Yejin Choi, Jesse Thomason, Khyathi Raghavi Chandu

专题命中 测试时计算 :reasoning(title);分类 cs.CL

Comments Accepted to ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 73%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 73%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25069 2026-07-29 cs.CL cs.AI 新提交 73%

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

DS@GT ARC在CheckThat! 2026中的应用:基于大语言模型的多语言数值声明验证的推理轨迹排序和分组奖励建模

Sagnik Sinha, Shreyas Shrestha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言数值声明验证,探索基于大语言模型(LLM)的推理轨迹排序和分组奖励建模两种方法。LLM方法用LoRA微调验证器评分,还尝试子声明分解;奖励模型用TF-IDF及特征评分。结果显示LLM方法多数指标更优,阿拉伯语中AraBERT表现更佳且子声明分解未提升性能。

Comments 10 pages, 2 figures. Accepted at CLEF 2026 CheckThat!. To appear in CEUR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17531 2026-07-21 cs.CL cs.AI 新提交 73%

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration

预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法

Jie Hu

机构 * Research Institute of China Telecom(中国电信研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。

Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11686 2026-07-16 cs.LG cs.AI 版本更新 73%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06799 2026-07-09 cs.LG cs.AI 新提交 73%

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

什么能预测文本到SQL的正确性?一项选择性预测研究

Robert Richardson

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究哪些信号能预测文本到SQL的正确性,黑盒信号AUROC在0.61到0.68之间,基于验证的评判器分数更高,集成可达0.82 AUROC。还探讨验证器训练,微调后的验证器在分布内表现较好,但跨模式泛化能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交 73%

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26300 2026-06-26 cs.AI cs.CL 新提交 73%

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

验证地平线:编码智能体奖励没有银弹

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mingze Li, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu Wang, Yuheng Jing, Zeyao Ma, Zeyu Cui

机构 * Qwen Team(Qwen团队)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。

Comments Authors are listed alphabetically by their first names

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19346 2026-06-23 cs.CL cs.AI 新提交 73%

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

跨语言迁移中语言相关性与任务对齐的解耦

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom

机构 * Haverford College(哈弗福德学院) Brown University(布朗大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 73%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05625 2026-06-05 cs.AI cs.LG 73%

Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

自承诺延迟:一种用于提示隐式劫持的无奖励探针

Bonan Shen, Youting Wang, Dingyan Shang, Tao Ning

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出自承诺延迟指标,通过测量推理上下文对模型自身最终答案的承诺时机,无需奖励信号即可检测提示隐式劫持,在GSM8K数据集上达到AUROC 0.878-0.926。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03608 2026-06-03 cs.LG cs.AI 73%

Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

利用验证-生成差距:基于置信度条件的测试时强化学习

Jiahui Li, Jianfeng Shan, Wenpei Chen, Shunyu Wu, Jian Lou, Wenjie Feng, Dan Li, See-Kiong Ng

机构 * Sun Yat-Sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出TTRL-CoCoV框架,通过置信度自适应机制解决无标签设置下Pass@k优化中的伪标签错误和多样性崩溃问题,显著提升Pass@1和Pass@k性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 73%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19317 2026-05-20 cs.LG cs.AI 73%

Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement

通过迭代部分细化在扩散模型中实现推理时间扩展

Taegu Kang, Jaesik Yoon, Sungjin Ahn

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无需外部验证器的扩散模型推理时间扩展方法Iterative Partial Refinement,通过在混合噪声条件下迭代部分细化生成更一致的样本,在MNIST Sudoku任务中提升了有效解率。

Comments Accepted at the ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 73%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13907 2026-05-15 stat.ML cs.AI cs.LG 73%

AIS: Adaptive Importance Sampling for Quantized RL

AIS: 量化强化学习中的自适应重要性采样

Jiajun Zhou, Wei Shao, Lingchao Zheng, Yuwei Fan, Ngai Wong

机构 * Huawei(华为) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIS方法,通过动态调整重要性采样强度,解决量化强化学习中 rollout 与训练不匹配导致的策略梯度偏差问题,在保持FP8加速优势的同时,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11011 2026-05-13 cs.LG cs.AI 73%

LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

LoopUS: 将预训练大语言模型转换为循环潜在细化模型

Taekhyun Park, Yongjae Lee, Dohee Kim, Hyerim Bae

机构 * Department of Data Science(数据科学系) Department of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Changwon National University(昌原国立大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 LoopUS通过循环架构提升LLM推理性能,无需重新训练,采用四个核心组件稳定模型并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17609 2026-04-21 cs.CL cs.LG 73%

Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity

智能体探索但忽视环境:大语言模型缺乏环境好奇心

Leon Engländer, Sophia Althammer, Ahmet Üstün, Matthias Gallé, Tom Sherborne

机构 * Cohere Poolside

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究发现当前大语言模型缺乏环境好奇心,无法有效利用意外但相关的信息。通过三个基准测试发现,尽管智能体发现了解决方案,但很少主动利用。研究指出可用工具、计算资源和训练数据分布是影响因素,优化配置能提升性能,但智能体仍主要依赖环境获取预期信息。

详情

展开后加载摘要…

URL PDF HTML 收藏