arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2604.02007 2026-04-07 cs.LG 83%

Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理

Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin

机构 * ServiceNow

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。

Comments 20 pages, 4 tables, 6 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08659 2026-04-07 cs.CL 79%

CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning

CODA:面向自适应推理的难度感知计算分配

Siye Wu, Jian Xie, Yikai Zhang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 79%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23850 2026-04-07 cs.AI cs.CL cs.LG 67%

The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models

向下钻探与伪造测试(DDFT):一种衡量语言模型认知鲁棒性的协议

Rahul Baxi

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DDFT协议,用于评估语言模型在语义压缩和对抗性伪造下的认知鲁棒性,发现鲁棒性与传统设计无关,且错误检测能力是关键瓶颈。

Comments This version strengthens the theoretical and empirical grounding of the CI metric, including explicit analysis of structural dependencies and ranking stability under ablations (e.g., excluding Turn 4). Claims regarding scale and robustness are revised to avoid overgeneralization. The evaluation protocol, jury methodology, and limitations are expanded to clarify assumptions and boundary conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 67%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 62%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏