arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2604.02967 2026-04-06 cs.AI cs.CL 81%

FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models

FoE:错误森林使大推理模型中的首个解成为最佳解

Kehan Jiang, Haonan Dong, Zhaolu Kang, Zhengzhou Zhu, Guojie Song

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现大推理模型中首个解往往最优,提出RED框架通过抑制错误增长和修剪后续错误提升性能,实验显示在多个基准上性能提升达19.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02341 2026-04-06 cs.LG cs.AI 81%

LLM Reasoning with Process Rewards for Outcome-Guided Steps

基于过程奖励的大型语言模型推理

Mohammad Rezaei, Jens Lehmann, Sahar Vahdati

机构 * Amazon Science(亚马逊科学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PROGRS框架通过过程奖励相对偏好优化,提升数学推理准确性,减少错误引导,优于仅基于结果的基线方法。

Comments 8 pages, 3 figures, 2 tables, submitted to IJCNN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02315 2026-04-06 cs.AI 77%

Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

超越助手回合:用户回合生成作为语言模型交互意识的探测器

Sarath Shekkizhar, Romain Cosentino, Adam Earle

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出通过用户回合生成探测语言模型的交互意识,发现交互意识与任务准确性无关,且通过温度采样可提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02776 2026-04-06 cs.SE 67%

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

评估使用SLMs和提示工程进行代码生成的环境影响

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了基于SLMs的代码生成中不同提示策略对准确性和可持续性的影响,发现可持续性与准确性脱钩,提示工程可实现环保与性能的平衡。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03201 2026-04-06 cs.AI 57%

Coupled Control, Structured Memory, and Verifiable Action in Agentic AI (SCRAT -- Stochastic Control with Retrieval and Auditable Trajectories): A Comparative Perspective from Squirrel Locomotion and Scatter-Hoarding

耦合控制、结构化记忆与可验证行为在代理AI中的应用(SCRAT -- 随机控制与可审计轨迹:从松鼠运动与散落储藏的比较视角)

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文从松鼠生态角度探讨代理AI中控制、记忆与可验证行为的耦合机制,提出结构化记忆模型与延迟验证信号,验证三种假设以提升系统鲁棒性与可靠性。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00901 2026-04-06 cs.AI 57%

Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts

经验作为罗盘:具有演进编排和代理提示的多代理RAG

Sha Li, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HERA框架,通过动态编排和角色特定提示提升多代理RAG在复杂任务中的性能,实现38.69%的平均提升并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02761 2026-04-06 cs.SE 50%

Sustainability Analysis of Prompt Strategies for SLM-based Automated Test Generation

基于SLM的自动化测试生成提示策略可持续性分析

Pragati Kumari, Novarun Deb

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文研究了基于小语言模型的自动化测试生成中提示策略对计算和环境可持续性的影响,通过实验评估七种策略,发现策略选择对可持续性指标有显著影响,简单策略更环保。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏