arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-09 至 2026-07-09 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2607.06764 2026-07-09 cs.AI 新提交 83%

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

用于ARC-AGI-1上抽象推理和泛化的经济高效智能体框架

Kabir Moghe, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI

AI总结 研究ARC-AGI-1上在严格预算下非思考模式的开放权重模型,构建智能体框架,包括探索者-定义者管道和反思协调器,通过特定架构提升基线成绩,分析了管道特性,确定思考工具是重要组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06974 2026-07-09 cs.CL cs.LG 新提交 81%

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES:用于自我改进的语言模型推理的具有可学习选择的模块化指令内存

Ruilin Tong, Dong Gong

机构 * University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对LLMs测试时推理问题,提出MILES框架,通过动态扩展内存及正确性优化的内存组合,利用模块化内存单元与可学习选择头实现粗到细检索机制,实验表明该框架在性能、效率及权衡上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06720 2026-07-09 cs.AI cs.CL 新提交 81%

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

上下文搜索何时有用?基于反射驱动推理的采样复杂性理论

Yotam Wolf, Noam Wies, Amnon Shashua

机构 * The Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究上下文搜索何时有用,通过将其建模为对推理轨迹的近似推理分析采样复杂性,表明反思能定位早期错误时可指数级改进,收益稳健可学习,还在强化学习抽象下验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06799 2026-07-09 cs.LG cs.AI 新提交 73%

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

什么能预测文本到SQL的正确性?一项选择性预测研究

Robert Richardson

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究哪些信号能预测文本到SQL的正确性,黑盒信号AUROC在0.61到0.68之间,基于验证的评判器分数更高,集成可达0.82 AUROC。还探讨验证器训练,微调后的验证器在分布内表现较好,但跨模式泛化能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08068 2026-07-09 cs.LG 新提交 70%

DICE: Entropy-Regularized Equilibrium Selection for Stable Multi-Agent LLM Coordination

DICE: 用于稳定多智能体LLM协调的熵正则化均衡选择

Yi Xie, Zhanke Zhou, Chentao Cao, Bo Liu, Bo Han

机构 * University of Arizona(亚利桑那大学) Hong Kong Baptist University(香港浸会大学)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 提出DICE框架,通过熵正则化均衡选择(HQRE)解决多智能体LLM协调中的不稳定性,实现线性收敛和有限贝叶斯遗憾,在11个基准上平均提升4.3-8.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 62%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 57%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17842 2026-07-09 cs.LG 版本更新 57%

SNLP: Layer-Parallel Inference via Structured Newton Corrections

SNLP:通过结构化牛顿校正的层并行推理

Ligong Han, Kai Xu, Hao Wang, Akash Srivastava

机构 * Core AI, IBM(IBM核心AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出结构化牛顿层并行(SNLP)框架,通过将Transformer层间依赖视为非线性残差方程并用结构化牛顿校正并行求解,实现推理加速,在0.5B模型上获得高达2.58倍加速。

Comments Project webpage: https://github.com/phymhan/nanochat-snlp

详情

展开后加载摘要…

URL PDF HTML 收藏