arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 3 篇

2605.00136 2026-05-04 cs.AI 77%

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19897 2026-05-04 cs.CL cs.AI cs.LG 67%

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

通过语义和事件记忆学习:一种反思式智能体适应方法

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02443 2026-05-04 cs.LG 57%

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

某些头部,不确定尾部:专家-样本用于测试时缩放在细粒度MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Nanjing University of Science(南京理工大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文研究细粒度MoE在测试时缩放中的性能优化,提出Expert-Sample方法通过保留高置信度选择并引入可控随机性提升生成多样性。

Comments 25 pages, 13 figures

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏