arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-30 至 2026-03-30 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2410.12853 2026-03-30 cs.CL cs.AI cs.LG 85%

Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks

思想多样性在多智能体辩论框架中增强了推理能力

Mahmood Hegazy

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过多智能体辩论框架发现,思想多样性显著提升LLM推理能力,中等规模模型在GSM-8K基准测试中超越GPT-4,达到91%准确率,同时在ASDiv基准测试中创下新纪录。

Comments 11 pages, 9 figures

Journal ref Journal of Robotics and Automation Research(JRAR), Vol. 5 Issue 3, October -2024, pg. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 57%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏