arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-24 至 2026-04-24 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5 篇

2511.06209 2026-04-24 cs.AI cs.CL 84%

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06428 2026-04-24 cs.LG 83%

BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models

BackPlay:用于扩散语言模型的头部-only回溯自校正

Liming Liu, Binxuan Huang, Zixuan Zhang, Xin Liu, Bing Yin, Tuo Zhao

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 BackPlay通过在冻结的生成器上训练轻量级校正头,改进多token解码下的生成质量,利用回溯校正机制减少错误积累。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21584 2026-04-24 cs.AI cs.CE cs.LG 81%

CoFEE: Reasoning Control for LLM-Based Feature Discovery

CoFEE:基于LLM的特征发现的推理控制

Maximilian Westermann, Ben Griffin, Aaron Ontoyin Yin, Zakari Salifu, Yagiz Ihlamur, Kelvin Amoaba, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford(牛津大学) Vela Research(Vela研究) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoFEE框架,通过引入认知行为提升LLM特征发现的预测性和效率,实验显示其在预测性和成本控制上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24239 2026-04-24 cs.LG cs.AI 81%

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Baidu(百度) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 73%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏