arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-03 至 2026-08-03 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2606.05976 2026-08-03 cs.AI cs.CL 版本更新 84%

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

自我修正错觉:LLM 纠正他人但不纠正自己

Kuan-Yen Chen, Fang-Yi Su, Shih-Yen Lin, Bao Li, Jung-Hsien Chiang

机构 * National Taiwan University(国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。

Comments 15 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新 81%

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 79%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29052 2026-08-03 cs.RO 新提交 78%

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(晨昇科技公司)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28638 2026-08-03 cs.CL cs.LG 新提交 62%

Learning Stateful Predictive Knowledge From Experience

从经验中学习有状态的预测知识

Yan Song, Xidong Feng, Bo Liu, Xinyu Cui, Haotian Fu, Zichen Liu, Mengyue Yang, Cheng Deng, Jian Zhao, Jun Wang

机构 * University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Brown University(布朗大学) University of Bristol(布里斯托尔大学) University of Edinburgh(爱丁堡大学) Zhongguancun Academy(中关村科学院) The Yangtze River Delta(长三角)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM智能体现有轨迹级反思学习的缺陷,提出SKL方法,通过两种算法训练智能体学习有状态预测知识,在多任务上性能优于现有范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29246 2026-08-03 cs.AI 新提交 57%

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化

Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan, Tianyue Wang, Haiyun Guo, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28908 2026-08-03 cs.LG 新提交 57%

Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds

反思还是重新生成?为什么大型语言模型(LLM)的修正会失败,而人类的修正却能成功

Yefan Tao, Gerald Friedland, Madhusudhanan Chandrasekaran, Luyang Kong

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出人类-LLM反思框架(HRF)对比人类与LLM的修正,发现LLM反思在客观任务增益近零、主观任务增益为负,本质是条件重新生成,而非真正的错误驱动修正。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏