Reasoning Under 1 Billion: Memory-Augmented Reinforcement Learning for Large Language Models
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
Comments preprint,20 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
Comments preprint,20 pages
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments arXiv admin note: text overlap with arXiv:1701.04715 by other authors
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Work in progress
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted as Oral at KnowFM @ AAAI 2025
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 8 pages, 8 figures
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 11 pages, 4 figures, to be published in The 31st International Conference on Computational Linguistics (COLING 2025)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 29 pages
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
Comments Accepted to LREC-COLING 2024
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Preprint
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 6 pages, 11 figures
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
Comments EMNLP 2023 main; long paper
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project Repo: https://github.com/dayuyang1999/Awesome-Code-Reasoning
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments Accepted to NAACL 2025 Main
专题命中 复杂问题求解 :reasoning(title);logical reasoning(title);分类 cs.CL、cs.AI
放大并不意味着具有预测性:思考模型中的推理行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。
Comments Published in COLM 2026
通过置信度动态实现大推理模型的早停
机构 * University of Maryland(马里兰大学) ; University of Southern California(南加州大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究推理过程中中间答案的置信度,提出CoDE-Stop方法利用置信度动态决定早停,无需额外训练,提升准确率与效率,减少25-50%的token使用。
通过分步置信度归因诊断黑盒大语言模型的多步推理失败
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。
Comments Accepted by ICML 2026
ReGuLaR:面向大型视觉语言模型的基于关系的潜在推理
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 提出ReGuLaR框架,通过训练时的ReGFormer将潜在推理显式地锚定在视觉证据中的对象和关系上,在多种基准上取得最优性能。
超越准确率:分解大语言模型的推理效率
机构 * Integreat - Norwegian Centre for knowledge-driven machine learning(Integreat - 挪威知识驱动机器学习中心) ; UiT - The Arctic University of Norway(UiT - 北极大学) ; University of Oslo(奥斯陆大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种无需追踪的评估协议,通过完成率、条件正确性和生成长度三个指标分解大语言模型的token效率,同时考虑任务工作量元数据进行归一化处理,并评估模型在不同任务上的推理效率和冗余问题。
Comments Preprint (under review). 29 pages, 4 figures
多模态潜在推理 via 分层视觉提示注入
机构 * Nanyang Technological University(南洋理工大学) ; Huawei Noah's Ark Lab(华为诺亚实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn)
AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。
TRIM:通过多步推理任务中的目标逐步路由进行混合推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TRIM通过目标逐步路由在多步推理任务中提升推理效率,通过识别错误步骤并分配不同模型处理,实现更高的成本效率。
Comments Accepted at ICLR 2026
MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。
GoT-R1:通过强化学习提升MLLM的视觉生成推理能力
机构 * HKU MMLAB(香港大学多媒体实验室) ; CUHK MMLAB(香港中文大学多媒体实验室) ; Sensetime(商汤科技) ; Beihang University(北京航空航天大学) ; SUAT(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。
Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026
提示策略在扩展推理大语言模型中的温度依赖性能
机构 * Gujarat Technological University(古吉拉特技术大学) ; The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究评估了不同温度下链式思维和零样本提示策略在扩展推理中的表现,发现零样本提示在中等温度下性能最佳,链式思维在极端温度下表现最佳,扩展推理的收益随温度增加而提升。
Comments 3 Figures, 2 Tables
分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) ; Hangzhou Dianzi University(杭州电子科技大学) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。
Comments Accepted by CVPR 2026
PA3: 通过链式推理实现政策感知的智能体对齐
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; Amazon Alexa AI(亚马逊Alexa AI)
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。
当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。