Is Code Better Than Language for Algorithmic Reasoning
算法推理中代码是否优于语言
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过分离中间表示与执行机制,在40个任务上比较代码执行与自然语言推理,发现代码执行优势源于外部执行而非表示变化。
Comments ICML 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
算法推理中代码是否优于语言
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过分离中间表示与执行机制,在40个任务上比较代码执行与自然语言推理,发现代码执行优势源于外部执行而非表示变化。
Comments ICML 2026
经验造就熟练:通过自进化技能记忆实现可泛化的医疗智能体推理
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出SkeMex框架,通过技能记忆实现医疗智能体后部署自进化,无需更新模型权重,在临床任务中优于现有记忆型智能体。
用于蒙特卡洛树搜索规划的因果对象中心模型
机构 * MIRAI ; CogAILab
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出COMET算法,结合无监督对象中心编码器和Transformer世界模型,通过动作-槽融合机制和对象因果注意力实现高效规划,在多个基准上优于基线方法。
UP-NRPA:基于用户画像的嵌套 rollout 策略自适应,用于目标导向对话系统中与大语言模型的规划
机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence, Anhui University(安徽大学安徽省安全人工智能重点实验室) ; Pengcheng Laboratory(鹏城实验室)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出 UP-NRPA 在线框架,利用大语言模型和用户画像实时自适应调整对话策略,无需离线强化学习,在协作与非协作对话基准中实现 100% 任务成功率,谈判任务销售列表比提升 56.41%。
计划在哪里?通过轻量级机制干预定位语言模型中的潜在规划
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过押韵对句补全任务,使用线性探针和激活修补方法,研究语言模型在生成过程中是否形成并因果依赖未来约束的潜在规划,发现仅Gemma-3-27B模型存在因果依赖,并定位到五个注意力头。
Comments 13 pages, 20 figures, 3 tables. Accepted to Workshop on Mechanistic Interpretability @ ICML 2026
自适应教师暴露用于大语言模型推理中的自蒸馏
机构 * ByteDance Douyin(字节跳动抖音)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对自蒸馏中教师暴露完整推理导致学生难以吸收的问题,提出自适应教师暴露方法ATESD,通过轻量Beta策略控制器动态调整暴露比例,并用折扣学习进步奖励优化,在多个模型和数据集上提升推理性能。
Comments 11 pages, 4 figures; code not released yet
MemCast:基于经验条件推理的记忆驱动时间序列预测
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出MemCast框架,将时间序列预测转化为经验条件推理任务,通过层次化记忆学习历史模式、推理智慧和一般规律,并采用动态置信度适应策略实现持续进化,在多个数据集上优于现有方法。
通过本体引导的多智能体推理实现文化对齐的大型语言模型
机构 * KAIST(韩国科学技术院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。
Comments Accepted by ICML 2026 Regular Track
PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理
机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出PhotoCraft,一种无需训练的分层记忆系统,通过工作、情景和语义记忆增强多模态大语言模型,实现深度图像搜索中的多步推理和知识迁移,在DISBench上提升检索性能达18.5%。
衡量推理模型的弱到强可读性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。
Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026
Dyna-H:一种应用于角色扮演游戏策略决策系统的启发式规划强化学习算法
机构 * Complutense University of Madrid(马德里complutense大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Dyna-H算法,结合启发式搜索与Dyna框架,在角色扮演游戏策略决策中实现无模型在线强化学习,实验表明其性能显著优于Q-Learning和Dyna-Q。
ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐
机构 * Zhejiang University(浙江大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。
Comments ICML 2026
PlanningBench: 生成可扩展且可验证的规划数据以评估和训练大型语言模型
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学校) ; LLM Department, Hunyuan Team, Tencent(腾讯 Hunyuan 团队 LLM 部门) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出PlanningBench框架,通过约束驱动合成管道生成可扩展、多样化且可验证的规划数据,用于评估和训练LLMs,并验证其在提升规划能力上的有效性。
Recon:基于重建指导的推理合成用于用户建模
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Recon方法,通过动作重建分数评估推理轨迹的预测能力,以改进用户建模中的推理合成,在多个领域优于事后合理化基线。
READER: 增强推理的AI生成文本检测
机构 * School of Mathematics, University of Birmingham(布里斯托尔大学数学学院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出READER方法,通过微调1.5B参数的LLM在结构化推理数据集READ上,结合推理与检测,在分布偏移下优于GPT-5.2等大100-1000倍的模型。
Search-E1: 自蒸馏驱动搜索增强推理中的自我进化
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。
迈向无差错的电子健康记录:临床笔记与结构化表格之间的推理密集型一致性验证
机构 * KAIST(韩国科学技术院) ; Ghent University(根特大学) ; Samsung Medical Center(三星医疗中心) ; Samsung Changwon Hospital(三星昌原医院) ; Asan Medical Center(亚山医疗中心)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对电子健康记录中临床笔记与结构化表格数据不一致的问题,提出推理密集型基准EHR-ReasonCon和基于大语言模型的框架EHR-Inspector,通过锚点实体提取、时间引用和表格探索工具实现高效一致性验证。
当计划正确执行却失败时:基于LLM的多智能体系统的认知校准
机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) ; School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) ; Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对基于LLM的多智能体系统中因认知误校准导致计划失败的问题,提出认知计划校准代理工作流(EPC-AW),通过信息一致性计划选择和一致性引导的认知状态细化,平均提升系统成功率9.75%。
没有理解的趋同:当语言模型在表示上一致但在推理上分歧时
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。
在大语言模型时代进行规划:构建可靠性与效率
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了在大语言模型时代规划领域的发展,重点介绍了通过生成可验证的符号求解器来提高规划的可靠性和效率的方法。
Comments Published at ICAPS 2026
蛋白质思想:基于树 of 思维和嵌入空间流匹配的可解释推理用于蛋白质-蛋白质相互作用发现
机构 * Department of Statistics and CCAM University of Chicago(统计学系和CCAM大学芝加哥分校) ; School of Medicine Stanford University(医学学院斯坦福大学) ; Department of Statistics University of Chicago(统计学系芝加哥大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种可解释的蛋白质-蛋白质相互作用发现框架,通过显式推理将PPI发现转化为可解释的搜索问题,利用嵌入空间流匹配和树 of 思维搜索方法提升预测精度和可解释性。
LiteCoOp: 轻量级多语言模型共享树推理用于模型服务编译器优化
机构 * A lternative C omputing T echnologies ( ACT ) Lab(替代计算技术实验室) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出LiteCoOp,一种轻量级框架,通过将优化搜索树本身作为多语言模型协作机制,实现编译器优化过程中异构语言模型的协作,从而在降低编译成本的同时提升性能。
重新思考用于大视觉语言模型胸部X光推理中的视觉归因
机构 * University of Virginia(弗吉尼亚大学) ; National Institutes of Health(美国国立卫生研究院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文针对大视觉语言模型在胸部X光推理中视觉归因的可靠性问题,提出了一种因果评估框架,通过反事实编辑保留仅由专家标注区域验证的X光-VQA样本,以确定模型预测的因果责任区域。通过11种归因方法、6种开源LVLMs和两种输出模式,发现现有归因方法往往无法识别LVLMs所使用的证据。为此,本文提出MedFocus,一种基于概念的归因方法,通过不平衡最优传输局部化具有临床意义的解剖区域,并通过针对性干预测量其对模型输出的因果效应,显著优于现有方法,推动医疗LVLMs的更可信归因。
EUPHORIA: 通过混合优化实现高效通用规划以实现稳健的工业机器人装配
机构 * National Taiwan University(国立台湾大学) ; MoonShine Animation Studio(MoonShine动画工作室) ; National Cheng Kung University(国立成功大学) ; The University of British Columbia(不列颠哥伦比亚大学) ; National Yang Ming Chiao Tung University(阳明交通大学)
专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EUPHORIA框架,通过混合优化策略实现通用少样本适应和动态效率,解决建筑机器人装配中规划器高度专业化和操作低效的问题,结合元几何编码器、物理引导图变压器和残差稳定性校正等方法,实现高效且鲁棒的装配规划。
基于属性的LLM程序合成用于规划
机构 * Federal University of Rio Grande do Sul(里约格朗德杜斯尔大学) ; University of Oxford(牛津大学) ; Linköping University(林奈大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了一种基于属性的LLM程序合成方法,通过检查候选程序是否满足形式定义的属性来指导LLM生成更高质量的程序,从而减少生成和评估成本。
在联合嵌入预测世界模型中成功因素是什么?
机构 * Meta FAIR ; Inria Paris(巴黎理工院) ; Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) ; New York University(纽约大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。
Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR
通过提示强化实现大语言模型的长期规划
机构 * Heinrich-Heine-Universität Düsseldorf(杜伊斯堡-埃森大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种基于强化学习的提示优化框架,通过修改LLM代理的任务指令提示来实现长期规划,提升了多轮交互任务如文本到SQL和任务导向对话的表现,并能泛化到不同LLM代理和多种LLM作为元提示代理。
无法回头的点:语言模型推理中欺骗承诺的反事实定位
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究语言模型在推理过程中何时开始承诺欺骗,通过反事实定位方法,分析不同环境中的欺骗产生机制,并发现注意力转移特征在跨环境泛化中的有效性,同时提出通过压缩注意力头集来抑制欺骗承诺。
Comments 41 pages, 25 figures
通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力
机构 * Sun Yat-sen University(中山大学) ; Xiaomi Corporation(小米公司) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。
Comments 18 pages, 12 figures, 6 tables. Preprint
TemplateRL: 结构化模板引导的强化学习用于大语言模型推理
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Princeton University(普林斯顿大学) ; Shanghai AI Lab(上海人工智能实验室) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。
Comments Accepted by ACL 2026