Post-Hoc Reasoning in Chain of Thought: Decoding and Steering Pre-Committed Answers
在生成链式推理前解码答案:来自预CoT探测器和激活引导的证据
专题命中 规划推理 :CoT(title_cn,summary_cn);reasoning(title,abstract);分类 cs.AI
AI总结 研究发现,模型在生成链式推理前已确定答案,通过激活引导实验揭示了预CoT过程中的因果关系及潜在错误模式。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
在生成链式推理前解码答案:来自预CoT探测器和激活引导的证据
专题命中 规划推理 :CoT(title_cn,summary_cn);reasoning(title,abstract);分类 cs.AI
AI总结 研究发现,模型在生成链式推理前已确定答案,通过激活引导实验揭示了预CoT过程中的因果关系及潜在错误模式。
用于动态机器人任务规划的视觉-语言-策略模型
机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) ; Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。
基于RSA的前瞻性规划:通过跨未来时间步投影用户意识实现动态环境中的高效信号传递
机构 * Saarland University(萨尔兰大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于RSA的前瞻性规划方法,通过跨未来时间步投影用户意识,优化动态环境中的人机协作效率。
Comments 11 pages, 3 figures
Journal ref Proc. of the 25th Int. Conf. on Autonomous Agents and Multiagent Systems (AAMAS 2026)
PRO-LONG:程序化内存实现长程推理
机构 * Duke University(杜克大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。
图上搜索:面向知识图谱的大语言模型推理的迭代式知情导航
机构 * Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Digital Media, CBC(数字媒体,CBC) ; Halmstad University College(哈姆斯塔德大学学院) ; University of Waterloo(滑铁卢大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出Search-on-Graph方法,通过让大语言模型自身基于知识图谱结构和完整推理历史选择关系路径,遵循观察-思考-导航范式,在六个KGQA基准上超越现有方法,无需任务特定微调。
Comments Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)
基于概率超属性的去中心化规划
机构 * Brno University of Technology(布拉格技术大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出利用概率超属性和MDP进行去中心化规划,扩展了规划技术的规范能力,并建立了与特定Dec-MDPs规划的联系。
Comments 11 pages, 1 figure, 2 tables. Accepted at AAMAS 2025: the 24th International Conference on Autonomous Agents and Multiagent Systems
PlanE:基于抽取式大语言模型的数据、调优和推理的元规划
机构 * Ant Group(蚂蚁集团) ; School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)
专题命中 规划推理 :planning(title);分类 cs.AI
AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。
因果智能体图像恢复:用于自适应图像恢复智能体的自进化因果记忆
机构 * Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 针对图像恢复智能体知识存储局限,提出Causal-AgentIR框架,通过构建结构化因果记忆图及协作系统,支持智能体进行因果推理,依质量变化和反馈调整恢复经验,有效提升图像恢复能力。
训练用于自解释忠实性的大语言模型
机构 * Imperial College London(帝国理工学院)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。
Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)
MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。
Comments 16 pages, 8 figures
通过动态评分标准共同进化大语言模型评估器和策略
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。
Comments add online model info (approved)
智能体上下文管理:将智能体内存和成本视为生命周期和架构问题来解决
机构 * Maximem
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究生产型人工智能智能体因无法管理推理上下文而失败的问题,提出智能体上下文管理(ACM),分解为五个原语,经经济分析和参考实现验证,在特定配置下取得较好结果,还指出了现有基准未涵盖的维度及上下文前沿。
Comments 23 pages, 6 figures, 4 tables. Evaluation harness and study data: github.com/maximem-ai
ICAE-Bench:将编码智能体评估为交互式项目构建者
机构 * Meituan(美团)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。
SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。
GuardianAgentBench:智能体何处失败及如何防范
机构 * Vectara, Inc.(Vectara公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(DeepSeek人工智能公司)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。
用于证据感知材料文献分析的技能收缩代理
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。
Comments 9 pages, 5 figures
SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏
机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) ; Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; AI Security Lab, Beijing, China(360人工智能安全实验室)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。
Comments Accepted by ICML 2026
TeaRAG:一种令牌高效的智能检索增强生成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。
Comments 34 pages
随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶
机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) ; Southwest University, China(西南大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。
Comments Has been submitted to AAAI 2026
迈向边缘到云连续体上的联邦认知数字孪生
专题命中 规划推理 :reasoning(abstract)
AI总结 本文针对数字孪生在分布式环境中的问题,提出联邦认知数字孪生架构,结合联邦与认知,通过本地和全局孪生体在边缘到云连续体上分布智能,集成分布式自主性与认知推理,提升复杂分布式CPS的可扩展性、响应能力和决策能力。
用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整
机构 * Dalian University of Technology(大连理工大学) ; The University of Tokyo(东京大学)
专题命中 规划推理 :planning(abstract)
AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。
城市电缆路由优化的可变邻域搜索算法中的采样学习
专题命中 规划推理 :planning(abstract)
AI总结 针对城市电缆路由优化这一大规模双层组合优化问题,提出学习辅助可变邻域搜索(L-VNS)算法,该算法集成四个关键组件,经实验验证其相比其他方法有优越性,能有效降低建设成本,且具有有效性和鲁棒性。
Comments Accepted by Swarm and Evolutionary Computation
Journal ref Swarm and Evolutionary Computation; Volume 106, June 2026, 102432