Limited Reasoning Space: The cage of long-horizon reasoning in LLMs
有限推理空间:LLMs中长视图推理的牢笼
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 本文提出Halo框架,通过熵驱动的双控制器实现可控推理,解决LLM长视图任务中的推理限制问题。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
有限推理空间:LLMs中长视图推理的牢笼
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 本文提出Halo框架,通过熵驱动的双控制器实现可控推理,解决LLM长视图任务中的推理限制问题。
大型语言模型中的提示之外:理解、上下文学习与推理链
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 本研究探讨了大型语言模型在提示之外的理解、上下文学习和推理链机制,揭示了模型通过自回归过程推断转移概率、减少提示歧义以及分解复杂问题的能力,为高级提示工程提供了理论支持。
Embed-RL: 用于推理驱动的多模态嵌入的强化学习
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。
Comments Correcting errors and improving organizational logic
以质量为导向的代理推理用于大语言模型辅助软件设计:问题-思考(QoT)作为时间序列自我QA链
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出QoT框架,通过时间序列自我QA链提升大语言模型辅助软件设计的质量,通过多领域实验验证其在不同模型规模和复杂度下的效果。
多轮攻击下大推理模型的一致性
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究评估了多轮对抗攻击下九种前沿推理模型的鲁棒性,发现推理虽提供部分鲁棒性,但存在显著脆弱性,指出基于自信的防御需重新设计以适应推理模型。
VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理
机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) ; Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。
Comments 30 pages, 21 figures, EACL 2026 Findings
MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。
Comments Project Page: https://accio-lab.github.io/MM-CondChain
从以实体为中心到以目标为导向的图:增强Minecraft中的LLM知识检索
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出目标导向图(GoG)框架,通过构建目标依赖关系图提升LLM在Minecraft中的步骤推理能力,实验表明其优于GraphRAG等方法。
Comments Accepted at Knowledge-Based Systems
MDER-DR: 基于实体中心摘要的多跳问答
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 MDER-DR通过实体中心摘要和分解解决机制,提升多跳问答任务在稀疏复杂关系数据中的鲁棒性和性能。
Comments Our code is available at https://github.com/DataSciencePolimi/MDER-DR_RAG
FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。
尝试、检查并重试:一种提升LLMs长上下文工具调用性能的分而治之框架
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出Tool-DC框架,通过'尝试-检查-重试'范式提升LLMs在长上下文工具调用任务中的性能,实验表明其在多个基准测试中均优于基线方法。
Comments 17 pages, 8 figures
消除幻觉:一种动态框架用于评估大语言模型的消除
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学) ; IBM Research(IBM研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。
Comments Published at COLM 2025