arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-13 至 2026-03-13 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2602.19281 2026-03-13 cs.AI 90%

Limited Reasoning Space: The cage of long-horizon reasoning in LLMs

有限推理空间:LLMs中长视图推理的牢笼

Zhenyu Li, Guanlin Wu, Cheems Wang, Yongqiang Zhao

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出Halo框架,通过熵驱动的双控制器实现可控推理,解决LLM长视图任务中的推理限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10000 2026-03-13 cs.CL cs.LG 86%

Beyond the Prompt in Large Language Models: Comprehension, In-Context Learning, and Chain-of-Thought

大型语言模型中的提示之外:理解、上下文学习与推理链

Yuling Jiao, Yanming Lai, Huazhen Lin, Wensen Ma, Houduo Qi, Defeng Sun

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型在提示之外的理解、上下文学习和推理链机制,揭示了模型通过自回归过程推断转移概率、减少提示歧义以及分解复杂问题的能力,为高级提示工程提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13823 2026-03-13 cs.CV 85%

Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

Embed-RL: 用于推理驱动的多模态嵌入的强化学习

Haonan Jiang, Yuji Wang, Yongjie Zhu, Xin Lu, Wenyu Qin, Meng Wang, Pengfei Wan, Yansong Tang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。

Comments Correcting errors and improving organizational logic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11082 2026-03-13 cs.SE cs.AI 83%

Quality-Driven Agentic Reasoning for LLM-Assisted Software Design: Questions-of-Thoughts (QoT) as a Time-Series Self-QA Chain

以质量为导向的代理推理用于大语言模型辅助软件设计:问题-思考(QoT)作为时间序列自我QA链

Yen-Ku Liu, Yun-Cheng Tsai

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出QoT框架,通过时间序列自我QA链提升大语言模型辅助软件设计的质量,通过多领域实验验证其在不同模型规模和复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13093 2026-03-13 cs.AI cs.CL 81%

Consistency of Large Reasoning Models Under Multi-Turn Attacks

多轮攻击下大推理模型的一致性

Yubo Li, Ramayya Krishnan, Rema Padman

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估了多轮对抗攻击下九种前沿推理模型的鲁棒性,发现推理虽提供部分鲁棒性,但存在显著脆弱性,指出基于自信的防御需重新设计以适应推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11631 2026-03-13 cs.AI cs.CV 79%

VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought

VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理

Eunsoo Lee, Jeongwoo Lee, Minki Hong, Jangho Choi, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。

Comments 30 pages, 21 figures, EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12266 2026-03-13 cs.CV 78%

MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning

MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准

Haozhan Shen, Shilin Yan, Hongwei Xue, Shuaiqi Lu, Xiaojun Tang, Guannan Zhang, Tiancheng Zhao, Jianwei Yin

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。

Comments Project Page: https://accio-lab.github.io/MM-CondChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18607 2026-03-13 cs.AI 70%

From Entity-Centric to Goal-Oriented Graphs: Enhancing LLM Knowledge Retrieval in Minecraft

从以实体为中心到以目标为导向的图:增强Minecraft中的LLM知识检索

Jonathan Leung, Yongjie Wang, Zhiqi Shen

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出目标导向图(GoG)框架,通过构建目标依赖关系图提升LLM在Minecraft中的步骤推理能力,实验表明其优于GraphRAG等方法。

Comments Accepted at Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11223 2026-03-13 cs.CL cs.AI cs.IR 62%

MDER-DR: Multi-Hop Question Answering with Entity-Centric Summaries

MDER-DR: 基于实体中心摘要的多跳问答

Riccardo Campi, Nicolò Oreste Pinciroli Vago, Mathyas Giudici, Marco Brambilla, Piero Fraternali

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MDER-DR通过实体中心摘要和分解解决机制,提升多跳问答任务在稀疏复杂关系数据中的鲁棒性和性能。

Comments Our code is available at https://github.com/DataSciencePolimi/MDER-DR_RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 57%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11495 2026-03-13 cs.CL 57%

Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs

尝试、检查并重试:一种提升LLMs长上下文工具调用性能的分而治之框架

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du, Dacheng Tao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Tool-DC框架,通过'尝试-检查-重试'范式提升LLMs在长上下文工具调用任务中的性能,实验表明其在多个基准测试中均优于基线方法。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏