arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-13 至 2026-03-13 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2411.00744 2026-03-13 cs.DB cs.CL cs.IR 57%

CARROT: A Learned Cost-Constrained Retrieval Optimization System for RAG

CARROT:一种用于RAG的学得式成本约束检索优化系统

Ziting Wang, Haitao Yuan, Wei Dong, Gao Cong, Feifei Li

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 CARROT通过MCTS和配置代理优化RAG检索,提升检索效率与准确性,实验显示性能提升达30%。

Comments Accepted to ICDE 2026. Updated title (previously "CORAG: A Cost-Constrained Retrieval Optimization System for Retrieval-Augmented Generation")

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13883 2026-03-13 cs.AI 57%

Domain-Independent Dynamic Programming

领域无关的动态规划

Ryo Kuroiwa, J. Christopher Beck

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于动态规划的新型求解方法DIDP,通过动态规划描述语言实现领域无关的求解,实验显示其在多个组合优化问题上优于传统MIP和CP求解器。

Comments Accepted manuscript in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11884 2026-03-13 cs.MA 50%

The price of decentralization in managing engineering systems through multi-agent reinforcement learning

在多智能体强化学习中管理工程系统去中心化的代价

Prateek Bhustali, Pablo G. Morato, Konstantinos G. Papakonstantinou, Charalampos P. Andriotis

专题命中 规划推理 :planning(abstract)

AI总结 本研究探讨了多智能体强化学习在管理工程系统时去中心化的代价,发现冗余度增加会加剧协调挑战,但去中心化策略仍能超越启发式基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11866 2026-03-13 cs.CV 50%

Derain-Agent: A Plug-and-Play Agent Framework for Rainy Image Restoration

Derain-Agent:一种用于雨去除图像恢复的即插即用代理框架

Zhaocheng Yu, Xiang Chen, Runzhe Li, Zihan Geng, Guanglu Sun, Haipeng Li, Kui Jiang

专题命中 规划推理 :planning(abstract)

AI总结 Derain-Agent通过动态代理框架和智能规划网络,实现雨去除的即插即用式精炼,提升去雨性能并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 9 篇

2505.18675 2026-03-13 cs.CV cs.AI cs.CL 81%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12166 2026-03-13 cs.CV 78%

LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning

LatentGeo: 在潜在空间中学习可学习的辅助构造以进行多模态几何推理

Haiying Xu, Zihan Wang, Song Dai, Zhengxuan Zhang, Kairan Dou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nankai University(南开大学) Communication University of China(中国传媒大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 LatentGeo通过学习潜在空间中的连续视觉表示,解决多模态几何推理中辅助构造的表示问题,采用三阶段课程和强化学习方法提升几何推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO 70%

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12238 2026-03-13 cs.CV 67%

SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation

SceneAssistant: 一种用于开放词汇3D场景生成的视觉反馈代理

Jun Luo, Jiaxiang Tang, Ruijie Lu, Gang Zeng

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SceneAssistant通过视觉反馈驱动代理实现开放词汇3D场景生成,结合3D物体生成模型和视觉-语言模型的空间推理能力,生成高质量且多样化的3D场景。

Comments Code: https://github.com/ROUJINN/SceneAssistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20823 2026-03-13 cs.CV cs.AI cs.LG 62%

RefTr: Recurrent Refinement of Confluent Trajectories for 3D Vascular Tree Centerlines

RefTr: 基于连通轨迹的3D血管树中心线递归细化

Roman Naeem, David Hagerman, Jennifer Alvén, Fredrik Kahl

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RefTr通过递归细化连通轨迹生成3D血管树中心线,采用Transformer架构提升精度并减少参数,实验显示其在性能、速度和参数数量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 57%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11515 2026-03-13 cs.AI 57%

Multi-Agent Collaboration for Automated Design Exploration on High Performance Computing Systems

多智能体协作用于高性能计算系统上的自动化设计探索

Harshitha Menon, Charles F. Jekel, Kevin Korner, Brian Gunnarson, Nathan K. Brown, Michael Stees, M. Giselle Fernandez-Godino, Walter Nissen, Meir H. Shachar, Dane M. Sterbentz, William J. Schill, Yue Hao, Robert Rieben, William Quadros, Steve Owen, Scott Mitchell, Ismael D. Boureima, Jonathan L. Belof

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MADA框架通过多智能体协作实现自动化设计探索,专注于惯性约束聚变中的RMI抑制问题,利用HPC系统和机器学习替代方案提升设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11447 2026-03-13 cs.RO 50%

Enhancing Lightweight Vision Language Models through Group Competitive Learning for Socially Compliant Navigation

通过群体竞争学习增强轻量级视觉语言模型以实现符合社会规范的导航

Xinyu Zhang, Atsushi Konno, Toshihiko Yamasaki, Ling Xiao

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出群体竞争学习策略,通过协调全局语义与分布正则化,提升轻量级VLMs在社交导航中的推理与决策能力,实现高准确性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2603.12246 2026-03-13 cs.AI cs.CL cs.LG 82%

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

检验推理LLM作为裁判在不可验证LLM后续训练中的表现

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20197 2026-03-13 cs.LG cs.AI 81%

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

混合策略强化学习可调节探索用于多模态推理

Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han

机构 * Aberystwyth University(阿伯里斯特维斯大学) Institute of Artificial Intelligence (TeleAl)(人工智能研究所) China Telecom(中国电信) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV 78%

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 测试时计算 :verifier(title,abstract)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 50%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11397 2026-03-13 cs.SD 50%

Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models

边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中

Xiangyuan Xue, Jiajun Lu, Yan Gao, Gongping Huang, Ting Dang, Hong Jia

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03400 2026-03-13 cs.RO 50%

GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement

GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强

Minquan Gao, Xinyi Li, Qing Yan, Xiaojian Sun, Xiaopan Zhang, Chien-Ming Huang, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级

Comments IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 12 篇

2602.19281 2026-03-13 cs.AI 90%

Limited Reasoning Space: The cage of long-horizon reasoning in LLMs

有限推理空间:LLMs中长视图推理的牢笼

Zhenyu Li, Guanlin Wu, Cheems Wang, Yongqiang Zhao

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出Halo框架,通过熵驱动的双控制器实现可控推理,解决LLM长视图任务中的推理限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10000 2026-03-13 cs.CL cs.LG 86%

Beyond the Prompt in Large Language Models: Comprehension, In-Context Learning, and Chain-of-Thought

大型语言模型中的提示之外:理解、上下文学习与推理链

Yuling Jiao, Yanming Lai, Huazhen Lin, Wensen Ma, Houduo Qi, Defeng Sun

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型在提示之外的理解、上下文学习和推理链机制,揭示了模型通过自回归过程推断转移概率、减少提示歧义以及分解复杂问题的能力,为高级提示工程提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13823 2026-03-13 cs.CV 85%

Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

Embed-RL: 用于推理驱动的多模态嵌入的强化学习

Haonan Jiang, Yuji Wang, Yongjie Zhu, Xin Lu, Wenyu Qin, Meng Wang, Pengfei Wan, Yansong Tang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。

Comments Correcting errors and improving organizational logic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11082 2026-03-13 cs.SE cs.AI 83%

Quality-Driven Agentic Reasoning for LLM-Assisted Software Design: Questions-of-Thoughts (QoT) as a Time-Series Self-QA Chain

以质量为导向的代理推理用于大语言模型辅助软件设计:问题-思考(QoT)作为时间序列自我QA链

Yen-Ku Liu, Yun-Cheng Tsai

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出QoT框架,通过时间序列自我QA链提升大语言模型辅助软件设计的质量,通过多领域实验验证其在不同模型规模和复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13093 2026-03-13 cs.AI cs.CL 81%

Consistency of Large Reasoning Models Under Multi-Turn Attacks

多轮攻击下大推理模型的一致性

Yubo Li, Ramayya Krishnan, Rema Padman

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估了多轮对抗攻击下九种前沿推理模型的鲁棒性,发现推理虽提供部分鲁棒性,但存在显著脆弱性,指出基于自信的防御需重新设计以适应推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11631 2026-03-13 cs.AI cs.CV 79%

VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought

VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理

Eunsoo Lee, Jeongwoo Lee, Minki Hong, Jangho Choi, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。

Comments 30 pages, 21 figures, EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12266 2026-03-13 cs.CV 78%

MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning

MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准

Haozhan Shen, Shilin Yan, Hongwei Xue, Shuaiqi Lu, Xiaojun Tang, Guannan Zhang, Tiancheng Zhao, Jianwei Yin

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。

Comments Project Page: https://accio-lab.github.io/MM-CondChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18607 2026-03-13 cs.AI 70%

From Entity-Centric to Goal-Oriented Graphs: Enhancing LLM Knowledge Retrieval in Minecraft

从以实体为中心到以目标为导向的图:增强Minecraft中的LLM知识检索

Jonathan Leung, Yongjie Wang, Zhiqi Shen

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出目标导向图(GoG)框架,通过构建目标依赖关系图提升LLM在Minecraft中的步骤推理能力,实验表明其优于GraphRAG等方法。

Comments Accepted at Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11223 2026-03-13 cs.CL cs.AI cs.IR 62%

MDER-DR: Multi-Hop Question Answering with Entity-Centric Summaries

MDER-DR: 基于实体中心摘要的多跳问答

Riccardo Campi, Nicolò Oreste Pinciroli Vago, Mathyas Giudici, Marco Brambilla, Piero Fraternali

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MDER-DR通过实体中心摘要和分解解决机制,提升多跳问答任务在稀疏复杂关系数据中的鲁棒性和性能。

Comments Our code is available at https://github.com/DataSciencePolimi/MDER-DR_RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 57%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11495 2026-03-13 cs.CL 57%

Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs

尝试、检查并重试:一种提升LLMs长上下文工具调用性能的分而治之框架

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du, Dacheng Tao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Tool-DC框架,通过'尝试-检查-重试'范式提升LLMs在长上下文工具调用任务中的性能,实验表明其在多个基准测试中均优于基线方法。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏