arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10960 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 10960 篇

2607.05772 2026-07-08 cs.SE 新提交 85%

Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents

通过基于大语言模型的智能体进行多阶段推理来检测导致漏洞的提交

Liyou Chen, Hailong Sun, Xiang Gao, Yue Pan

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 研究旨在检测导致漏洞的提交,提出基于大语言模型的多智能体框架VIC - RAGENT,利用多个专业智能体提供互补视角,通过多阶段推理过程完善候选漏洞,实验表明其性能优于基线,为VIC检测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 85%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV 85%

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20164 2026-06-19 cs.CL cs.AI cs.LG q-bio.QM 新提交 85%

MedRLM: Recursive Multimodal Health Intelligence for Long-Context Clinical Reasoning, Sensor-Guided Screening, Evidence-Grounded Decision Support, and Community-to-Tertiary Referral Optimization

MedRLM:用于长上下文临床推理、传感器引导筛查、证据支持决策及社区到三级转诊优化的递归多模态健康智能

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathum Thani, Thailand 1

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MedRLM递归多模态健康智能框架,通过递归检查、分解、检索、验证和合成患者信息,协调多个专业代理并引入临床证据图记忆,实现长上下文临床推理和传感器引导筛查。

Comments 9 pages, 3 figures, 3 tables, 1 Algorithm, 29 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21198 2026-05-26 cs.LG cs.AI cs.CL cs.CV cs.RO 85%

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

从试错中学习:具身大语言模型的反思式测试时规划

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Leonidas Guibas, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16205 2026-05-18 cs.AI cs.CL cs.LG cs.MA cs.SY eess.SY 85%

Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

上下文、推理与层次:在对抗性POMDP中的复合LLM代理设计成本-性能研究

Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman

机构 * Carleton University(卡尔顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了在对抗性部分可观测序贯环境中,复合LLM代理设计的上下文、推理和层次分解对性能与成本的影响,发现程序化状态抽象在成本效率上表现最佳,而分层分解无需推理可获得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07776 2026-05-11 cs.LG cs.AI cs.CL 85%

Tracing Uncertainty in Language Model "Reasoning"

追踪语言模型推理中的不确定性

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Frellsen

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根技术大学数据科学部门) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心MaiNLP) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过不确定性量化分析语言模型推理轨迹,发现其不确定性特征可预测最终答案正确性,且早期即可检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07745 2026-04-21 cs.CL cs.AI cs.LG 85%

Parallel Test-Time Scaling for Latent Reasoning Models

潜在推理模型的并行测试时缩放

Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shandong Jianzhu University(山东建筑大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过改进采样和聚合方法,使潜在推理模型能有效利用并行测试时缩放,提升连续空间中的推理能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01062 2026-04-10 cs.CL cs.AI cs.LG 85%

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

SealQA: 提升搜索增强语言模型在事实性问题中的推理能力

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。

Comments Camera Ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21272 2026-03-24 cs.AI cs.CL cs.DS cs.LG 85%

The Library Theorem: How External Organization Governs Agentic Reasoning Capacity

图书馆定理:外部组织如何支配代理推理能力

Zachary F. Mainen

机构 * Champalimaud Foundation(Champalimaud基金会)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了外部组织对代理推理能力的影响,通过实验验证了索引外部记忆的代理在检索效率上的优势,并指出语言模型在索引构建与导航协议执行中的分离需求。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 85%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25260 2026-02-17 cs.AI cs.CL cs.LG 85%

Internal Planning in Language Models: Characterizing Horizon and Branch Awareness

语言模型中的内部规划:刻画视野与分支意识

Muhammed Ustaomeroglu, Baris Askin, Gauri Joshi, Carlee Joe-Wong, Guannan Qu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析语言模型内部计算结构,揭示规划视野与分支意识的特性,为理解模型内部动态提供通用工具。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18282 2026-02-09 cs.AI cs.CL cs.LG 85%

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 85%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20194 2026-01-29 cs.HC 85%

An Autonomous Agent Framework for Feature-Label Extraction from Device Dialogues and Automatic Multi-Dimensional Device Hosting Planning Based on Large Language Models

基于大语言模型的自主代理框架:用于设备对话中特征-标签提取与自动多维设备托管规划

Huichao Men, Yizhen Hu, Yu Gao, Xiaofeng Mou, Yi Xu, Xinhua Xiao

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AirAgent框架,利用大语言模型实现家庭空气系统的自主管理,通过双层协作架构提升空气质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08468 2026-01-14 cs.CL cs.AI cs.LG 85%

JudgeRLVR: Judge First, Generate Second for Efficient Reasoning

JudgeRLVR: 先判后生成以实现高效推理

Jiangshan Duo, Hanyu Li, Hailin Zhang, Yudong Wang, Sujian Li, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) CFCS, School of Computer Science, Peking University(计算机学院,北京大学) LLM-Core Xiaomi(小智LLM核心)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JudgeRLVR通过先判后生成的双阶段方法,提升大型语言模型在数学领域内的推理效率与准确性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA 85%

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09284 2025-12-23 cs.AI cs.CL cs.LG 85%

Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning

Tree-OPO: 用于多步推理的逆政策蒙特卡洛树引导优势优化

Bingning Huang, Tu Nguyen, Matthieu Zimmer

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Tree-OPO通过引入分阶段优势估计框架,利用MCTS生成轨迹优化策略学习,提升数学推理任务的准确性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09349 2025-12-11 cs.RO 85%

COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning

COVLM-RL:基于VLM引导强化学习的自动驾驶中关键对象导向推理

Lin Li, Yuxin Cai, Jianwu Fang, Jianru Xue, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 COVLM-RL通过结合关键对象导向推理与VLM引导强化学习,提升了自动驾驶系统的泛化能力和训练效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13757 2025-11-07 cs.CV 85%

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

Comments NeurIPS 2025; Website link:https://autovla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17109 2025-10-21 cs.CL cs.AI cs.LG cs.MA 85%

Verification-Aware Planning for Multi-Agent Systems

Tianyang Xu, Dan Zhang, Kushan Mitra, Estevam Hruschka

机构 * Purdue University, USA(普渡大学,美国) Megagon Labs, USA(梅加隆实验室,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submission for ARR Oct

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16767 2025-10-21 cs.RO 85%

T3 Planner: A Self-Correcting LLM Framework for Robotic Motion Planning with Temporal Logic

Jia Li, Guoxiang Zhao

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15244 2025-10-21 cs.CL cs.AI cs.LG 85%

Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning

Lina Berrayana, Ahmed Heakl, Muhammad Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25852 2025-10-01 cs.RO 85%

Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation

Zitong Bo, Yue Hu, Jinming Ma, Mingliang Zhou, Junhui Yin, Yachen Kang, Yuqi Liu, Tong Wu, Diyun Xiang, Hao Chen

机构 * Xiaomi Robotics Lab(小米机器人实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11420 2025-09-16 q-fin.TR cs.AI cs.CE cs.CL cs.LG 85%

Trading-R1: Financial Trading with LLM Reasoning via Reinforcement Learning

Yijia Xiao, Edward Sun, Tong Chen, Fang Wu, Di Luo, Wei Wang

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Tauric Research: https://github.com/TauricResearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03864 2025-08-08 cs.AI cs.CL cs.LG 85%

DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search

Murong Yue, Wenlin Yao, Haitao Mi, Dian Yu, Ziyu Yao, Dong Yu

机构 * George Mason University(乔治·马歇尔大学) Tencent AI Lab(腾讯AI实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00669 2025-08-04 cs.CL cs.AI cs.CV cs.LG 85%

Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

Wenxuan Wang, Zizhan Ma, Meidan Ding, Shiyi Zheng, Shengyuan Liu, Jie Liu, Jiaming Ji, Wenting Chen, Xiang Li, Linlin Shen, Yixuan Yuan

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen University(深圳大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08224 2025-07-22 cs.RO 85%

Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning

Chan Young Park, Jillian Fisher, Marius Memmel, Dipika Khullar, Seoho Yun, Abhishek Gupta, Yejin Choi

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

Comments Code Available: https://github.com/chan0park/SelfReVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12728 2025-06-17 cs.SE 85%

MCTS-Refined CoT: High-Quality Fine-Tuning Data for LLM-Based Repository Issue Resolution

Yibo Wang, Zhihao Peng, Ying Wang, Zhao Wei, Hai Yu, Zhiliang Zhu

专题命中 规划推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12119 2025-05-26 cs.AI cs.CL cs.LG 85%

Mastering Board Games by External and Internal Planning with Language Models

John Schultz, Jakub Adamek, Matej Jusup, Marc Lanctot, Michael Kaisers, Sarah Perrin, Daniel Hennes, Jeremy Shar, Cannada Lewis, Anian Ruoss, Tom Zahavy, Petar Veličković, Laurel Prince, Satinder Singh, Eric Malmi, Nenad Tomašev

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 70 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏