arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2603.13100 2026-03-16 cs.RO cs.AI 88%

Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences

评估VLMs在机器人运动中的空间推理能力:迈向具有运动偏好的机器人规划的一步

Wenxi Wu, Jingjing Zhang, Martim Brandão

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文评估了四种先进VLMs在机器人运动中的空间推理能力,探讨了运动偏好(如物体接近性和路径风格)的处理,并分析了准确率与计算成本的权衡。

Comments Accepted to the First Workshop on Efficient Spatial Reasoning at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12421 2026-03-16 cs.CV 88%

A Neuro-Symbolic Framework Combining Inductive and Deductive Reasoning for Autonomous Driving Planning

一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划

Hongyan Wei, Wael AbdAlmageed

机构 * Clemson University(克莱姆森大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。

Comments Under review. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12397 2026-03-16 cs.CL 85%

Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors

不只是终点,而是旅程:推理痕迹因果地塑造泛化行为

Pengcheng Wen, Yanxu Zhu, Jiapeng Sun, Han Zhu, Yujin Zhou, Chi-Min Chan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Jiaotong University(北京交通大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨推理痕迹对模型泛化行为的因果影响,通过设计控制实验发现不同推理类型导致不同行为模式,证明推理本身具有独立信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 82%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12710 2026-03-16 cs.AI cs.CL 81%

AI Planning Framework for LLM-Based Web Agents

基于大语言模型的网络代理的AI规划框架

Orit Shahnovsky, Rotem Dror

机构 * Faculty of Computer and Information Science, University of Haifa(计算机与信息科学学院,海法大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种将网络任务视为序列决策过程的AI规划框架,通过将现代代理架构映射到传统规划范式,提出五种新的评估指标,验证了全计划提前代理在技术指标上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12740 2026-03-16 cs.AI 79%

ToolTree: Efficient LLM Agent Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning

ToolTree: 通过双反馈蒙特卡洛树搜索与双向剪枝实现高效的LLM代理工具规划

Shuo Yang, Soyeon Caren Han, Yihao Ding, Shuhe Wang, Eduard Hoy

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出ToolTree,一种基于蒙特卡洛树搜索的工具规划方法,通过双阶段LLM评估和双向剪枝机制,提升工具使用序列的适应性和效率,实验表明其在多种基准测试中性能提升约10%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12607 2026-03-16 cs.RO cs.AI 79%

CarPLAN: Context-Adaptive and Robust Planning with Dynamic Scene Awareness for Autonomous Driving

CarPLAN: 基于动态场景感知的上下文自适应与鲁棒规划

Junyong Yun, Jungho Kim, ByungHyun Lee, Dongyoung Lee, Sehwan Choi, Seunghyeop Nam, Kichun Jo, Jun Won Choi

机构 * Department of Artificial Intelligence, Hanyang University(翰林大学人工智能系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Automotive Engineering, Hanyang University(翰林大学汽车工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 CarPLAN通过位移感知预测编码和上下文自适应多专家解码器,提升自动驾驶在复杂场景中的鲁棒性和适应性规划能力。

Comments 10 pages, 6 figures. Under review at IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14099 2026-03-16 cs.CV cs.AI 79%

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

FAPE-IR:面向全场景图像修复的频率感知规划与执行框架

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji

机构 * Tianjin University(天津大学) University of Macau(澳门大学) City University of Hong Kong(香港城市大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12994 2026-03-16 cs.RO 78%

Route Fragmentation Based on Resource-centric Prioritisation for Efficient Multi-Robot Path Planning in Agricultural Environments

基于资源优先的路线碎片化方法用于农业环境中高效多机器人路径规划

James R. Heselden, Gautham P. Das

机构 * Lincoln Centre for Autonomous Systems, University of Lincoln, UK(林肯自主系统中心,林肯大学,英国) Lincoln Institute for Agri-food Technology, University of Lincoln, UK(林肯农业食品技术研究所,林肯大学,英国)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于资源优先的路线碎片化方法,用于农业环境中高效多机器人路径规划,通过部分路线进展减少二进制等待影响,提升任务吞吐量。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12787 2026-03-16 cs.CV 78%

Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning

基本手术动作的通用识别促进技能评估和基于视觉-语言模型的手术规划

Mengya Xu, Daiyun Shen, Jie Zhang, Hon Chi Yip, Yujia Gao, Cheng Chen, Dillan Imans, Yonghao Long, Yiru Ye, Yixiao Liu, Rongyun Mai, Kai Chen, Hongliang Ren, Yutong Ban, Guangsuo Wang, Francis Wong, Chi-Fai Ng, Kee Yuan Ngiam, Russell H. Taylor, Daguang Xu, Yueming Jin, Qi Dou

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出包含10种基本手术动作的大型数据集,开发了新的基础模型以实现基本动作的通用识别,并展示了其在手术技能评估和手术规划中的应用。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12482 2026-03-16 cs.CV 78%

CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning

CalliMaster:通过布局引导的空间规划掌握页面级中文书法

Tianshuo Xu, Tiantian Hong, Zhifei Chen, Fei Chao, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01550 2026-03-16 cs.RO cs.CV 78%

NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测

Fei Liu, Shichao Xie, Minghua Luo, Zedong Chu, Junjun Hu, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(title,abstract)

AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12559 2026-03-16 physics.soc-ph 75%

Large Language Models as Delivery Rider: Generating Instant Food Delivery Riders' Routing Decision with LLM Agent Framework

大语言模型作为配送骑手:利用LLM代理框架生成即时食品配送骑手的路线决策

Chengbo Zhang, Zuopeng Xiao

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出LLM-DR框架,通过基于经验的骑手人设和基于推理的路线过程,模拟配送骑手的异质决策,以研究骑手劳动力战略对系统出行模式的影响。

Comments Proceedings of the 3rd International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17188 2026-03-16 cs.CL cs.AI cs.IR 73%

Towards AI Search Paradigm

迈向人工智能搜索范式

Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin

机构 * Baidu Search(百度搜索)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05344 2026-03-16 cs.AI 70%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12420 2026-03-16 cs.HC 67%

LLMs for Human Mobility: Opportunities, Challenges, and Future Directions

大语言模型在人类迁移中的应用:机遇、挑战与未来方向

Jie Gao, Yaoxin Wu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨大语言模型在人类迁移研究中的应用,总结了五个任务中的核心挑战与LLM解决方案,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12634 2026-03-16 cs.LG cs.AI 62%

Spend Less, Reason Better: Budget-Aware Value Tree Search for LLM Agents

少花钱,多思考:基于预算的值树搜索用于大语言模型代理

Yushu Li, Wenlong Deng, Jiajin Li, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需训练的推理时框架,通过单个LLM骨干模型将多跳推理建模为动态搜索树,并引入预算条件的节点选择机制,以在预算耗尽时实现从广度探索到贪婪利用的平稳过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12500 2026-03-16 cs.CE cs.AI 57%

TRACE: Temporal Rule-Anchored Chain-of-Evidence on Knowledge Graphs for Interpretable Stock Movement Prediction

TRACE: 基于知识图谱的时序规则锚定证据链的可解释股票走势预测

Qianggang Ding, Haochen Shi, Luis Castejón Lozano, Miguel Conner, Juan Abia, Luis Gallego-Ledesma, Joshua Fellowes, Gerard Conangla Planes, Adam Elwood, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) Mila – Québec AI Institute(魁北克人工智能研究所) Aily Labs(Aily实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TRACE通过结合符号关系先验、动态图探索和LLM引导决策,实现股票预测的可解释性,实验表明其在S&P 500基准上取得优于基线的准确率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12396 2026-03-16 cs.IR cs.AI 57%

Test-Time Strategies for More Efficient and Accurate Agentic RAG

测试时策略用于更高效和准确的代理RAG

Brian Zhang, Deepti Guntur, Zhiyang Zuo, Abhinav Sharma, Shreyas Chaudhari, Wenlong Zhao, Franck Dernoncourt, Puneet Mathur, Ryan Rossi, Nedim Lipka

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出测试时改进Search-R1流程,通过上下文模块和去重模块提升RAG系统在复杂多跳问题中的效率和准确性,实验表明在HotpotQA和Natural Questions数据集上EM得分提高5.6%,检索次数减少10.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08705 2026-03-16 cs.LG cs.GT cs.MA 57%

Partially Observable Multi-Agent Reinforcement Learning with Information Sharing

部分可观测多智能体强化学习与信息共享

Xiangyu Liu, Kaiqing Zhang

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文研究了在部分可观测随机游戏框架下可证明的多智能体强化学习问题,提出利用智能体间的信息共享来解决计算复杂性问题,并设计了具有准多项式时间复杂度的算法,扩展至合作部分可观测马尔可夫决策过程。

Comments Final journal version of the ICML 2023 conference paper, accepted to SIAM Journal on Control and Optimization (SICON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12406 2026-03-16 cs.SE 50%

Team Diversity Promotes Software Fairness: An Experiment on Fairness-Aware Requirements Prioritization

团队多样性促进软件公平性:一项关于公平意识需求优先级排序的实验

Cleyton Magalhes, Ronnie de Souza Santos, Bimpe Ayoola, Brody Stuart-Verner, Italo Santos

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨了软件团队多样性对需求优先级排序中公平意识行为的影响,发现多样性团队更一致地拒绝存在公平风险的故事,且决策理由更强调包容性和伦理责任。

详情

展开后加载摘要…

URL PDF HTML 收藏