arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2604.12076 2026-04-15 cs.CL cs.AI cs.CY 90%

Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models

数字之外的叙事:可识别受害者效应及其在对齐和推理中的放大

Syed Rifat Raiyan

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型中可识别受害者效应的普遍存在及其受对齐训练的影响,发现指令调优模型表现出极端效应,而推理专精模型则逆转了该效应,且标准CoT提示放大了该效应。

Comments Under review, 49 pages, 20 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19917 2026-04-15 cs.CL 83%

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models

PILOT:通过内部化潜在优化轨迹进行大语言模型的规划

Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 PILOT通过内部化潜在优化轨迹,帮助大语言模型克服长周期任务中的推理不稳定问题,实验显示其在数学和编码基准测试中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10929 2026-04-15 cs.RO 82%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 81%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11047 2026-04-15 cs.CL cs.LG 81%

CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs

CoG:通过关系蓝图和故障感知细化实现可控图推理

Yuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CoG框架,通过关系蓝图和故障感知细化模块,解决知识图谱中推理稳定性与效率问题,实验显示其在准确性和效率上均优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12493 2026-04-15 cs.CL cs.AI 81%

Latent Planning Emerges with Scale

在规模下显现的潜在规划

Michael Hanna, Emmanuel Ameisen

机构 * ILLC, University of Amsterdam(伊拉斯姆斯自由大学,阿姆斯特丹大学) Anthropic

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在简单规划任务中潜在规划能力随规模增加而增强的现象,发现模型能通过内部表示生成未来词并影响上下文,但复杂任务如押韵对句中规划能力有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12627 2026-04-15 cs.AI 79%

KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance

KnowRL: 通过最小充分知识引导的强化学习提升大语言模型推理

Linhao Yu, Tianmeng Yang, Siyu Ding, Renren Jin, Naibin Gu, Xiangzhao Hao, Shuaiyi Nie, Deyi Xiong, Weichong Yin, Yu Sun, Hua Wu

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 KnowRL通过最小充分知识引导的强化学习框架提升大语言模型推理能力,通过分解知识点并优化子集选择,在八个基准测试中超越现有基线,达到70.08的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25758 2026-04-15 cs.AI 79%

Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training

思考火花!:推理模型后训练期间的涌现注意力头

Yein Park, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(韩国大学) Upstage AI AIGEN Sciences(AIGEN 科技)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了后训练技术如何通过涌现的注意力头提升推理能力,分析不同训练方法对注意力头演化的影响,并揭示了复杂推理与基础计算之间的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12126 2026-04-15 cs.AI cs.CL 79%

Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching

在大规模工具空间中通过熵引导分支实现长周期计划执行

Rongzhe Wei, Ge Shi, Min Cheng, Na Zhang, Pan Li, Sarthak Ghosh, Vaibhav Gorde, Leman Akoglu

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出熵引导分支算法,解决大规模工具库中长周期任务执行的挑战,通过动态扩展高预测熵的决策分支,提升任务成功率和计算效率。

Comments This work was completed during an internship at Amazon

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12628 2026-04-15 math.OC cs.RO 78%

A Comparison of Reinforcement Learning and Optimal Control Methods for Path Planning

强化学习与最优控制方法在路径规划中的比较

Qiang Le, Yaguang Yang, Isaac E. Weintraub

机构 * Department of Electrical and Computer Engineering, Hampton University(哈珀学院电气与计算机工程系) Air Warfare Directorate, Air Force Research Laboratory(空军研究实验室空战 Directorate)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文比较了强化学习与最优控制方法在路径规划中的应用,提出基于DDPG的方法能快速生成安全路径,但存在不可行区域,未来将改进奖励函数和探索其他方法。

Comments 8 pages, 9 figures, submitted to AAAI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 73%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 67%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12995 2026-04-15 cs.CL cs.CY 57%

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

PolicyLLM:迈向大型语言模型在公共政策领域的卓越理解

Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PolicyBench基准和PolicyMoE模型,评估大型语言模型在公共政策理解中的能力,发现其在应用任务中表现更优,揭示了当前LLM在政策理解中的局限性。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12762 2026-04-15 cs.CV cs.AI cs.MA 57%

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

ARGOS:智能多摄像机人像搜索中的谁、哪里和何时

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

机构 * KAIST(韩国科学技术院) University of Seoul(首尔大学) KIST(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。

Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13647 2026-04-15 cs.RO cs.AI 57%

Improved particle swarm optimization algorithm: multi-target trajectory optimization for swarm drones

改进的粒子群优化算法:多目标轨迹优化用于群无人机

Minze Li, Wei Zhao, Ran Chen, Mingqiang Wei

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PE-PSO算法,通过引入持久探索机制和熵基参数调整策略,提升群无人机在动态环境中的实时轨迹规划能力,实验表明其在轨迹质量、能耗效率等方面优于传统方法。

Comments New experiments have revealed systematic errors in the original data

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17086 2026-04-15 cs.CL 57%

Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning

通过最小化强化学习推进多智能体RAG系统

Yihong Wu, Liheng Ma, Muzhi Li, Jiaming Zhou, Lei Ding, Jianye Hao, Ho-fung Leung, Irwin King, Yingxue Zhang, Jian-Yun Nie

机构 * McGill University \& Mila Montréal QC Canada The Chinese University of Hong Kong Hong Kong China Huawei Noah’s Ark Lab Montréal QC Canada University of Manitoba Winnipeg MB Canada Tianjin University Tianjin China Independent Researcher Hong Kong China McGill University \& Mila The Chinese University of Hong Kong Huawei Noah’s Ark Lab University of Manitoba Tianjin University Independent Researcher

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Mujica-MyGo框架,通过多智能体RAG流程分解多轮交互,结合轻量强化学习算法MyGO,有效解决长上下文问题,提升复杂问答性能。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12437 2026-04-15 cs.CV 50%

A Hybrid Architecture for Benign-Malignant Classification of Mammography ROIs

一种用于乳腺X线摄影ROI良性恶性分类的混合架构

Mohammed Asad, Mohit Bajpai, Sudhir Singh, Rahul Katarya

机构 * Dept. of Electronics and Communication Engineering(电子与通信工程系) Delhi Technological University(德里技术大学) Dept. of Information Technology(信息科技系) IGDTUW Dept. of Computer Science and Engineering(计算机科学与工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出结合EfficientNetV2-M和Vision Mamba的混合架构,用于乳腺X线摄影ROI的良性恶性分类,实现高效全局上下文建模和局部特征提取,提升病变级别分类性能。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22799 2026-04-15 cs.CV 50%

VPTracker: Global Vision-Language Tracking via Visual Prompt

VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪

Jingchao Wang, Kaiwen Zhou, Zhijian Wu, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏