arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2605.11534 2026-05-13 cs.RO 88%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11553 2026-05-13 cs.IR 82%

TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning

TwiSTAR:快速思考,缓慢思考,然后行动,基于语义ID的生成推荐

Shiteng Cao, Kaian Jiang, Yunlong Gong, Zhiheng Li

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出TwiSTAR框架,通过自适应分配推理努力提升推荐准确性与效率,利用语义ID检索、轻量级排序和慢推理模型,结合常识知识增强,减少延迟并优于基线方法。

Comments 16pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11666 2026-05-13 cs.LG cs.AI 81%

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

进化任务发现:通过技能组合与复杂性缩放推进推理前沿

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvoTD框架,通过结构化进化算子在算法技能与复杂性属性的双轴流形上进行数据合成,提升模型推理能力,并在不同架构和规模上实现稳定泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17265 2026-05-13 cs.IR 78%

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search

MemSearch-o1:通过基于推理的内存增长增强大语言模型的代理搜索

Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 规划推理 :reasoning(title,abstract)

AI总结 MemSearch-o1通过基于推理的内存增长和回溯机制,解决代理搜索中的内存稀释问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11514 2026-05-13 cs.CR 78%

FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems

FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞

Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

专题命中 规划推理 :planning(title,abstract)

AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11225 2026-05-13 cs.AI cs.LG cs.MA 76%

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT:通过轨迹细化弥合LLM代理中的规划与执行

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

专题命中 规划推理 :planning(title);分类 cs.AI、cs.LG

AI总结 PIVOT通过自监督框架迭代优化轨迹,解决LLM代理规划与执行不一致问题,实验证明其在约束满足和计算效率上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05513 2026-05-13 cs.IR 75%

LEAPS: An LLM-Empowered Adaptive Plugin in Taobao AI Search

LEAPS: 阿里巴巴淘宝AI搜索中的大语言模型赋能自适应插件

Lei Wang, Jinhang Wu, Zhibin Wang, Biye Li

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 LEAPS通过'拓宽与精炼'范式优化搜索流程,提升购物对话体验,同时保持传统检索性能并支持低成本集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 74%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07744 2026-05-13 cs.AI 74%

Alternating Target-Path Planning for Scalable Multi-Agent Coordination

可扩展多智能体协调的交替目标路径规划

Yu Kumagai, Keisuke Okumura

机构 * Hitotsubashi University, Japan(日本立命堂大学) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本国家先进工业科学和技术研究院)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文提出一种迭代优化框架,将目标分配与路径规划解耦,利用高效MAPF求解器实现可扩展的多智能体协同路径规划,有效提升大规模TAPF问题的求解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 70%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26752 2026-05-13 cs.CV 67%

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

GLM-5V-Turbo:迈向多模态代理的原生基础模型

V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehan Qi, Zehai He, Yutao Zhang, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yu Yang, Yongbin Liu, Yijian Lu, Yifan Xu, Yanzi Wang, Yanxiao Zhao, Yanfeng Wang, Yadong Xue, Yabo Xu, Xinyu Zhang, Xinyu Liu, Xiao Liu, Wenyi Zhao, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shudan Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, lat Long long, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Jiadai Sun, Haozhi Zheng, Haoran Wang, Haochen Li, Hanyu Lai, Han Xu, Fan Yang, Dan Zhang, Da Yin, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowen Lv, Bowei Jia, Bo Li, Bin Chen, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Z.ai & Tsinghua University(Z.ai与清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 GLM-5V-Turbo旨在提升多模态代理的感知与执行能力,通过整合多模态感知作为推理、规划和工具使用的核心组件,实现跨异构上下文的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12289 2026-05-13 cs.LG cs.AI 62%

PriorZero: Bridging Language Priors and World Models for Decision Making

PriorZero:连接语言先验与世界模型以实现决策制定

Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PriorZero通过解耦的rollout训练设计,将LLM生成的语义先验整合到基于世界模型的规划中,提升探索效率和长期性能,适用于文本冒险游戏和指令遵循任务。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07637 2026-05-13 cs.AI cs.LG cs.MA 62%

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

为大规模多智能体路径规划学习本地通信

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Oleg Bulichev, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LC-MAPF,通过多轮本地通信提升多智能体协作,优于现有基于强化学习和模仿学习的MAPF求解器,且保持可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11114 2026-05-13 cs.LG cs.AI stat.ML 62%

In-Context Multi-Objective Optimization

上下文多目标优化

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TAMO通过Transformer架构实现多目标黑盒优化,无需重新训练即可在不同任务间转移,显著提升优化效率并保持帕累托前沿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11373 2026-05-13 cs.AI cs.LG stat.ML 62%

Causal Algorithmic Recourse: Foundations and Methods

因果算法补救:基础与方法

Drago Plecko, Collin Wang, Elias Bareinboim

机构 * Department of Statistics & Data Science(统计与数据科学系) UCLA(加州大学洛杉矶分校) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果框架,通过预后干预结果建模算法补救过程,引入后补救稳定性条件,开发基于copula的算法推断补救效果,并提供分布自由方法学习补救效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL 62%

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12294 2026-05-13 cs.AI 57%

Executable Agentic Memory for GUI Agent

可执行代理记忆用于GUI代理

Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

机构 * Tsinghua University, China(清华大学, 中国) Sun Yat-sen University, China(中山大学, 中国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12129 2026-05-13 cs.SE cs.AI cs.OS 57%

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

大小并非关键:Harness设计决定小型语言模型的操作稳定性

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过实验分析Harness工程水平对小型语言模型操作性能的影响,采用三种Harness条件在24项任务中比较TSR和VTSR,发现Pipeline Harness在Gemma4 E2B上取得高成功率,且发现最小外壳条件下的TSR低于模型-only条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12106 2026-05-13 cs.AI 57%

Large Language Models as Amortized Pareto-Front Generators for Constrained Bi-Objective Convex Optimization

大语言模型作为约束双目标凸优化的 amortized 帕累托前沿生成器

Peipei Xu, SiYuan Ma, Yaohua Liu, Yu Wu, Guanliang Liu, Yang Zhang, Yong Liu

机构 * University of Shanghai for Science and Technology(上海科技大学) Nanyang Technological University(南洋理工大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Georgia Institute of Technology(佐治亚理工学院) The University of Michigan(密歇根大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DIPS框架,利用大语言模型生成约束双目标凸优化的帕累托前沿,通过紧凑离散化方案和三阶段课程优化,实现高效连续优化。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12078 2026-05-13 cs.SE cs.AI 57%

Property-Level Reconstructability of Agent Decisions: An Anchor-Level Pilot Across Vendor SDK Adapter Regimes

代理决策的属性级可重构性:一个跨供应商SDK适配器制度的锚点试点

Oleg Solozobov

机构 * Independent Researcher (Global)(全球独立研究员)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过锚点试点评估代理决策在不同制度下的可重构性,发现不同制度下属性级可重构性存在差异,揭示了严格治理完整性在不同层级的分布情况。

Comments 23 pages, 3 tables; reproducibility package: https://doi.org/10.5281/zenodo.20077961; GitHub: https://github.com/agent-runtime-evidence/anchor-level-reconstructability-pilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23679 2026-05-13 cs.RO cs.AI 57%

Learning What Can Be Picked: Active Reachability Estimation for Efficient Robotic Fruit Harvesting

学习可采摘之物:用于高效农业机器人采摘的主动可达性估计

Nur Afsa Syeda, Mohamed Elmahallawy, Luis Fernando de la Torre, John Miller

机构 * Washington State University(华盛顿州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种结合RGB-D感知与主动学习的方法,用于高效判断水果可达性,减少标注工作量并提高预测精度,实验表明在低标注情况下,熵和边距采样效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13163 2026-05-13 cs.LG 57%

Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback

高效算法用于具有带反馈的逻辑上下文滑动老虎机

Tanmay Goyal, Gaurav Sinha

机构 * Microsoft Research India(微软印度研究院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出Slate-GLM-OFU和Slate-GLM-TS算法,通过局部规划和全局学习实现低计算成本和低遗憾,实验显示其在合成设置中优于现有基线,并在二分类任务中表现良好。

Comments Accepted to UAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11169 2026-05-13 cs.AI 57%

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

OLIVIA:通过推理时间动作适应实现LLM ReAct代理的在线学习

Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou, Tong Yu, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OLIVIA通过在推理时对动作进行适应,改进LLM ReAct代理在部署中的决策能力,提供可跟踪、细粒度和不确定性感知的适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05884 2026-05-13 cs.CY cs.LG 57%

Integrating the Expected Future in Load Forecasts with Contextually Enhanced Transformer Models

将预期未来整合到负载预测中:基于上下文增强的Transformer模型

Raffael Theiler, Leandro Von Krannichfeldt, Giovanni Sansavini, Michael F. Howland, Olga Fink

机构 * Intelligent Maintenance and Operations Systems (IMOS)(智能维护与运营系统) École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Department of Mechanical and Process Engineering(机械与过程工程系) Eidgenössische Technische Hochschule (ETH)(瑞士联邦理工学院(ETH)) Department of Civil and Environmental Engineering(土木与环境工程系) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种结合预测与回归的任务,通过上下文增强的Transformer模型提升能源预测准确性,通过铁路和建筑能耗案例验证了方法的有效性,显著降低预测误差。

Comments 39 pages, 8 figures and tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21887 2026-05-13 cs.RO 50%

IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments

IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合

Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang

机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11434 2026-05-13 eess.IV 50%

FEFormer: Frequency-enhanced Vision Transformer for Generic Knowledge Extraction and Adaptive Feature Fusion in Volumetric Medical Image Segmentation

FEFormer:频率增强的视觉变换器用于通用知识提取和自适应特征融合的体数据医学图像分割

Jin Yang, Xiaobing Yu, Peijie Qiu

专题命中 规划推理 :planning(abstract)

AI总结 FEFormer通过引入频率增强模块,提升体数据医学图像分割的精度与效率,解决传统方法在局部细节和全局依赖捕捉上的不足。

Comments 20 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11369 2026-05-13 cs.CV 50%

Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers

具有物体交互的动态全身体态代理通过融合预训练模块控制器

Sanghyeok Nam, Byoungjun Kim, Daehyung Park, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种框架,通过结合预训练的运动先验和模仿代理,在规划和执行阶段生成动态且长期的人-物交互动作,如持桌奔跑,提升了动态人-物交互任务的成功率。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏