arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-26 至 2026-06-26 共收录 45 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 45 篇

2606.26669 2026-06-26 cs.AI 新提交 83%

SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills

SKILL-DISCO:将智能体轨迹蒸馏和编译为可重用的程序性技能

Zhongxin Guo, Danrui Qi, Hanwen Gu, Peng Cheng, Yongqiang Xiong

机构 * Microsoft Research(微软研究院) Beijing Foreign Studies University(北京外国语大学)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 提出SkillDisCo框架,从成功轨迹中蒸馏可重用参数化控制流子图并编译为可调用、可执行、可验证的程序性技能,在ALFWorld和WebArena上提升成功率并减少智能体步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26463 2026-06-26 cs.LG 新提交 83%

Finding the Time to Think: Learning Planning Budgets in Real-Time RL

寻找思考时间:在实时强化学习中学习规划预算

Aneesh Muppidi, Firas Darwish, Dylan Cope, João F. Henriques, Jakob Nicolaus Foerster

机构 * British Open-ended Learning and Discovery Lab (BOLD)(英国开放性学习与探索实验室(BOLD)) University of Oxford(牛津大学) VGG(视觉信息小组)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.LG

AI总结 针对环境在决策期间持续运行的实时强化学习,提出一种轻量级门控策略,根据状态选择规划预算,在多个实时游戏中优于固定预算和启发式基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13939 2026-06-26 cs.LG cs.AI 81%

Adaptive Automatic Model Selection for Demand Forecasting under Heterogeneous Demand Patterns

面向 horizon 的决策支持框架:用于在鲁棒生产计划中选择需求预测模型

Adolfo González, Víctor Parada

机构 * Department of Computer Engineering and Informatics, Faculty of Engineering, University of Santiago of Chile(工程学院计算机工程与信息学系,智利圣塔克鲁斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种面向 horizon 的决策支持框架,用于在需求波动大、不确定性高的生产计划中选择需求预测模型,通过 MDFH 方法预测误差指标并提出 RMSSEh 和 AHSIV 作为改进的模型选择方法。

Comments 31 pages, 12 figures and Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26790 2026-06-26 cs.CL 新提交 79%

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

OPID: 面向智能体强化学习的在策略技能蒸馏

Shuo Yang, Jinyang Wu, Zhengxi Lu, Yuhao Shen, Fan Zhang, Lang Feng, Shuai Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.CL

AI总结 提出OPID框架,通过从在策略轨迹中提取层级技能(回合级和步骤级)提供密集标记级监督,结合结果优势进行策略优化,提升智能体性能、样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 79%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27292 2026-06-26 cs.RO 新提交 78%

BOWConnect: Parallel Bayesian Optimization over Windows with Learned Local Cost Maps for Sample-Efficient Kinodynamic Motion Planning

BOWConnect: 基于学习局部代价图窗口的并行贝叶斯优化用于样本高效的运动动力学运动规划

Sourav Raxit, Abdullah Al Redwan Newaz, Jose Fuentes, Leonardo Bobadilla

机构 * Louisiana State University New Orleans(路易斯安那州立大学新奥尔良分校) Florida International University(佛罗里达国际大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出BOWConnect双向并行运动动力学规划器,通过窗口贝叶斯优化学习局部代价图引导采样,解决高维空间样本效率低、动态约束下代价启发式不可靠及窄通道规划难题,在基准测试中实现100%成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26858 2026-06-26 cs.RO 新提交 78%

PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts

PlanRL: 一种用于基于强化学习的驾驶专家的轨迹规划架构

Joonhee Lim, Yongjae Lee, Jangho Shin, Dongsuk Kum

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Hyundai Motor Company(现代汽车公司)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种将强化学习策略与多项式轨迹规划器结合的轨迹规划架构,通过Frenet坐标系简化道路几何并加入运动学可行性检查,在CARLA基准上驾驶评分提升5%-11%,成功率提升8%-19%。

Comments Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26413 2026-06-26 eess.SY cs.RO cs.SY 新提交 78%

PRISM: Efficient and Locally Optimal Probabilistic Planning with Reachability Guarantees

PRISM:具有可达性保证的高效且局部最优的概率规划

Alex Rose, Christopher Jewison, Jonathan P. How

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Draper

专题命中 规划决策 :planning(title,abstract)

AI总结 提出PRISM算法,通过将信念空间规划分解为确定性均值规划和协方差收缩,并引入在线局部优化,在满足状态和控制约束下实现高覆盖率和低成本,同时提供可达性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26404 2026-06-26 math.GM 新提交 78%

Air cargo load and route planning in pickup and delivery operations

航空货运在取送货作业中的装载与路线规划

A. C. P. Mesquita, C. A. A. Sanches

专题命中 规划决策 :planning(title,abstract)

AI总结 针对航空取送货中的负载不平衡风险,提出一种结合标准化托盘和固定位置的数学模型,并设计专用启发式算法,在便携计算机上快速求解实际规模问题。

Journal ref Expert Systems with Applications, Vol. 249, Part B, 1237111, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25629 2026-06-26 cs.RO eess.SP 新提交 78%

Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations

安全关键场景下基于蒸馏视觉语言模型的事件自适应运动规划

Zhenwei Huang, Changsheng You, Shuai Wang, Chao Zhou, Wei Xu, Yi Gong

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Manifold Tech Limited(曼孚科技股份有限公司)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出事件自适应运动规划(EAMP)框架,通过可配置语义事件触发器、蒸馏视觉语言模型和语义模型预测控制,在安全关键场景中实现高层推理与底层控制的协同,提升动态安全裕度并保持实时性。

Comments 8 pages, 8 figures, 4 tables. Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23589 2026-06-26 math.OC 版本更新 78%

Unlocking the Informational Value of Marginal Costs for Exact Time Series Aggregation in Generation Expansion Planning

解锁边际成本的信息价值用于发电扩展规划中的精确时间序列聚合

Luca Santosuosso, Sonja Wogrin

专题命中 规划决策 :planning(title,abstract)

AI总结 针对发电扩展规划问题的计算复杂性,提出一种基于边际成本的理论化时间序列聚合方法,通过保留完整模型的活跃约束实现精确聚合,并嵌入迭代算法提供误差上界的性能保证,在完整优化不可行时恢复可解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11906 2026-06-26 cs.RO 版本更新 78%

Visual-Language-Guided Task Planning for Horticultural Robots

面向园艺机器人的视觉-语言引导任务规划

Jose Cuaran, Kendall Koe, Aditya Potnis, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications(国家超级计算中心)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种模块化框架,利用视觉语言模型(VLM)主动查询异构数据源来引导机器人任务规划,在单作和混作环境中进行短期和长期作物监测任务基准测试,发现零样本VLM在短期任务中表现稳健(成功率87%),但长期多目标任务成功率低于10%,且依赖噪声语义地图时性能下降。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26298 2026-06-26 cs.AI cs.CR 新提交 77%

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

治理行动,而非智能体:机构证明作为自主AI系统的治理模型

Jakob Salfeld-Nebgen

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对自主AI系统可能执行不可逆高风险行动的问题,提出一种基于机构证明的计算治理模型,将执行权限与规划推理分离,通过独立权威源证明前提条件,并采用防篡改日志记录决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 70%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26105 2026-06-26 cs.CL cs.AI cs.LG 新提交 67%

Context Recycling for Long-Horizon LLM Inference

长程LLM推理的上下文回收

Derek Thomas

机构 * Independent Researcher(独立研究员)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26397 2026-06-26 cs.LG cs.AI 新提交 62%

Deterministic Pareto-Optimal Policy Synthesis for Multi-Objective Reinforcement Learning

多目标强化学习的确定性帕累托最优策略综合

Aniruddha Joshi, Niklas Lauffer, Sanjit Seshia

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于切比雪夫标量化的偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明其单调收敛到帕累托前沿的覆盖集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13955 2026-06-26 cs.CL cs.AI cs.CY 62%

Guided Persona-based AI Surveys: Can we replicate personal mobility preferences at scale using LLMs?

引导式基于人设的AI调查:能否利用LLMs在大规模上复制个人移动偏好

Ioannis Tzachristas, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Chair of Transportation Systems Engineering, TUM School of Engineering and Design, TUM, Germany(交通系统工程教授、技术大学工程与设计学院、技术大学、德国)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本研究探讨LLMs生成人工调查的潜力,通过'人设'结合现实数据,有效捕捉德国个人移动偏好中的复杂依赖关系,为交通规划提供可扩展、低成本的数据生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27136 2026-06-26 cs.AI 新提交 57%

Joint Learning of Experiential Rules and Policies for Large Language Model Agents

大型语言模型智能体的经验规则与策略联合学习

Shicheng Ye, Chao Yu

机构 * Sun Yat-sen University(中山大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出JERP框架,通过联合更新经验规则库和策略,使规则与演化策略对齐,在AlfWorld和WebShop上提升复杂交互任务的决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 57%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 57%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 57%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26700 2026-06-26 cs.RO cs.AI 新提交 57%

Learning Motion Feasibility from Point Clouds in Cluttered Environments

从杂乱环境中的点云学习运动可行性

Sajid Ansari, Arthi, Girish Varma, Antony Thomas

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出直接从RGB-D观测学习7自由度机械臂运动可行性预测的方法,构建包含270万抓取可行性标签的大规模基准,并评估三种分类器架构,最佳模型GRASPFC-PTX在新型物体上AUROC达0.996且预测速度远超基于采样的运动规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26661 2026-06-26 cs.RO cs.AI 新提交 57%

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

LAMP: 面向可行轨迹预测的车道对齐运动基元

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔大学) Hyundai Motor Company(现代汽车公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出LAMP框架,利用VQ-VAE学习形状感知运动基元作为离散意图查询,并结合车道拓扑先验的可行性意图选择器,在保持行为多样性的同时提升预测轨迹的拓扑一致性和可行性。

Comments IEEE ITSC 2026, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26590 2026-06-26 cs.LG cs.CR 新提交 57%

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

实证软件工程 TerraProbe: 用于检测LLM辅助Terraform中欺骗性修复的分层Oracle框架

Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas

机构 * East Texas A&M University(东德克萨斯农工大学) Texas Woman’s University(德克萨斯女子大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TerraProbe五层Oracle框架,评估LLM辅助Terraform安全修复,发现71.4%的真实修复为欺骗性修复,并建立四维欺骗性修复分类法。

Comments 34 pages, 12 figures, 14 tables. Journal-first manuscript submitted to Empirical Software Engineering. Primary classification: cs.SE; cross-list: cs.CR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26400 2026-06-26 cs.AI cs.SY eess.SY 新提交 57%

When Agents Meet Electric Bus Fleet Operations: Pricing Behavior, Trade-offs, and Policy Implications in an Aggregator Framework

当智能体遇上电动公交车队运营:聚合框架中的定价行为、权衡与政策启示

Jônatas Augusto Manzolli, Ali Eslami, Luis Miranda-Moreno, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) INESC Coimbra, University of Coimbra(科英布拉大学INESC Coimbra研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出一种智能体聚合框架,将优化调度模型与监督智能体结合,协调电动公交车队的充电、V2G及运营决策,揭示利润导向定价可能损害公交运营商利益,需透明协调与价值共享规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26333 2026-06-26 cs.LG 新提交 57%

Mesh-RL: Coupled subgrid reinforcement learning

Mesh-RL:耦合子网格强化学习

Behnam Gheshlaghi, Bahador Rashidi, Shahin Atakishiyev

机构 * University of Alberta(阿尔伯塔大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Mesh-RL框架,通过有限元启发的空间域分解和边界一致时序差分更新,加速稀疏奖励环境中的长程信用分配,提升收敛速度与学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交 57%

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04574 2026-06-26 cs.LG cs.NE q-fin.ST q-fin.TR stat.ML 版本更新 57%

Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning

基于深度强化学习的加密货币市场动态多对交易策略

Damian Lebiedź, Robert Ślepaczuk

机构 * Politechnika Śląska(波兰斯拉维亚理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本研究提出一种结合深度强化学习执行覆盖层的层次化“过滤-排序”配对选择方法和“固定风险、自适应均值”执行模型,在加密货币市场实现优于启发式基准的统计套利表现。

Comments 61 pages, 37 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新 57%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 57%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏