arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-04 至 2026-06-04 共收录 1118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 370 篇

2510.13272 2026-06-04 cs.CL 57%

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation

超越正确性:在检索增强生成中奖励忠实推理

Zhichao Xu, Zongyu Wu, Yun Zhou, Aosong Feng, Kang Zhou, Sangmin Woo, Kiran Ramnath, Yijun Tian, Xuan Qi, Weikang Qiu, Lin Lee Cheong, Haibo Ding

机构 * AWS AI Fundamental Research(AWS人工智能基础研究) The Pennsylvania State University(宾夕法尼亚州立大学) Yale University(耶鲁大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 本文提出VERITAS框架,通过细粒度轮次级忠实性奖励强化学习,提升检索增强生成中推理步骤的忠实性,同时改善任务性能。

Comments TMLR Camera Ready Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05633 2026-06-04 cs.CL 57%

GIFT: Games as Informal Training for Generalizable LLMs

GIFT:游戏作为通用型LLM的非正式训练

Nuoyan Lyu, Bingbing Xu, Xueyun Tian, Weihao Meng, Yige Yuan, Yang Zhang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10247 2026-06-04 cs.RO cs.AI 57%

DiffAero: A GPU-Accelerated Differentiable Simulation Framework for Efficient Quadrotor Policy Learning

DiffAero: 一种用于高效四旋翼策略学习的GPU加速可微分仿真框架

Xinhong Zhang, Runqing Wang, Yunfan Ren, Jian Sun, Hao Fang, Jie Chen, Gang Wang

机构 * State Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(自主智能无人系统国家重点实验室,北京理工大学) Zhongguancun Academy(中关村academy) Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出DiffAero,一种轻量级、GPU加速且完全可微的仿真框架,通过并行化物理与渲染实现高效四旋翼控制策略学习,并在消费级硬件上数小时内训练出鲁棒策略。

Comments 8 pages, 11 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.02095 2026-06-04 eess.SY cs.LG cs.SY 57%

Space Navigator: a Tool for the Optimization of Collision Avoidance Maneuvers

空间导航:碰撞规避 maneuver 优化工具

Leonid Gremyachikh, Dmitrii Dubov, Nikita Kazeev, Andrey Kulibaba, Andrey Skuratov, Anton Tereshkin, Andrey Ustyuzhanin, Lubov Shiryaeva, Sergej Shishkin

机构 * National Research University Higher School of Economics, Laboratory of Methods for Big Data Analysis(俄罗斯国家研究大学高等经济学院,大数据分析方法实验室) Yandex School of Data Analysis(Yandex数据科学学院) Phygitalism

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种名为“空间导航”的模块化自主碰撞规避系统,通过结合领域知识与强化学习方法,解决千级卫星星座的碰撞规避 maneuver 优化问题。

Comments Submitted to AAS Advances in the Astronautical Sciences, presented at IAA SciTech Forum 2018

Journal ref Advances in the Astronautical Sciences 2020 First IAA/AAS SciTech Forum on Space Flight Mechanics and Space Structures and Materials Conference, volume 170

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.07747 2026-06-04 eess.SY cs.AI cs.DC cs.RO cs.SY 57%

Lookup Table-Based Consensus Algorithm for Real-Time Longitudinal Motion Control of Connected and Automated Vehicles

基于查找表的共识算法用于连接和自动化车辆的实时纵向运动控制

Ziran Wang, Kyuntae Han, BaekGyu Kim, Guoyuan Wu, Matthew J. Barth

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于查找表的共识算法,用于实时控制连接和自动化车辆的纵向运动,通过动态生成查找表来实时寻找最佳控制增益,优于之前的工作和线性反馈算法。

Comments 2019 American Control Conference (ACC)Philadelphia, PA, USA, July 10-12, 2019978-1-5386-7928-9

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00035 2026-06-04 cs.RO cs.LG cs.SY eess.SY stat.ML 57%

Autonomous Highway Driving using Deep Reinforcement Learning

使用深度强化学习实现自动驾驶高速公路驾驶

Subramanya Nageshrao, Eric Tseng, Dimitar Filev

机构 * Ford Greenfield Labs(福特绿谷实验室) Ford Research and Innovation Center(福特研究与创新中心)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的方法,通过与模拟交通直接交互,使自动驾驶车辆在复杂和多变的环境中做出决策,解决了传统规则和预设成本函数在实时优化中的不足,提高了学习效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.05591 2026-06-04 eess.SY cs.AI cs.MA cs.SY 57%

TuSeRACT: Turn-Sample-Based Real-Time Traffic Signal Control

TuSeRACT:基于转向的实时交通信号控制

Srishti Dhamija, Pradeep Varakantham

机构 * School of Information Systems, Singapore Management University(新加坡管理大学信息学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出TuSeRACT,一种基于转向的实时交通信号控制方法,通过采样转向流量来优化交通信号调度,从而降低车辆等待时间,相比SURTRAC有更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.09048 2026-06-04 cs.AI cs.RO cs.SY eess.SY 57%

A Compression-Inspired Framework for Macro Discovery

一种受压缩启发的宏发现框架

Francisco M. Garcia, Bruno C. da Silva, Philip S. Thomas

机构 * College of Information and Computer Sciences(信息与计算机科学学院) Department of Computer Science(计算机科学系) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Federal University Rio Grande do Sul(里约格朗德杜斯阿鲁斯联邦大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种受压缩启发的宏发现框架,通过识别高性能策略获得的轨迹中的重复模式,帮助强化学习代理利用早期经验快速解决相关新任务。

Comments Accepted as Extended Abstract, AAMAS, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.02238 2026-06-04 cs.RO cs.CL cs.SY eess.SY 57%

Precise but Natural Specification for Robot Tasks

机器人任务的精确但自然的规范

Ivan Gavran, Brendon Boldt, Eva Darulova, Rupak Majumdar

机构 * Max Planck Institute for Software Systems, Germany(德国马克斯·普朗克软件研究所)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 Flipper通过自然语言接口实现机器人高阶任务规范,结合形式化核心语言与语义解析器,提供可视化反馈并支持自然语言扩展,提升任务描述效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.01825 2026-06-04 cs.LG econ.GN q-fin.EC stat.ML 57%

Evaluating Hospital Case Cost Prediction Models Using Azure Machine Learning Studio

利用Azure机器学习工作室评估医院病例成本预测模型

Alexei Botchkarev

机构 * Microsoft Azure Machine Learning Studio(微软Azure机器学习工作室)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种利用Azure机器学习工作室快速评估多种回归模型的工具,评估了鲁棒回归、提升决策树回归和决策森林回归在医院病例成本预测中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.03090 2026-06-04 math.OC cs.AI cs.SY eess.SY 57%

Deception in Optimal Control

最优控制中的欺骗

Melkior Ornik, Ufuk Topcu

机构 * Institute for Computational Engineering and Sciences, University of Texas at Austin(德克萨斯大学奥斯汀分校计算工程与科学研究所) Department of Aerospace Engineering and Engineering Mechanics and the Institute for Computational Engineering and Sciences, University of Texas at Austin(德克萨斯大学奥斯汀分校航空航天工程与工程力学系及计算工程与科学研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出一个数学严谨的框架,用于定义最优控制中的欺骗,通过设计最优欺骗策略,考虑代理和对手的信念空间,并讨论在不确定性和部分可观测马尔可夫决策过程中的欺骗策略设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09676 2026-06-04 cs.LG cs.SY eess.SY math.OC 57%

Model-Free Renewable Scenario Generation Using Generative Adversarial Networks

基于生成对抗网络的无模型可再生能源场景生成

Yize Chen, Yishen Wang, Daniel Kirschen, Baosen Zhang

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种基于生成对抗网络的数据驱动场景生成方法,用于高效生成具有时空相关性的可再生能源生产模式。

Comments Accepted to IEEE Transactions on Power Systems; code available at https://github.com/chennnnnyize/Renewables_Scenario_Gen_GAN

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08927 2026-06-04 quant-ph cs.AI cs.ET cs.SY eess.SY 57%

Compiling quantum circuits to realistic hardware architectures using temporal planners

利用时间规划器将量子电路编译到现实硬件架构

Davide Venturelli, Minh Do, Eleanor Rieffel, Jeremy Frank

机构 * NASA Ames Research Center, Quantum Artificial Intelligence Laboratory(美国国家航空航天局阿姆斯研究中心,量子人工智能实验室) USRA Research Institute for Advanced Computer Science (RIACS)(美国宇航局高级计算机科学研究所(RIACS)) Stinger Ghaffarian Technologies (SGT Inc.)(Stinger Ghaffarian技术(SGT公司)) NASA Ames Research Center, Planning and Scheduling Group(美国国家航空航天局阿姆斯研究中心,计划与调度组)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了将量子电路编译到新兴量子硬件的时空规划方法,重点探讨了超导架构的最近邻约束,并通过QAOA电路的实验验证了时间规划在编译优化中的可行性。

Comments updated manuscript, more planners and results

Journal ref 2017 Quantum Sci. Technol. - also related to proceedings of IJCAI 2017, and ICAPS SPARK Workshop 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02860 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 57%

Gaussian Processes for Data-Efficient Learning in Robotics and Control

高斯过程在机器人和控制中的数据高效学习

Marc Peter Deisenroth, Dieter Fox, Carl Edward Rasmussen

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出基于高斯过程的非参数转移模型,通过提取更多数据信息加速学习,减少模型误差影响,实现高效自主学习。

Comments 20 pages, 29 figures; fixed a typo in equation on page 8

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, issue no 2, pages 408-423, February 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.09597 2026-06-04 cs.AI cs.SY eess.SY 57%

Path Integral Networks: End-to-End Differentiable Optimal Control

路径积分网络:端到端可微最优控制

Masashi Okada, Luca Rigazio, Takenobu Aoshima

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出路径积分网络(PI-Net),一种基于路径积分最优控制算法的递归网络表示,用于最优控制规划。PI-Net通过反向传播和随机梯度下降端到端学习系统动态和成本模型,具备规划能力,可泛化到未见状态,适用于连续控制任务,并支持多种学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.08262 2026-06-04 eess.SY cs.AI cs.FL cs.SY 57%

Supervisor Synthesis of POMDP based on Automata Learning

基于自动机学习的POMDP监督器合成

Xiaobin Zhang, Bo Wu, Hai Lin

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出基于概率计算树逻辑的POMDP监督器合成框架,采用确定性有限自动机作为控制器,通过L*学习算法确定自动机的结构,以满足安全关键应用的性能保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05960 2026-06-04 cs.RO cs.AI cs.SY eess.SY 57%

Incremental Sampling-based Motion Planners Using Policy Iteration Methods

基于增量采样的运动规划器使用策略迭代方法

Oktay Arslan, Panagiotis Tsiotras

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于策略迭代的运动规划算法,利用动态规划思想在随机图中求解最短路径问题,通过改进策略加速计算过程,适用于大规模并行化。

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.04087 2026-06-04 cs.AI cs.SY eess.SY 57%

Networked Intelligence: Towards Autonomous Cyber Physical Systems

网络化智能:迈向自主的网络物理系统

Andre Karpistsenko

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文探讨了如何结合产业与学术成果,构建大规模网络物理系统,提出概念架构并评估子系统成熟度,为智能系统发展提供规划指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.01478 2026-06-04 cs.RO cs.AI cs.SY eess.SY 57%

Mixed Strategy for Constrained Stochastic Optimal Control

混合策略用于受约束的随机最优控制

Masahiro Ono, Mahmoud El Chamie, Marco Pavone, Behcet Acikmese

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出混合策略用于受约束的随机最优控制,证明随机化控制输入在非凸优化问题中可降低成本,等于对偶间隙,并提出基于对偶优化的高效求解方法。

Comments 11 pages. 9 figures.Preliminary version of a working journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1411.0728 2026-06-04 cs.LG cs.GT cs.SY eess.SY math.OC 57%

Approachability in Stackelberg Stochastic Games with Vector Costs

在向量成本的Stackelberg随机博弈中可接近性的研究

Dileep Kalathil, Vivek Borkar, Rahul Jain

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出在动态变化环境中多目标优化问题中,针对向量成本的Stackelberg随机博弈的可接近性策略,并设计了计算可行的算法和强化学习方法。

Comments 18 Pages, Submitted to Dynamic Games and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.09497 2026-06-04 cs.GT cs.AI cs.MA cs.SY eess.SY 57%

Interdependent Scheduling Games

相互依赖的调度博弈

Andres Abeliuk, Haris Aziz, Gerardo Berbeglia, Serge Gaspers, Petr Kalina, Nicholas Mattei, Dominik Peters, Paul Stursberg, Pascal Van Hentenryck, Toby Walsh

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了相互依赖的调度博弈模型,探讨了在基础设施规划与协调中的应用,分析了福利最大化、纳什均衡的存在与计算等核心问题。

Comments Accepted to IJCAI 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.00274 2026-06-04 cs.AI cs.SY eess.SY stat.ML 57%

Stick-Breaking Policy Learning in Dec-POMDPs

在Dec-POMDPs中采用Stick-Breaking策略的学习

Miao Liu, Christopher Amato, Xuejun Liao, Lawrence Carin, Jonathan P. How

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种变大小状态控制器的Dec-SBPR框架,通过Stick-Breaking先验构建局部策略,无需假设Dec-POMDP模型即可学习控制器参数,有效提升大规模问题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.03863 2026-06-04 cs.AI cs.SY eess.SY math.OC 57%

Discrete Route/Trajectory Decision Making Problems

离散路径/轨迹决策制定问题

Mark Sh. Levin

机构 * Inst. for Information Transmission Problems, Russian Academy of Sciences(信息传输问题研究所,俄罗斯科学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了复合多阶段决策问题,旨在设计从初始决策状态到目标决策状态的路径或轨迹。通过汽车路线问题作为基本物理隐喻,探讨了离散操作/状态设计空间(如有向图)中的多种决策问题,并在教育、医学和经济等领域应用。

Comments 25 pages, 34 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02251 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 57%

From Pixels to Torques: Policy Learning with Deep Dynamical Models

从像素到扭矩:基于深度动态模型的策略学习

Niklas Wahlström, Thomas B. Schön, Marc Peter Deisenroth

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出一种高效的数据驱动强化学习算法,通过深度动态模型直接从像素信息学习闭环控制策略,解决高维观测下的连续状态-动作空间数据高效学习问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.01793 2026-06-04 cs.LO cs.GT cs.LG cs.SY eess.SY 57%

Correct-by-synthesis reinforcement learning with temporal logic constraints

通过时序逻辑约束的正确性合成强化学习

Min Wen, Ruediger Ehlers, Ufuk Topcu

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种通过时序逻辑约束的正确性合成强化学习方法,结合最大许可策略和maximin-Q学习算法,实现系统满足规格的同时优化未知性能指标。

Comments 8 pages, 3 figures, 2 tables, submitted to IROS 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.0083 2026-06-04 eess.SY cs.AI cs.RO cs.SY 57%

Integrating active sensing into reactive synthesis with temporal logic constraints under partial observations

将主动感知整合到带有时序逻辑约束的反应合成中,在部分观察下

Jie Fu, Ufuk Topcu

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出在部分可观测和动态环境中,利用感知动作进行在线反应规划,通过主动感知策略减少不确定性,确保时序逻辑规范以概率1满足。

Comments 7 pages, 2 figures, submitted to American Control Conference 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1304.3088 2026-06-04 eess.SY cs.AI cs.MA cs.SY 57%

Information and Multi-Sensor Coordination

信息与多传感器协调

Greg Hager, Hugh F. Durrant-Whyte

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究多传感器系统中信息融合与协调控制问题,提出基于团队决策理论的分析方法,通过仿真验证了在不确定性环境下多传感器协作的有效性。

Comments Appears in Proceedings of the Second Conference on Uncertainty in Artificial Intelligence (UAI1986)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04641 2026-06-04 cs.DB 50%

Bridge the Last-Mile Gap to Semantic Analytics: Compiling Natural-Language Queries into Semantic Operator Pipelines

弥合语义分析的最后一步差距:将自然语言查询编译为语义操作符流水线

Wenkai Dong, Ruyu Li, Sairam Gurajada, Yifan Wang

专题命中 规划决策 :planning(abstract)

AI总结 提出NL2Pipe中间件系统,通过查询-数据链接、语义规划和代码生成三阶段编译,将自然语言问题自动转化为可执行的语义操作符流水线,显著提升跨源工作负载的F1分数。

Comments 4 figures, 7 tables. Code: https://github.com/dongw-netize/NL2Pipe-Compiling-Natural-Language-Questions-into-Semantic-Operator-Pipelines

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04600 2026-06-04 eess.SP 50%

Joint 3D Trajectory and Power Allocation for HAPs-UAV Bistatic ISARAC in Low-Altitude Networks

低空网络中HAPs-UAV双基地ISARAC的联合3D轨迹与功率分配

Bang Huang, Mohamed-Slim Alouini

专题命中 规划决策 :planning(abstract)

AI总结 针对低空网络中HAPs-UAV双基地ISARAC系统,提出联合3D轨迹与功率分配方法,通过交替优化最大化地面用户和速率,满足SAR成像SNR和分辨率约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04416 2026-06-04 stat.ME math.ST stat.AP stat.TH 50%

Powerful Multivariate Sensitivity Analysis via Sample Splitting in an Observational Study of the Effects of Poverty on Cardiovascular Disease Risk Factors

基于样本分割的观察性研究中贫困对心血管疾病风险因素影响的多变量敏感性分析

William Bekerman, Anurag Mehta, Rebecca E. Hasson, Leah E. Robinson, Dylan S. Small, Colin B. Fogarty

专题命中 规划决策 :planning(abstract)

AI总结 提出通过样本分割(规划样本选择最优线性组合,分析样本进行推断)来增强观察性研究中多结局全局零假设检验对未测量偏倚的敏感性分析功效,并应用于贫困对儿童青少年心血管疾病风险因素影响的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏