arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-25 至 2026-05-25 共收录 40 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 40 篇

2605.22896 2026-05-25 cs.RO cs.AI cs.LG 90%

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models

Agentic-VLA:视觉-语言-动作模型的高效在线自适应

Ruofan Jin, Zaixi Zhang

机构 * Ruofan Jin(金鲁凡) Zaixi Zhang(张在西)

专题命中 规划决策 :agentic(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Agentic-VLA框架,通过自适应奖励合成、语言引导探索和经验记忆三大创新,实现VLA模型在线高效自适应,在LIBERO基准上长时域任务提升12.3%,单样本学习提升28.5%,并实现零演示跨任务迁移。

Comments Total 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23382 2026-05-25 cs.CL 89%

From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

从正确性到偏好:个性化智能体强化学习框架

Ranxu zhang, zeyang li, Jiacheng Huang, Rui Zhang, Xiaozhou Xu, sun zhe, Yanyong Zhang, Chao Wang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool-use(abstract);planning(abstract)

AI总结 提出PARPO框架,通过解耦通用任务奖励与个性化偏好奖励,结合偏好解耦奖励模型和偏好对齐技能演化图记忆,实现个性化智能体强化学习。

Comments 34 pages, 7 figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26383 2026-05-25 cs.CL cs.AI 88%

Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning

基于强化学习的高效可迁移智能知识图谱检索增强生成

Junhong Lin, Shicheng Liu, Jinyeop Song, Song Wang, Julian Shun, Yada Zhu

机构 * MIT CSAIL(麻省理工学院CSAIL) University of Virginia(弗吉尼亚大学) IBM Research(IBM研究院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 提出KG-R1框架,通过强化学习将单个智能体与知识图谱交互,统一检索、推理和生成过程,在KGQA基准上以更少生成token提升准确率,并展现跨图谱的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22875 2026-05-25 cs.AI cs.LG 84%

RMA: an Agentic System for Research-Level Mathematical Problems

RMA:一个面向研究级数学问题的智能体系统

Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出Research Math Agents (RMA)框架,通过多角色多轮协作的智能体工作流,在First Proof基准上解决80%的研究级数学问题,优于GPT-5.2R等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23296 2026-05-25 cs.AI 83%

Parallel Context Compaction for Long-Horizon LLM Agent Serving

长视界LLM智能体服务的并行上下文压缩

Musa Cim, Burak Topcu, Chita Das, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对长视界LLM智能体对话历史超出上下文窗口的问题,提出并行压缩方法,通过细粒度控制摘要体积和提示工程,在HotpotQA和LoCoMo基准上相比顺序基线降低端到端耗时并提升压缩吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09583 2026-05-25 cs.RO cs.AI 83%

AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

Fei Lin, Yonglin Tian, Tengchao Zhang, Jun Huang, Sangtian Guan, Fei-Yue Wang

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(创新工程学院工程科学系,澳门科学技术大学) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院自动化研究所) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出AirVista-II端到端智能体系统,通过集成智能体任务识别调度、多模态感知和差异化关键帧提取策略,实现零样本下无人机动态场景的通用语义理解与推理。

Journal ref Proc. 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 6319-6324, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 81%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 79%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22995 2026-05-25 cs.CY cs.AI 79%

Whose Good, Whose Place? The Moral Geography of Agentic AI for Social Good

谁之善,谁之地?面向社会公益的能动型AI的道德地理学

Poli Nemkova, Haeshitha Indukuri, Jaedon Charles

机构 * University of North Texas(北卡罗来纳州立大学) Florida International University(佛罗里达国际大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 通过调查112篇论文,发现面向社会公益的能动型AI存在道德地理不对称:论文在制度和社会政策领域最不指定地理背景,且仅25%报告实际部署,据此提出问责缺口和最低报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06840 2026-05-25 cs.AI 79%

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

从LLM推理轨迹中提取搜索树揭示短视规划

Sixing Chen, Ji-An Li, Saner Cakir, Sinan Akcali, Kayla Lee, Marcelo G. Mattar

机构 * Generality Inc.(Generality公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 通过从四子棋游戏推理轨迹中提取搜索树并拟合计算模型,发现LLM的规划是短视的,其决策主要由浅层节点驱动,而非深层搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04929 2026-05-25 cs.RO cs.LG cs.SY eess.SY 79%

Neural Configuration-Space Barriers for Manipulation Planning and Control

用于操作规划与控制的神经构型空间障碍

Kehan Long, Ki Myung Brian Lee, Nikola Raicevic, Niyas Attasseri, Melvin Leok, Nikolay Atanasov

机构 * Contextual Robotics Institute, University of California San Diego(情境机器人研究所,加州大学圣地亚哥分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 提出一种基于神经构型空间距离函数障碍的统一方法,用于高维机器人操作规划与控制,通过分布鲁棒优化处理模型误差和传感器噪声,在杂乱动态环境中实现高效规划与鲁棒安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23782 2026-05-25 cs.GT cs.SY eess.SY 78%

Routing Equilibrium in Mixed-Autonomy Traffic Networks with Altruistic Autonomous Agents

混合自主交通网络中具有利他自主代理的路由均衡

Lihui Yi, Ermin Wei

专题命中 规划决策 :autonomous agent(title,abstract)

AI总结 本文通过变分不等式框架研究混合自主交通网络中自私人类与利他自主车辆的路由博弈均衡,给出社会成本改善或恶化的充分条件,并证明分散与集中场景下的均衡等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23240 2026-05-25 cs.RO cs.SY eess.SY 78%

Signal Temporal Logic Motion Planning via Graphs of Convex Sets

基于凸集图的信号时序逻辑运动规划

Yu Chen, Ancheng Hou, Mingyang Feng, Xiao Yu, Xiang Yin

机构 * School of Automation & Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) Institute of Artificial Intelligence, Xiamen University(人工智能研究院,厦门大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种结合时间自动机与凸集图的框架,将STL运动规划问题转化为凸集图上的最短路径问题,生成满足STL规范、平滑性和速度约束的贝塞尔样条轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22991 2026-05-25 cs.RO 78%

Verified Task-Space Motion Planning Under Joint-Space Constraints

关节空间约束下的验证任务空间运动规划

Hanjiang Hu, Changliu Liu, Yebin Wang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) MERL

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种通过半定规划或二分法计算可验证最大笛卡尔超矩形步长的方法,并将其集成到Bug2规划器中,实现零关节限位违反和100%目标到达率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22647 2026-05-25 physics.optics 78%

Agentic metasurface design with self-correcting language-model systems

具有自校正语言模型系统的智能超表面设计

Bei Wu, Bo Xiong, Haiyao Luo, Yaqi Li, Li Zhang, Qiaolu Chen, Hongsheng Chen, Yihao Yang

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出MetaDesigner,一种基于自校正语言模型系统的智能超表面设计框架,通过自然语言目标自动规划设计路线、调用工具并自校正错误,在RGB超透镜、全彩全息图和光电混合神经网络三个任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01232 2026-05-25 math.OC 78%

Large-Scale Resilience Planning for Wildfire-Prone Electricity-System via Adaptive Robust Optimization

基于自适应鲁棒优化的野火易发电力系统大规模韧性规划

Shuyi Chen, Shixiang Zhu, Ramteen Sioshansi

专题命中 规划决策 :planning(title,abstract)

AI总结 针对野火风险下的电力系统,提出一种联合优化长期基础设施配置与短期运行响应的三阶段鲁棒规划框架,通过数据驱动的不确定集和列与约束生成算法实现大规模求解。

Comments V4 updated reference with correction and minor fixes to outdated links

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17629 2026-05-25 math.AT 78%

On the complexity of parametrized motion planning algorithms

参数化运动规划算法的复杂性

Navnath Daundkar, Ekansh Jauhari

专题命中 规划决策 :planning(title,abstract)

AI总结 研究第r个顺序参数化拓扑复杂度的概率变体,该变体从下界度量经典不变量,并衡量构建允许参数化运动规划算法的难度。

Comments Minor changes made based on the referee report. To appear in the SIAM Journal on Applied Algebra and Geometry. May differ slightly from the published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-05-25 cs.AI cs.CL cs.IR cs.LG 75%

SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Jiazheng Fan, Bin Wu, Busheng Zhang, Mengru Wang, Yuqi Zhu, Ningyu Zhang, Keyan Ding, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

专题命中 规划决策 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23652 2026-05-25 cs.AI 70%

One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents

一个策略,无限NPC:用于可扩展游戏智能体的可追溯共享RL策略

Yoosung Hong

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一种基于冻结LLM嵌入的条件共享强化学习策略pcsp,实现大规模NPC的个性化控制,在300人生活模拟基准上零样本身份识别提升17倍,推理速度比LLM策略快22倍。

Comments 18 pages, 15 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03715 2026-05-25 cs.LG cs.AI 62%

R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification

R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大

Weijie Shi, Yanxi Chen, Zexi Li, Xuchen Pan, Yuchang Sun, Jiajie Xu, Xiaofang Zhou, Yaliang Li

机构 * Tongyi Lab(通义实验室) Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03882 2026-05-25 cs.CV cs.AI cs.LG cs.RO 62%

Investigating Robot Control Policy Learning for Autonomous X-ray-guided Spine Procedures

自主X光引导脊柱手术的机器人控制策略学习研究

Florence Klitzner, Blanca Inigo, Benjamin D. Killeen, Lalithkumar Seenivasan, Michelle Song, Axel Krieger, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University of Munich(慕尼黑技术大学) Johns Hopkins School of Medicine(约翰霍普金斯医学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究基于模仿学习的机器人控制策略在稀疏输入(双平面X光)下进行椎体成形术中的可行性,通过模拟环境训练策略实现基于视觉的套管针迭代对齐,首次尝试成功率达68.5%,并展示了向复杂解剖结构和真实X光的迁移能力,但存在入口点精度不足等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23565 2026-05-25 cs.LG cs.AI 62%

Understanding Goal Generalisation in Sequential Reinforcement Learning

理解序贯强化学习中的目标泛化

Jason Ross Brown, Edward James Young

机构 * University of Cambridge(剑桥大学) Geodesic Research(Geodesic研究)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过引入潜在策略梯度方法,研究序贯训练下强化学习代理在分布外环境中的目标泛化行为,发现显著特征驱动泛化且早期目标影响后期目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23551 2026-05-25 cs.LG cs.AI 62%

Goal-Conditioned Agents that Learn Everything All at Once

目标条件智能体一次性学习所有内容

Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) MIT(麻省理工学院) Inria(法国国家信息与自动化研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LEO方法,通过联合输出所有目标的值和动作,实现高效并行全目标学习,在Craftax上显著优于其他方法,在连续控制任务上与基线相当,速度提升超过250倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22866 2026-05-25 cs.AI cs.LG 62%

BOHM: Zero-Cost Hierarchical Attribution for Compound AI Systems

BOHM:复合AI系统的零成本层次归因

Joss Armstrong

机构 * Ericsson Research(爱立信研究)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出BOHM方法,从路由权重中提取层次归因树,实现零成本、多分辨率归因,与SHAP互补且无需访问组件内部。

Comments 35 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23753 2026-05-25 cs.LG 57%

SeedER: Seed-and-Expand Retrieval from Knowledge Graphs

SeedER: 基于种子扩展的知识图谱检索

Hamed Shirzad, Frederik Wenkel, Dominique Beaini, Danica J. Sutherland, Emmanuel Noutahi

机构 * Valence Labs, Montréal, QC, Canada(Valence实验室,加拿大魁北克省蒙特利尔) University of British Columbia, Department of Computer Science, Vancouver, BC, Canada(不列颠哥伦比亚大学计算机科学系,加拿大不列颠哥伦比亚省温哥华)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出SeedER框架,通过轻量级种子节点选取和图感知策略的强化学习迭代扩展,高效检索知识图谱中与查询相关的节点,在组合泛化和图约束子模优化上具有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23583 2026-05-25 cs.RO cs.LG 57%

How Many Training Samples Are Needed for the Inverse Kinematics Solutions by Artificial Neural Networks

人工神经网络求解逆运动学需要多少训练样本

Dong-Won Lim

机构 * The University of Suwon(苏won大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究通过数学框架和实验分析,确定人工神经网络求解机器人逆运动学所需的最小训练样本数,发现超过125个样本不再提升模型效率。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23040 2026-05-25 cs.LG 57%

Steered Generation via Gradient-Based Optimization on Sparse Query Features

基于稀疏查询特征的梯度优化引导生成

Sumanta Bhattacharyya, Pedram Rooshenas

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出基于稀疏自编码器和梯度优化的稀疏查询特征引导方法,实现对大型语言模型逻辑规划与风格细节的统一可解释控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22824 2026-05-25 cs.DC cs.AI 57%

An AI-Driven Framework for Energy-Efficient Environmental Monitoring in Smart Cities Using Edge Intelligence

基于边缘智能的智慧城市节能环境监测AI驱动框架

Yichen Liu, Imam Akintomiwa Akinlade, Xiaochong Jiang, Wenting Yang, Shiqi Yang

机构 * Independent Researcher(独立研究者) Harvard Business School(哈佛商学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种利用TinyML边缘设备和上下文感知自适应决策的AI驱动框架,通过效用函数动态激活传感器,减少能耗并延长寿命,在城市规模模拟中验证了其优于静态、周期和UCB自适应策略。

Comments 6 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23811 2026-05-25 eess.SP 50%

A Machine Learning Framework for Large-Scale Static Wireless Mesh Networks

大规模静态无线Mesh网络的机器学习框架

Julia Andrusenko

专题命中 规划决策 :planning(abstract)

AI总结 针对复杂岛屿环境中155个商用现成无线电节点的大规模静态无线Mesh网络,提出一种结合确定性射频传播建模与约束聚类优化的系统设计方法。

Comments 5 pages, 3 figures, submitted to MILCOM 2026 Track 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23616 2026-05-25 econ.GN q-fin.EC 50%

Value-focused modelling to generate alternatives -- Coupling multi-criteria decision analysis and optimisation models to support strategic decisions

价值导向的替代方案生成——耦合多准则决策分析与优化模型以支持战略决策

Emily Bergup, Jonas Finke, Sebastian Schär, Valentin Bertsch

专题命中 规划决策 :planning(abstract)

AI总结 提出价值导向的替代方案生成方法(VF-MGA),通过双向耦合多准则决策分析(MCDA)和建模生成替代方案(MGA),在能源系统规划中生成利益相关者相关的近优替代方案,并通过案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏