arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-20 至 2026-05-20 共收录 210 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 63 篇

2605.19580 2026-05-20 cs.RO 78%

PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models

PAPO-VLA: 为视觉-语言-动作模型进行规划感知的策略优化

Peizheng Guo, Jingyao Wang, Changwen Zheng, Wenwen Qiang

机构 * Institute of Software Chinese Academy of Sciences(软件研究所中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出PAPO-VLA,一种针对视觉-语言-动作模型的规划感知策略优化方法,通过识别和优化规划动作以提高VLA策略的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19168 2026-05-20 eess.SY cs.SY 78%

Multi-Criteria Integer Programming Model for Route Planning in an Off-Road Combat Environment

多准则整数规划模型在非公路作战环境中的路线规划

Joshua Betz, Daniel Herber, Jeffrey Niemann

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种多准则整数规划模型,用于在开放地形中规划军事车辆路线,综合考虑土壤通行性和敌方接触风险,通过案例研究验证了该模型在量化环境移动约束与战术考虑之间的权衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19139 2026-05-20 cs.PF 78%

Reducing Waiting Time for Medical Tourists Through Hybrid Agent-Based and Discrete-Event Simulation: A Hospital Case Study

通过混合基于代理和离散事件模拟减少医疗旅游者的等待时间:一家医院案例研究

Melika Baghi, Hadi Mosadegh

专题命中 规划决策 :agent(title,abstract)

AI总结 本研究开发了一种混合基于代理和离散事件模拟模型,用于评估国际患者部门的床容量、专科数量、在线咨询比例等关键因素,以减少医疗旅游者的等待时间。

Comments 41 Pages including appedix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04525 2026-05-20 cs.RO 78%

HDFlow: Hierarchical Diffusion-Flow Planning for Long-horizon Tasks

HDFlow:用于长时间任务的分层扩散-流规划

Nandiraju Gireesh, Yuanliang Ju, Chaoyi Xu, Weiheng Liu, Yuxuan Wan, He Wang

机构 * Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出HDFlow,一种新的分层规划框架,利用扩散和修正流模型的优势,克服了单一范式生成规划器的局限性,通过在模拟和现实中的家具组装任务验证其有效性。

Comments ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14355 2026-05-20 math.OC 78%

A PDE-constrained Optimization Approach to Optimal Trajectory Planning under Uncertainty via Reflected Schrödinger Bridges

通过反射薛定谔桥问题实现不确定性下的最优轨迹规划的PDE约束优化方法

Dante Kalise, Wenxin Liu

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于反射薛定谔桥问题的PDE约束优化方法,用于在不确定性下进行最优轨迹规划。该方法通过将问题转化为均场极限,结合非线性Fokker-Planck方程和Hamilton-Jacobi-Bellman方程,利用Hopf-Cole变换将非线性系统转换为可高效求解的正向-反向对流扩散方程,验证了在复杂几何中计算最优控制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19015 2026-05-20 eess.SY cs.RO cs.SY 78%

Probabilistic Recursively Feasible Motion Planning Under Uncertain Environments

概率递归可行性运动规划在不确定环境中

Hyeontae Sung, Hyeongchan Ham, Junyoung Park, Kai Ren, Heejin Ahn

机构 * School of Electrical Engineering, Korea Advanced Institute of Science(韩国科学技术院电气工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种概率递归可行模型预测控制框架,通过保证递归可行性概率来解决不确定环境中安全运动规划的挑战,主要贡献是通过闭式表达式计算轨迹的均值和协方差,并构建安全约束以确保递归可行性。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18778 2026-05-20 cs.SI 78%

T-REX: Fast and Dynamic Journey Planning for Continental-Scale Public Transit Networks

T-REX:用于大陆级公共交通网络的快速动态行程规划

Jonas Sauer, Patrick Steil, Sascha Witt

专题命中 规划决策 :planning(title,abstract)

AI总结 T-REX通过多级覆盖原则优化公共交通行程规划,利用网络多级划分快速识别长途旅行中的换乘,显著提升查询速度和效率,适用于大陆规模的实时交互应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20055 2026-05-20 cs.SE cs.AI cs.RO 76%

Towards LLM-Assisted Architecture Recovery for Real-World ROS~2 Systems: An Agent-Based Multi-Level Approach to Hierarchical Structural Architecture Reconstruction

面向现实世界ROS~2系统的LLM辅助架构恢复:一种基于智能体的多级方法用于分层结构架构重建

Dominique Briechle, Raj Chanchad, Tobias Geger, Ruidi He, Dhruv Jajadiya, Dhruv Kapadiya, Andreas Rausch, Meng Zhang

机构 * Institute for Software and Systems Engineering, Clausthal University of Technology, Clausthal-Zellerfeld 38678, Germany(软件与系统工程研究所, Clausthal 技术大学, Clausthal-Zellerfeld 38678,德国)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于智能体的多级方法,用于恢复复杂ROS~2系统中的分层结构架构,通过改进的提示和多级中间架构表示,提高了架构恢复的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18872 2026-05-20 cs.LG cs.AI cs.RO 76%

EUPHORIA: Efficient Universal Planning via Hybrid Optimization for Robust Industrial Robotic Assembly

EUPHORIA: 通过混合优化实现高效通用规划以实现稳健的工业机器人装配

Shih-Yu Lai, Chia-Ching Yen, Yang-Ting Shen, Peter Yichen Chen, Yu-Lun Liu, Bing-Yu Chen

机构 * National Taiwan University(国立台湾大学) MoonShine Animation Studio(MoonShine动画工作室) National Cheng Kung University(国立成功大学) The University of British Columbia(不列颠哥伦比亚大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 本文提出EUPHORIA框架,通过混合优化策略实现通用少样本适应和动态效率,解决建筑机器人装配中规划器高度专业化和操作低效的问题,结合元几何编码器、物理引导图变压器和残差稳定性校正等方法,实现高效且鲁棒的装配规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17038 2026-05-20 cs.AI 74%

Phase-Aware Mixture of Experts for Agentic Reinforcement Learning

具有相意识的专家混合用于代理强化学习

Shengtian Yang, Yu Li, Shuo He, Yewen Li, Qingpeng Cai, Peng Jiang, Lei Feng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing and Data Science学院,新加坡)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 本文提出了一种具有相意识的专家混合(PA-MoE),以解决传统专家混合(MoE)中由于token级路由导致的相一致模式碎片化问题,通过学习隐含的相边界来提升专家的专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18772 2026-05-20 cs.IR cs.AI cs.CL 73%

Improving Retrieval-Augmented Generation without Taxonomy-based Error Categorization

无需基于分类的错误归类即可改进检索增强生成

Gongbo Zhang, Yifan Peng, Chunhua Weng

机构 * Columbia University(哥伦比亚大学) Weill Cornell Medicine(韦尔·科恩医学中心)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RePAIR方法,通过直接将错误的RAG输出映射到错误缓解行动计划,无需依赖细粒度错误分类和显式批评者监督,从而提升检索增强生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14787 2026-05-20 cs.RO 71%

COMPASS: Confined-space Manipulation Planning with Active Sensing Strategy

COMPASS:基于主动感知策略的受限空间操作规划

Qixuan Li, Chen Le, Dongyue Huang, Jincheng Yu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) Department of Electronic Engineering, and the Institute for Embodied Intelligence and Robotics, Tsinghua University, Beijing, China(清华大学电子工程系,以及 embodied intelligence and robotics 研究院,中国北京) The School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院,新加坡)

专题命中 规划决策 :planning(title)

AI总结 本文提出COMPASS框架,通过主动感知策略在受限和杂乱环境中实现安全操作,提高了操作成功率。

Comments Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19604 2026-05-20 cs.AI 70%

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

形式技能:用于高效且准确LLM代理的可编程运行时技能

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

机构 * FairyClaw

专题命中 规划决策 :workflow(abstract);function calling(abstract);分类 cs.AI

AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13646 2026-05-20 cs.RO cs.AI 70%

Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling

基于因果性的端到端自动驾驶:通过以自身为中心的联合场景建模

Seokha Moon, Minseung Lee, Joon Seo, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出CaAD框架,通过共享潜在场景表示捕捉车辆与周围代理之间的因果依赖关系,以提高端到端自动驾驶的闭环规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG 67%

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07777 2026-05-20 cs.MA cs.GT 67%

Talk, Judge, Cooperate: Gossip-Driven Indirect Reciprocity in Self-Interested LLM Agents

谈话、评判、合作:在自利LLM代理中基于 gossip 的间接互惠

Shuhui Zhu, Yue Lin, Shriya Kaistha, Wenhao Li, Baoxiang Wang, Hongyuan Zha, Gillian K. Hadfield, Pascal Poupart

专题命中 规划决策 :agentic(abstract,abstract_cn)

AI总结 本文提出ALIGN框架,通过策略性分享开放式 gossip 实现去中心化代理的声誉形成、信任评估和社会规范协调,从而提升间接互惠并抵御恶意入侵,发现LLM的更强推理能力促进更激励对齐的合作,而聊天模型容易过度合作。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20149 2026-05-20 cs.CL cs.AI cs.HC 62%

Less Back-and-Forth: A Comparative Study of Structured Prompting

少来回:结构化提示的比较研究

Saurav Ghosh, Gabriella Polach, Abdou Sow

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了结构化提示设计是否能提高LLM响应质量并减少用户努力,通过比较三种提示条件,发现检查清单提示在任务完成、正确性、合规性和清晰度方面得分最高,且在质量和努力的平衡上表现最佳。

Comments 7 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20037 2026-05-20 cs.LG cs.AI 62%

When Critics Disagree: Adaptive Reward Poisoning Attacks in RIS-Aided Wireless Control System

当批评者意见不一致时:RIS辅助无线控制系统中的自适应奖励中毒攻击

Deemah H. Tashman, Soumaya Cherkaoui

机构 * Department of Computer and Software Engineering(计算机与软件工程系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于分歧引导的奖励中毒攻击(DGRP),用于攻击Soft Actor-Critic(SAC)智能体,以评估RIS辅助网络中深度强化学习(DRL)的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19975 2026-05-20 cs.LG cs.AI 62%

Learning with Foresight: Enhancing Neural Routing Policy via Multi-Node Lookahead Prediction

具有前瞻性学习:通过多节点前瞻性预测增强神经路由策略

Xia Jiang, Yaoxin Wu, Yew-Soon Ong, Yingqian Zhang

机构 * Eindhoven University of Technology(埃因霍温理工大学) Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出多节点前瞻性预测(MnLP)方法,通过扩展监督学习范式同时预测多个未来节点,提升神经路由策略的长期规划能力,并在不同问题规模和现实基准上改进泛化能力。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 62%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16814 2026-05-20 cs.LG cs.AI cs.CV 62%

Needles in the Landscape: Semi-Supervised Pseudolabeling for Archaeological Site Discovery under Label Scarcity

景观中的针:在标签稀缺条件下用于考古遗址发现的半监督伪标签方法

Simon Jaxy, Anton Theys, Patrick Willett, W. Chris Carleton, Ralf Vandam, Pieter Libin

机构 * Sensors, Royal Military Academy, Brussels, Belgium AMGC (Archaeology, Environmental Changes \& Geo-Chemistry), Vrije Universiteit Brussel Max Planck Institute of Geoanthropology, Jena, Germany Shared first author Shared last author

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种非对称双伪标签(DPL)方法,通过端到端深度学习直接从多波段遥感影像中学习稀疏正样本,无需人工特征工程或对遗址不存在的假设,在两个著名的考古数据集上进行了评估。DPL在Sagalassos数据集上优于LAMAP基线,在F1和召回率上分别提高了12%和29%,而在Cyprus数据集上,DPL在无确认负样本的纯PU设置中恢复了判别能力。DPL的集成产生可解释的概率表面,支持调查规划,从最小的标记数据中有效发现遗址。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00286 2026-05-20 cs.LG cs.AI math.OC stat.ML 62%

Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model

递归熵风险优化在折扣马尔可夫决策过程中的应用:带有生成模型的样本复杂性界

Oliver Mortensen, Mohammad Sadegh Talebi

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在有限折扣马尔可夫决策过程(MDP)中使用递归熵风险度量(ERM)进行风险敏感强化学习的问题,引入了基于模型的算法Model-Based ERM Q-Value Iteration(MB-RS-QVI),并推导了该算法在价值学习和策略学习中的PAC型样本复杂性界,证明了在最坏情况下样本复杂性与|β|/(1-γ)呈指数关系,为递归ERM在风险规避和风险寻求情形下的样本复杂性提供了首次严格保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20072 2026-05-20 cs.AI cs.RO 57%

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

探查具身大语言模型:当更高的观察保真度损害问题解决

Oussama Zenkri, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(柏林技术大学机器人与生物学实验室) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(柏林科学智能研究卓越集群) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究了具身大语言模型在不同观察信息下的行为,发现高保真度观察反而降低了问题解决能力,核心方法是通过实验改变可用信息并测量行为变化,主要贡献是揭示了感知误差与推理失败的交互影响。

Comments Submitted to From Animals to Animats: The 18th International Conference on the Simulation of Adaptive Behavior (SAB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20061 2026-05-20 cs.CL 57%

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

奖励信念,而非行动:一致性引导的长期智能体信用分配

Wenjie Tang, Minne Li, Sijie Huang, Liquan Xiao, Yuan Zhou

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出ReBel算法,通过建模结构化信念状态来指导策略学习,解决长期任务中由于部分可观测性导致的信用分配问题,实验表明其在ALFWorld和WebShop等基准测试中提升了任务成功率并提高了样本效率。

Comments 10 pages, 4 figures, 3 tables, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05066 2026-05-20 cs.LG 57%

Reward-Conditioned Reinforcement Learning

基于奖励的强化学习

Michal Nauman, Marek Cygan, Pieter Abbeel

机构 * University of Warsaw(华沙大学) Nomagic UC Berkeley, Amazon FAR(伯克利大学,亚马逊FAR)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出基于奖励的强化学习(RCRL),通过在收集经验时使用单一名义目标,使智能体在不额外交互的情况下暴露于多种奖励目标,从而提高样本效率并支持零样本行为调整。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19634 2026-05-20 cs.CV cs.AI 57%

P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation

P2DNav: 全景到俯视视角的零样本视觉-语言导航

Kai Sheng, Liuyi Wang, Haojie Dai, Jinlong Li, Yongrui Qin, Zongtao He, Chengju Liu, Qijun Chen

机构 * Department of Control Science and Engineering, Tongji University(控制科学与工程系,同济大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出P2DNav框架,通过全景到俯视视角的分解、滑动窗口对话记忆和反思重新定位机制,解决零样本视觉-语言导航中的方向推理与局部定位问题,实验表明其在R2R-CE基准上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19597 2026-05-20 cs.CL 57%

LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening

LLMEval-Logic: 一个验证求解器的中文逻辑推理基准,具有对抗性强化

Ming Zhang, Qiyuan Peng, Yinxi Wei, Yujiong Shen, Kexin Tan, Yuhui Wang, Zhenghao Xiang, Junjie Ye, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Maxm Pan, Ruizhi Yang, Qi Zhang, Xuanjing Huang

机构 * Institute of Trustworthy Embodied Artificial Intelligence(可信具身人工智能研究院) Fudan University(复旦大学) Hunyuan Team Tencent(腾讯 Hunyuan 团队) School of Philosophy Fudan University(复旦大学哲学学院)

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 本文提出LLMEval-Logic,一个基于真实情境场景的中文逻辑推理基准,通过作者和专家共同审核自然语言项目及其形式化参考,利用Z3验证注释答案,构建自然到形式的评分标准,并通过闭环对抗流程强化选定项目。基准包含246个基础项目和190个难度项目,评估14个前沿LLM显示当前模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19587 2026-05-20 cs.AI 57%

SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects

SceneCode: 可执行的世界程序用于可编辑的室内场景及具有关节物体

Puyi Wang, Yuhao Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yangguang Li, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Microsoft(微软) University of Oxford(牛津大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文提出SceneCode,一种通过可执行程序生成可编辑的室内场景,解决了现有方法中物体结构控制不足的问题,提升了场景生成的精确性和可交互性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19447 2026-05-20 cs.AI 57%

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

什么和何时去蒸馏:多轮代理的定向 hindsight 蒸馏

Xiaozhe Li, Tianyi Lyu, Yang Li, Yichuan Ma, Peiji Li, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Tongji University Shanghai AI Laboratory(同济大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究了多轮代理中如何选择性地利用 hindsight 蒸馏,提出了一种基于环境反馈的强化学习框架 SERL,通过任务奖励和环境反馈的结合,在 ALFWorld 和 WebShop 任务中取得了较高的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19314 2026-05-20 cs.RO cs.AI 57%

ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents

ContextFlow:长周期具身智能体的分层任务-状态对齐

Shuhan Guo, Kun Zhang, Haifei Liu, Xingyu Gao, Yongqi Zhang, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Qiuzhen College, Tsinghua University(清华大学启祯学院) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院) Department of Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)数据科学与分析部门) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了长周期具身智能体中任务-状态不一致问题,提出ContextFlow框架通过显式合同表示阶段、运行时观测转为证据包以及应用作用域更新来实现任务前沿对齐,提高任务执行的连贯性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏