A Multi-Agent Off-Policy Actor-Critic Algorithm for Distributed Reinforcement Learning
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
Comments 10 pages, total 9 figures including all sub-figures
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
Journal ref IEEE Robotics and Automation Letters 2(2): 656-663 (2017)
专题命中 规划决策 :agent(title,abstract);planning(title);autonomous agent(abstract);分类 cs.AI
Comments 26 pages, 3 figures, unpublished version
专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI
Comments 54 pages, Master of Science in Informatics Engineering thesis
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
Comments 7 pages, 11 figures
多智能体策略优化中的通用 per-智能体优势估计
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);autonomous agent(comments)
AI总结 本文提出了一种多智能体策略优化框架,通过通用 per-智能体优势估计器提升样本效率和协调性,实验表明其在复杂场景中表现优异。
Comments Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
Agent Banana: 基于代理思维与工具的高质量图像编辑
机构 * TAMU(德克萨斯大学) ; Brown University(布朗大学) ; UW-Madison(威斯康星大学麦迪逊分校) ; UCSD(加州大学圣地亚哥分校) ; USC(南加州大学) ; xAI(xAI公司) ; Adobe Research(Adobe研究院) ; Meta AI ; Princeton University(普林斯顿大学)
专题命中 规划决策 :agent(title,abstract);agentic(title,abstract)
AI总结 Agent Banana通过分层代理规划-执行框架实现高质量图像编辑,解决多轮次编辑一致性与背景忠实度问题,同时保持指令遵循能力。
Comments Project Website: agent-banana.github.io
专题命中 规划决策 :agent(title,abstract);planning(title);multi-agent(abstract);autonomous agent(comments)
Comments Accepted to the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS-23)
面向SAR数据生成的任务驱动与质量保障智能体框架
机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) ; Science and Technology on Electromagnetic Scattering Laboratory, Beijing Institute of Environmental Features(北京环境特征研究院电磁散射实验室)
专题命中 规划决策 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)
AI总结 提出SAGA框架,通过模式约束规划与多维度评估器,实现面向任务的SAR数据增强,提升可靠性、可复现性及下游任务效用。
自适应潜在智能推理
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Waterloo(滑铁卢大学) ; Greenshoe, Inc.(Greenshoe公司)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)
AI总结 提出双模式框架ALAR,在常规决策步骤使用紧凑潜在推理,仅在需要深入思考时切换至显式思维链,在保持或提升任务准确率的同时显著减少生成令牌数。
思想即规划:通过强化规划进行思维链优化的潜在世界模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学)
专题命中 规划决策 :planning(title,summary_cn);分类 cs.AI、cs.CL
AI总结 提出Thoughts-as-Planning框架,将思维链优化形式化为潜在语义空间中的序贯决策过程,通过潜在世界模型模拟推理链编辑对下游输出的影响,并利用梯度下降或强化学习进行规划,在语言理解和生成任务上优于现有基线。
AgentFugue:通过集体推理实现长时域任务的智能体扩展
机构 * GSAI, Renmin University of China(GSAI,中国人民大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 规划决策 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)
AI总结 提出AgentFugue框架,通过共享推理中心实现多个对等智能体并行探索和选择性信息共享,无需显式角色分工或工作流编排,从而提升长时域任务性能。
基于强化学习的高效可迁移智能知识图谱检索增强生成
机构 * MIT CSAIL(麻省理工学院CSAIL) ; University of Virginia(弗吉尼亚大学) ; IBM Research(IBM研究院)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)
AI总结 提出KG-R1框架,通过强化学习将单个智能体与知识图谱交互,统一检索、推理和生成过程,在KGQA基准上以更少生成token提升准确率,并展现跨图谱的零样本迁移能力。
DecoupleSearch: 通过分层奖励建模解耦规划与搜索
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出DecoupleSearch框架,通过双值模型解耦规划与搜索过程,利用蒙特卡洛树搜索评估每一步的质量,并通过分层束搜索迭代优化规划和搜索候选,验证了方法的有效性。
Comments EMNLP 2025 Main Conference
按时、在预算内:面向代理工作流的约束驱动在线资源分配
机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) ; Xiaohongshu Inc(小红书公司)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)
AI总结 本文研究了在预算和截止时间约束下,如何通过约束驱动的在线资源分配提高代理工作流的成功概率,提出MCPP算法并在CodeFlow和ProofFlow上验证其有效性。
Comments Preprint
认知代理编译用于显式问题求解器建模
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agent(title,summary_cn);分类 cs.AI、cs.CL
AI总结 本文提出Cognitive Agent Compilation框架,利用强教师LLM将问题解决知识编译为显式目标代理,旨在提高教育场景中问题解决的可检查性和可编辑性。
Comments Accepted to AIED 2026 Blue Sky
代理强化学习用于大语言模型的景观:综述
机构 * University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; University College London(伦敦大学学院) ; University of Science and Technology of China(中国科学技术大学) ; Imperial College London(伦敦帝国学院) ; Dalian University of Technology(大连理工大学) ; Chinese Academy of Sciences(中国科学院) ; The Chinese University of Hong Kong(香港中文大学) ; University of Georgia(佐治亚大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Bristol(布里斯托大学)
专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);tool use(abstract);planning(abstract)
AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。
Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O
OpenKedge: 通过执行绑定的安全性和证据链治理代理突变
专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 OpenKedge通过引入执行绑定的安全性和证据链,将代理突变转化为受控过程,确保系统行为的可审计性和可预测性。
Comments 17 pages, 3 figures, 2 tables
从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响
专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)
AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。
Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures
代理提案:通过组合技能合成增强大语言模型推理
机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) ; EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Shanghai University of Finance(上海财经大学) ; Wuhan University(武汉大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool-use(abstract);workflow(abstract)
AI总结 Agentic Proposing通过组合技能合成生成高质量训练数据,使大语言模型在数学、编程和科学领域实现更高效的推理和泛化能力。
Comments 23page4
代理作为裁判
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Cambridge(剑桥大学) ; Shandong Jianzhu University(山东建筑大学) ; Huawei Technologies(华为技术)
专题命中 规划决策 :agent(title,abstract);planning(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文提出了一种基于代理的评估框架,通过规划、工具验证和多代理协作提升评估的鲁棒性和可验证性,并提供了该领域的发展分类和未来研究方向。
超越任务完成:评估智能体AI系统的框架
机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴的SERC) ; MontyCloud Inc(MontyCloud公司)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出一个端到端的智能体评估框架,旨在评估智能体AI系统的行为,而不仅仅是任务完成度。
机构 * Old Dominion University(旧 Dominion 大学) ; Florida International University(佛罗里达国际大学) ; University of Sri Jayewardenepura(Sri Jayewardenepura 大学) ; Deloitte & Touche LLP ; AnaletIQ ; Nanyang Technological University(南洋理工大学) ; University of Colombo(科伦坡大学)
专题命中 规划决策 :AI agent(title,abstract);agent(abstract);planning(abstract);agentic(abstract)
机构 * BNRIST, Tsinghua University(北京理工大学、清华大学) ; Independent Researcher(独立研究者)
专题命中 规划决策 :agent(title,abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)
专题命中 规划决策 :agent(title,abstract);planning(abstract);function calling(abstract);multi-agent(abstract)
Comments Project at https://github.com/OpenBMB/AppCopilot
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data, China(大数据研究 institute) ; Sun Yat-sen University, China(中山大学) ; City University of Hong Kong, China(香港城市大学) ; Communication University of China, China(通信大学)
专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)
专题命中 规划决策 :agent(title,abstract);tool use(abstract);planning(abstract);multi-agent(abstract)
Comments Under Review for ACL
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; San Francisco State University(旧金山州立大学) ; Stanford University(斯坦福大学)
专题命中 规划决策 :AI agent(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)