arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-21 至 2026-05-21 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 41 篇

2605.21240 2026-05-21 cs.LG cs.AI 62%

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

APEX:自主策略探索用于自演化大语言模型代理

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APEX,一种用于自演化大语言模型代理的自主策略探索方法,通过构建和维护显式的策略空间来解决探索崩溃问题,并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20784 2026-05-21 cs.AI cs.LG 62%

Interaction Locality in Hierarchical Recursive Reasoning

层次递归推理中的交互局部性

Yosuke Miyanishi, Tetsuro Morimura

机构 * CyberAgent Inc.(CyberAgent公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出交互局部性框架,用于测量信息流是否在附近单元或语义段内传输或跨越,通过在HRM和TRM等层次递归推理模型上应用,验证了局部执行与全局规划的可重复测量框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20758 2026-05-21 cs.AI cs.CV cs.LG cs.RO 62%

Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards

面向组合奖励的冲突感知加法引导:流模型中的对抗性生成

Xuehui Yu, Fucheng Cai, Meiyi Wang, Xiaopeng Fan, Harold Soh

机构 * Smart Systems Institute, National University of Singapore, Singapore(新加坡国立大学智能系统研究所) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种面向组合奖励的冲突感知加法引导方法,用于在流模型中处理对抗性生成问题,通过动态检测和解决梯度冲突来纠正离曼福德漂移,提升了生成保真度。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12483 2026-05-21 cs.LG cs.AI 62%

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

超越GRPO和在线策略蒸馏:一种经验性稀疏到密集奖励原则用于语言模型后训练

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种经验性的稀疏到密集奖励原则,用于语言模型后训练,通过在教师模型上使用稀疏奖励进行探索和发现,然后通过密集监督将行为压缩到部署模型中,从而在数学问题上实现了优于GRPO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20258 2026-05-21 cs.LG cs.AI cs.CR 62%

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

需要两人:互补的自我蒸馏用于大语言模型中的上下文完整性

Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SELFCI框架,通过分离信息抑制与任务解决,解决大语言模型中隐私与效用的权衡问题,通过互补的自我蒸馏方法提升上下文完整性。

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20242 2026-05-21 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 62%

LEAP: A closed-loop framework for perovskite precursor additive discovery

LEAP:一种用于钙钛矿前驱体添加剂发现的闭环框架

Xin-De Wang, Zhi-Rui Chen, Ze-Feng Gao, Peng-Jie Guo, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出LEAP框架,结合大语言模型和主动学习,通过文献驱动的机制相关描述符和贝叶斯优化,实现了钙钛矿太阳能电池添加剂的高效发现,实验验证显示其在性能提升方面优于通用模型。

Comments 30 pages; 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21061 2026-05-21 cs.CV cs.AI cs.RO 57%

Grounding Driving VLA via Inverse Kinematics

通过逆运动学接地驾驶VLA

Junsung Park, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) KimJaeChul AI Graduate School(金 JaeChul人工智能研究生院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出通过逆运动学求解器重新设计驾驶VLA,以解决轨迹预测中对视觉token的忽略问题,通过引入视觉状态预测和逆运动学网络,提升了视觉接地和轨迹规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20743 2026-05-21 cs.CV cs.CL 57%

Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction

Draw2Think: 通过约束引擎交互增强几何推理

Juncheng Hu, Jiawei Du, Xin Zhang, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 Draw2Think通过与GeoGebra约束引擎交互,将几何推理从潜在空间推断转换为与约束引擎的代理交互,从而提高几何推理的准确性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20648 2026-05-21 cs.RO cs.AI 57%

Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition

联合学习谓词和动作使零样本技能组合成为可能

Benedict Quartey, Sebastian Castro, Eric Rosen, Wil Thomason, George Konidaris, Stefanie Tellex

机构 * Brown University(布朗大学) Robotics & AI Institute(机器人与人工智能研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种联合学习谓词和动作的技能方法,通过闭合回路的视觉-运动策略,使机器人能够在不重新训练的情况下实现零样本技能组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15157 2026-05-21 cs.RO cs.LG 57%

Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention

手在环中:通过无缝手臂干预改进VLA策略以实现灵巧操作

Zhuohang Li, Liqun Huang, Wei Xu, Zhengming Zhu, Nie Lin, Xiao Ma, Xinjun Sheng, Ruoshi Wen

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(机械系统与振动国家重点实验室,机械工程学院,上海交通大学) Shanghai Key Laboratory of Intelligent Robotics, Meta Robotics Institute, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海市重点实验室,元机器人研究院,上海交通大学,上海200240,中国) The University of Tokyo(东京大学)

专题命中 规划决策 :tool use(abstract);分类 cs.LG

AI总结 本文提出Hand-in-the-Loop方法,通过无缝整合人类干预与自主策略执行,减少手部操作中的突兀变化,提升双臂灵巧操作的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14392 2026-05-21 cs.LG cs.RO 57%

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems

WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统

Yuchen Wang, Jiangtao Kong, Sizhe Wei, Xiaochang Li, Haohong Lin, Hongjue Zhao, Tianyi Zhou, Lu Gan, Huajie Shao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23086 2026-05-21 cs.AI 57%

Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks

从输出监督学习的链式思维混淆可以泛化到未见过的任务

Nathaniel Mitrani Hadida, Sassan Bhanji, Cameron Tice, Puria Radmard

机构 * University of Cambridge(剑桥大学) Geodesic Research

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文研究了链式思维(CoT)推理中混淆现象的泛化能力,发现模型在学习混淆推理轨迹时,能够将这种混淆行为及其在未见过的任务中表现出来,从而影响模型的可监控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21257 2026-05-21 cs.RO 50%

Reinforcement Learning for Risk Adaptation via Differentiable CVaR Barrier Functions

通过可微分CVaR障碍函数实现风险适应的强化学习

Xinyi Wang, Taekyung Kim, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou

机构 * Department of Robotics(机器人学系) Department of Aerospace Engineering(航空航天工程系) University of Michigan(密歇根大学) Toyota Motor North America, Research & Development(丰田美国北美洲研发)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种端到端的风险适应框架,用于在障碍物运动不确定性的环境下进行人群导航,结合强化学习与基于条件价值-at-风险(CVaR)障碍函数的可微分二次规划安全层,共同学习名义控制输入、风险水平和安全边际,并强制执行显式的概率安全约束。

Comments Project page: https://anonymousrobotics9666.github.io/rlcvarbf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21138 2026-05-21 cs.RO 50%

Safety-Critical Control for Smoothed Implicit Contact Dynamics

安全关键控制用于平滑隐式接触动力学

Haegu Lee, Yitaek Kim, Christoffer Sloth

机构 * The Maersk Mc-Kinney Moller Institute, University of Southern Denmark(马士基麦金尼莫勒研究所,丹麦南部大学)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种方法,通过引入边界聚焦的滚动策略和离散时间控制屏障函数框架,解决平滑隐式接触动力学中接触力的约束问题,以提高安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21132 2026-05-21 cs.CV 50%

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

SurgOnAir: 基于层次感知的实时手术视频评论

Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

机构 * Computer Aided Medical Procedures (CAMP), TU Munich, Germany Munich Center for Machine Learning (MCML), Munich, Germany University of Strasbourg, France The Chinese University of Hong Kong, Hong Kong

专题命中 规划决策 :workflow(abstract)

AI总结 本研究提出SurgOnAir,一种流式视觉-语言模型,通过层次化数据集实现对手术流程多层级的实时理解与评论生成,提升手术过程中的即时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21026 2026-05-21 cs.RO 50%

Component Influence-Driven Fastener Reduction for Robotic Disassemblability-Aware Design Simplification

基于组件影响的快速件减少用于机器人拆解意识设计简化

Takuya Kiyokawa, Tomoki Ishikura, Shingo Hamada, Genichiro Matsuda, Kensuke Harada

机构 * Department of Systems Innovation, Graduate School of Engineering Science, The University of Osaka(大阪大学工学研究科系统创新部门) Manufacturing Innovation Division, Panasonic Holdings Corporation(松下电器制造创新部门)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种分析框架,通过快速件减少来提高机器人拆解意识设计简化,该框架利用CAD模型和自动生成的接触-连接-约束(CCC)图,将机器人拆解序列规划结果转化为组件影响评分,以指导设计简化。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21008 2026-05-21 eess.AS 50%

A Survey of Audio Reasoning in Multimodal Foundation Models

多模态基础模型中音频推理的综述

Zhihan Guo, Wenqian Cui, Guan-Ting Lin, Daxin Tan, Jingyao Li, Qiyong Zheng, Dingdong Wang, Jing Xiong, Han Shi, Jiaya Jia, Irwin King

专题命中 规划决策 :agentic(abstract)

AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20925 2026-05-21 physics.ao-ph 50%

Blending machine learning and physics-based approaches for weather and climate: a typology

将机器学习与物理基础方法结合用于天气和气候:一种类型学

Benjamin J Shipway, Caroline Bain, David Walters, Ben B. B. Booth, Ian Boutle, Robin T. Clark, Katherine L. Hill, Elizabeth Kendon, Simon B. Vosper

专题命中 规划决策 :planning(abstract)

AI总结 本文探讨了将机器学习与物理基础模型结合用于天气和气候预测的类型学,分析了融合方法的核心优势与挑战,为未来预测系统的发展提供了指导。

Comments Submitted to Bull. Amer. Meteor. Soc. (BAMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20796 2026-05-21 cs.RO 50%

CMC-Opt: Constraint Manifold with Corners for Inequality-Constrained Optimization

CMC-Opt: 带角落的约束流形用于不等式约束优化

Yetong Zhang, Frank Dellaert

机构 * College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院) Atlanta, USA(美国亚特兰大)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种基于流形的框架,用于解决机器人中存在等式和不等式约束的优化问题。通过引入带角落的约束流形,将原问题直接转换为无约束优化问题,从而在约束状态空间上进行优化,并在大规模动力学规划问题中验证了该框架的有效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27375 2026-05-21 cs.CV 50%

VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching

VeraRetouch: 一个轻量级的全微分框架用于多任务推理照片修复

Yihong Guo, Youwei Lyu, Jiajun Tang, Yizhuo Zhou, Hongliang Wang, Jinwei Chen, Changqing Zou, Qingnan Fan

机构 * Zhejiang University(浙江大学) vivo BlueImage Lab(vivo BlueImage实验室) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang Lab(浙江实验室)

专题命中 规划决策 :workflow(abstract)

AI总结 本文提出VeraRetouch,一个轻量级且全微分的多任务照片修复框架,通过使用0.5B视觉-语言模型和全微分的修复渲染器,实现了端到端的像素级训练,并引入了AetherRetouch-1M+数据集和DAPO-AE强化学习策略,以提升修复性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20388 2026-05-21 cs.CV 50%

How You Move Tells What You'll Do: Trajectory-Conditioned Egocentric Prediction

如何移动决定了将来的行动:轨迹条件的自身视角预测

Sejoon Jun, Hai Nguyen-Truong, Luigi Seminara, Lorenzo Torresani

机构 * Khoury College of Computer Sciences, Northeastern University, Boston(北德文斯克学院,东北大学,波士顿) Korea Advanced Institute of Science and Technology, Daejeon(韩国科学技术院,大田) Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系,意大利)

专题命中 规划决策 :planning(abstract)

AI总结 该研究通过轨迹条件自身视角预测,发现轨迹能更精确地表达意图,从而在任务规划中优于语言条件,且在预测时无需观察轨迹即可获得显著优势。

Comments Project page: https://farsightlab.github.io/TrajPilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17003 2026-05-21 cs.CR 50%

From Public-Key Linting to Operational Post-Quantum X.509 Assurance for ML-KEM and ML-DSA: Registry-Driven Policy, Mutation-Based Evaluation, and Import Validation

从公钥 linting 到操作性后量子 X.509 保证:面向 ML-KEM 和 ML-DSA 的注册驱动政策、突变基于评估和导入验证

José Luis Delgado Jiménez

专题命中 规划决策 :workflow(abstract)

AI总结 本文提出了一种操作性的后量子 X.509 保证框架,用于 ML-KEM 和 ML-DSA,在狭义可执行配置文件 pkix-core 中,通过注册驱动政策、突变基于评估和导入验证来确保证书配置文件语义、SubjectPublicKeyInfo 表示和私钥容器导入的正确性。

Comments 48 pages, 13 figures, 32 tables, 6 appendices. Includes artifact, reproducibility, and cross-tool evaluation appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 34 篇

2603.06007 2026-05-21 cs.CL cs.AI cs.MA 91%

MASFactory: A Graph-centric Framework for Orchestrating LLM-Based Multi-Agent Systems with Vibe Graphing

MASFactory: 一种基于图的框架,用于通过Vibe图谱编排基于大语言模型的多智能体系统

Yang Liu, Jinxuan Cai, Yishen Li, Qi Meng, Zedi Liu, Xin Li, Chen Qian, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出MASFactory,一种基于图的框架,用于通过Vibe图谱编排基于大语言模型的多智能体系统,解决了现有框架在实现复杂图工作流时需要大量手动工作、重用性差和难以整合异构外部上下文源的问题。

Comments Accepted to the ACL 2026 Demo Track. Camera-ready version. 10 pages, 6 figures. Code and documentation are available at: https://github.com/BUPT-GAMMA/MASFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20425 2026-05-21 cs.AI 90%

AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows

AgentCo-op: 基于检索的互操作多智能体工作流合成

Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma

机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系) Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出AgentCo-op,一种基于检索的多智能体工作流合成框架,通过类型化任务传递合成可执行工作流,并在执行证据表明失败时应用有界自引导局部修复。在两个开放世界基因组学案例研究中,AgentCo-op在不重设计或运行全局拓扑搜索的情况下,将独立开发的科学智能体和外部工具库整合到可审计的工作流中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04332 2026-05-21 cs.MA 90%

DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux

DRAMA: 为动态变化中的多智能体生态系统提供下一代动态编排

Xinkui Zhao, Yifan Zhang, Sai Liu, Naibo Wang, Guanjie Cheng, Yueshen Xu, Chang Liu, Shuiguang Deng, Jianwei Yin

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);autonomous agent(abstract);planning(abstract)

AI总结 本文提出DRAMA,一种动态且鲁棒的多智能体系统,通过模块化架构和灵活的任务分配机制,提高多智能体在快速变化环境中的协作韧性。

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20563 2026-05-21 cs.MA cs.AI cs.CL cs.LG cs.SE 89%

Multi-agent Collaboration with State Management

具有状态管理的多智能体协作

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong

机构 * Shanghai Jiaotong University(上海交通大学) Cortices AI Emory University(埃默里大学) Peking University(北京大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出STORM,一种面向多智能体协作的状态管理方法,通过在共享工作区中调解智能体的交互,确保每个智能体在一致的代码库视图上操作,并在写入时检测和解决冲突。STORM在多个LLM上优于基于git-worktree的多智能体基线,且在成本效率上具有竞争力,表明显式状态管理比工作区隔离更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09215 2026-05-21 cs.AI cs.CR 89%

Enabling Regulatory Multi-Agent Collaboration: Architecture, Challenges, and Solutions

使监管多智能体协作成为可能:架构、挑战与解决方案

Qinnan Hu, Yuntao Wang, Yuan Gao, Zhou Su, Linkang Du, Qichao Xu

机构 * School of Cyber Science and Engineering(网络科学与工程学院) Xi'an Jiaotong University(西安交通大学) School of Mechatronic Engineering and Automation(机械电子工程与自动化学院) Shanghai University(上海大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于区块链的分层架构,用于监管智能体协作,设计了三个关键模块以实现自动问责、动态声誉评估和恶意行为预测,从而建立可信、健壮和可扩展的监管机制。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20929 2026-05-21 cs.RO 89%

STEAM: A Training-Free Congestion-Aware Enhancement Framework for Decentralized Multi-Agent Path Finding

STEAM: 一种无需训练的拥堵感知增强框架用于去中心化多智能体路径寻找

Mingyang Feng, Mengnuo Zhang, Shaoyuan Li, Xiang Yin

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文提出STEAM框架,一种无需训练的去中心化多智能体路径寻找(MAPF)学习方法,在离散环境中通过注入轻量级拥堵感知指导来提升性能,通过空间避让、时间修正和密度修正等方法提高成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14201 2026-05-21 cs.RO cs.CV 89%

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

MAPLE:基于潜在空间的多智能体交互用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

机构 * Qualcomm AI Research(英矽人工智能研究)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)

AI总结 本文提出MAPLE框架,通过在视觉-语言-动作模型的潜在空间中实现反应式多智能体滚动,以解决传统模仿学习框架下闭环设置中模型易碎的问题,通过监督微调和强化学习结合多样性奖励,实现了可扩展且无需外部模拟器的闭环训练,提升了端到端自动驾驶系统的鲁棒性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02844 2026-05-21 cs.LG cs.AI cs.CR cs.MA 88%

Wolfpack Adversarial Attack for Robust Multi-Agent Reinforcement Learning

狼群对抗攻击用于鲁棒多智能体强化学习

Sunwoo Lee, Jaebak Hwang, Yonghyeon Jo, Seungyul Han

机构 * Graduate School of Artificial Intelligence, UNIST, Ulsan, South Korea(人工智能研究生院,UNIST,韩国乌山)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出狼群对抗攻击框架,用于对抗多智能体强化学习中的协同对抗攻击,并引入狼群-对抗学习框架来训练鲁棒的MARL策略以防御该攻击。

Comments 9 pages main, 23 pages appendix with reference. Accepeted by ICML 2025

Journal ref Proceedings of Machine Learning Research (PMLR), ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏