arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-14 至 2026-05-14 共收录 183 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 40 篇

2602.02350 2026-05-14 cs.AI cs.LG cs.MA 88%

Context Learning for Multi-Agent Discussion

多智能体讨论中的上下文学习

Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus(中山大学深圳校区网络科学与技术学院) College of Computer Science, Northwest University(西北大学计算机学院) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网体系结构实验室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出M2CL方法,通过动态生成上下文指令提升多智能体讨论的一致性与协作效率,实验表明其在多个任务中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11556 2026-05-14 cs.CL cs.AI cs.MA 88%

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

多智能体大语言模型中分布式信息下的集体推理系统性失效

Yuxuan Li, Aoi Naito, Hirokazu Shirado

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学学院,卡内基梅隆大学,匹兹堡,美国) School of Environment and Society, Institute of Science Tokyo, Tokyo, Japan(环境与社会学院,东京科学研究所,东京,日本)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究发现多智能体大语言模型在分布式信息下仅能获得30.1%的准确率,而单智能体在完整信息下可达80.7%。系统性失效源于智能体无法识别和应对潜在的信息不对称,导致关键分布式事实未被探索。通过轻量级结构化通信协议可显著提升集体推理能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13725 2026-05-14 cs.AI cs.SI 88%

ScioMind: Cognitively Grounded Multi-Agent Social Simulation with Anchoring-Based Belief Dynamics and Dynamic Profiles

ScioMind:基于认知的多智能体社交模拟与基于锚定的信念动态和动态资料

Yitian Yang, Yiqun Duan, Linghan Huang, Yiqi Zhu, Francesco Bailo, Chunmeizi Su, Huaming Chen

机构 * The University of Sydney(悉尼大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 ScioMind结合结构化意见动态与LLM代理推理,通过记忆锚定信念更新规则、分层记忆架构和动态代理资料提升社交模拟的真实性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13496 2026-05-14 cs.DC cs.LG 88%

MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters

MARLIN:多智能体博弈强化学习用于云数据中心可持续LLM推理

H. Moore, S. Qi, D. Milojicic, C. Bash, S. Pasricha

机构 * Colorado State University(科罗拉多州立大学) Hewlett Packard Labs(惠普实验室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出MARLIN框架,通过博弈强化学习优化LLM推理的TTFT、碳排放、用水量和能耗,实现至少18%的TTFT、33%的碳排放、43%的用水量和11%的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13345 2026-05-14 cs.AI cs.MA 88%

Multi-Agent Systems in Emergency Departments: Validation Study on a ED Digital Twin

急诊部门中的多智能体系统:数字孪生的验证研究

Markus Wenzel, Tobias Strapatsas, Jessika Kress, Dorothea Sauer, Nele Gessler, Horst K. Hahn

机构 * Constructor University(Constructor大学) Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Asklepios Kliniken Hamburg GmbH(阿斯克列庇斯汉堡医院有限公司)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种混合离散事件模拟与基于智能体的模型,用于验证急诊部门的资源配置优化策略,通过实证研究展示了模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12388 2026-05-14 cs.MA cs.LG 88%

Events as Triggers for Behavioral Diversity in Multi-Agent Reinforcement Learning

事件作为多智能体强化学习中行为多样性的触发因素

Hannes Büchi, Manon Flageat, Eduardo Sebastián, Amanda Prorok

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出通过事件触发机制解耦智能体身份与行为,引入神经流形多样性与事件驱动超网络,实现动态行为适应与零样本泛化,提升多智能体协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13170 2026-05-14 cs.LG cs.MA 88%

Finding the Weakest Link: Adversarial Attack against Multi-Agent Communications

寻找最薄弱的环节:针对多智能体通信的对抗攻击

Maxwell Standen, Junae Kim, Claudia Szabo

机构 * The University of Adelaide(阿德莱德大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文研究了针对多智能体强化学习系统的一种单目标通信扰动攻击,提出利用雅可比矩阵的梯度信息来识别最易受攻击的消息、智能体和时间步,同时引入两种对抗损失函数以平衡攻击成功率与影响,通过实验验证了方法的有效性。

Comments Full version of the Extended Abstract presented at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 88%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01457 2026-05-14 cs.AI 88%

CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making

CoFlow:协调的少步流用于离线多智能体决策制定

Guowei Zou, Haitao Wang, Beiwen Zhang, Boning Zhang, Hejun Wu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 CoFlow通过协调速度注意力和自适应协调门控,在少步生成中保持多智能体协调,提升离线多智能体强化学习的效率与协调性。

Comments 34 pages, 15 figures, 10 tables. Project page: https://guowei-zou.github.io/coflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 88%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01453 2026-05-14 cs.LG 88%

The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration

合作多智能体探索中的地平线阈值

Idan Barnea, Orin Levy, Yishay Mansour

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文研究了在无奖励探索设定下合作多智能体强化学习,提出了一种分阶段学习框架,通过有限时间步数的MDP,确定学习阶段数与智能体数量的权衡,证明当学习阶段数等于地平线H时,算法效率与精度的最优平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01049 2026-05-14 cs.LG 88%

Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies

集中式自适应采样用于独立多智能体策略的可靠协同训练

Nicholas E. Corrado, Josiah P. Hanna

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出CoSER方法,通过协调动作选择减少联合采样误差,提升多智能体强化学习中策略梯度算法的收敛可靠性。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13269 2026-05-14 eess.SY cs.SY 88%

Submodular Multi-Agent Policy Learning for Online Distributed Task Allocation in Open Multi-Agent Systems

用于开放多智能体系统在线分布式任务分配的子模多智能体策略学习

Jing Liu, Yangyang Yang, Luca Ballotta, Fangfei Li, Yang Tang, Ruggero Carli

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文研究了具有子模团队效用的多智能体强化学习,针对分布式任务分配问题,提出子模多智能体策略梯度框架SubMAPG,通过子模差奖励训练信号实现高效任务分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22117 2026-05-14 eess.SY cs.SY 88%

Safe Multi-Agent Navigation via Constrained HJB-Informed Learning

通过约束HJB引导学习实现安全多智能体导航

Fenglan Wang, Xinguo Shu, Lei He, Lin Zhao

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文提出HJB-GNN框架,通过联合学习控制屏障函数、分布式导航策略和价值函数,实现多智能体导航中的安全约束与目标达成的平衡,验证了其在复杂环境中的优越性能和可扩展性。

Comments Accepted by Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00982 2026-05-14 cs.RO cs.MA 88%

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

具备通信的鲁棒且安全的多智能体强化学习:从仿真到硬件

Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

机构 * Department of ECE University of Connecticut(电子工程系,康涅狄格大学) School of Computing University of Connecticut(计算学院,康涅狄格大学) Department of ECE Boston University(电子工程系,波士顿大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文提出RSR-RSMARL框架,通过鲁棒强化学习算法和安全模块实现多智能体系统在仿真与硬件间的零 shot 转移,提升自动驾驶安全性和协调性。

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07159 2026-05-14 math.OC 88%

A linear-quadratic partially observed Stackelberg stochastic differential game with multiple followers and its application to multi-agent formation control

一个线性二次部分观测Stackelberg随机微分博弈及其在多智能体编队控制中的应用

Yichun Li, Yaozhong Hu, Jingtao Shi, Yueyang Zheng

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文研究了涉及单领导者和多个跟随者的线性二次部分观测Stackelberg随机微分博弈问题,采用新的状态分解和正交分解方法解决部分观测带来的困难,扩展了多智能体系统的确定性编队控制框架到随机情形。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12555 2026-05-14 cs.MA cs.GT 88%

DelAC: A Multi-agent Reinforcement Learning of Team-Symmetric Stochastic Games

DelAC:团队对称随机博弈的多智能体强化学习

Duan-Shin Lee, Yu-Hsiu Hung

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文研究了具有m≥2个团队的团队对称博弈,证明了团队对称博弈总是存在团队对称纳什均衡,并提出了一种基于actor-critic的多智能体强化学习算法,通过模拟展示其优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12966 2026-05-14 cs.AI 85%

Position: Agentic AI System Is a Foreseeable Pathway to AGI

位置:代理AI系统是实现AGI的可预见路径

Junwei Liao, Shuai Li, Muning Wen, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University College London(伦敦大学学院)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文挑战单一模型扩展是实现AGI的唯一路径,提出代理AI作为掌握复杂异质任务的必要范式,通过理论推导对比单一学习器与代理系统的优化约束,展示代理AI在泛化和样本效率上的指数级优势。

Comments Accepted by ICML'26 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13839 2026-05-14 cs.CL 83%

Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights

良友并非仅提供口头建议:它们可以更新你的权重

Wenrui Bao, Huan Wang, Jian Wang, Zhangyang Wang, Kai Wang, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) Westlake University(西拉丘吉大学) Snap Inc.(Snap公司) UT-Austin(得克萨斯大学奥斯汀分校) Tencent Hy(腾讯)

专题命中 多智能体 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出TFlow框架,通过低秩权重扰动实现高效多智能体LLM协作,提升准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22847 2026-05-14 cs.LG cs.AI stat.ML 79%

Decentralized Ranking Aggregation via Gossip: Convergence and Robustness

基于ossip的去中心化排名聚合:收敛性与鲁棒性

Kerrian Le Caillec, Anna Van Elst, Igor Colin, Stephan Clémençon

机构 * LTCI, Télécom-Paris, Institut Polytechnique de Paris(LTCI, Télécom-Paris, 法国巴黎理工学院)

专题命中 多智能体 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在去中心化环境下如何通过随机ossip通信实现可靠的排名共识,探讨了鲁棒性和可扩展性问题。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13035 2026-05-14 cs.MA 75%

Conveyor Parcel Routing with Order-Contiguous Arrivals

带订单连续到达的传送带包裹路由

Takuro Kato, Keisuke Okumura

专题命中 多智能体 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出DOPP算法,解决带订单连续到达的在线多智能体路径寻找问题,通过三层结构高效生成可行路径,验证了算法在不同传送带布局中的实用性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15161 2026-05-14 cs.CL cs.AI 73%

Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems

用于医疗对话系统可靠评估的自动化评分标准

Yinzhu Chen, Abdine Maiga, Hossein A. Rahmani, Emine Yilmaz

机构 * AI Center, University College London(伦敦大学学院人工智能中心)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种检索增强的多智能体框架,用于自动生成实例特定的评估评分标准,通过权威医学证据生成可验证的细粒度评估标准,并在HealthBench和LLMEval-Med数据集上取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01629 2026-05-14 cs.LG cs.RO cs.SY eess.SY 70%

AdaptNC: Adaptive Nonconformity Scores for Conformal Prediction under Distribution Shift

AdaptNC: 适应性非符合分数用于分布偏移下的符合预测

Renukanandan Tumu, Aditya Singh, Rahul Mangharam

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出AdaptNC框架,通过联合在线调整非符合分数参数和符合阈值,解决分布偏移下的预测区域保守问题,实验表明其在保持覆盖率的同时显著减少预测区域体积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13145 2026-05-14 cs.LG 70%

Collaborating in Multi-Armed Bandits with Strategic Agents

多臂老虎机中与战略代理协作

Idan Barnea, Ofir Schlisselberg, Yishay Mansour

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究多代理贝叶斯老虎机问题中的协作学习,提出CAOS机制通过信息共享维持协作并保证强后悔界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13131 2026-05-14 cs.LG cs.RO 70%

ERPPO: Entropy Regularization-based Proximal Policy Optimization

ERPPO:基于熵正则化的近端策略优化

Changha Lee, Gyusang Cho

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出ERPPO算法,通过引入熵正则化项解决多维环境中多智能体强化学习的非平稳观测问题,提升目标定位的准确性和稳定性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13063 2026-05-14 cs.LG 70%

Ergodic Trajectory Design by Learned Pushforward Maps: Provable Coverage via Conditional Flow Matching

通过学习的推前映射进行遍历轨迹设计:通过条件流匹配实现可证明的覆盖

Ehsan Aghazadeh, Masoud Malekzadeh, Ahmad Ghasemi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出了一种epushforward框架,通过条件流匹配学习映射,将潜在轨迹分布转换为目标密度,实现轨迹的可证明覆盖,同时支持多智能体和不同约束条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06138 2026-05-14 cs.LG 70%

Flow Matching for Offline Reinforcement Learning with Discrete Actions

基于流匹配的离线强化学习中离散动作的处理

Fairoz Nower Khan, Nabuat Zaman Nahim, Ruiquan Huang, Haibo Yang, Peizhong Ju

机构 * Department of Computer Science, University of Kentucky(计算机科学系,肯塔基大学) Department of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学系,罗切斯特理工学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出一种适用于离散动作空间的流匹配框架,通过连续时间马尔可夫链和因子化条件路径,扩展了离线强化学习的应用范围,并在多种任务中展示了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12507 2026-05-14 cs.SI cs.AI cs.MA 70%

Can LLM Agents Simulate Dynamic Networks? A Case Study on Email Networks with Phishing Synthesis

大语言模型代理能否模拟动态网络?基于钓鱼合成的邮件网络案例研究

Siqi Miao, Ziyang Chen, Yuhong Luo, Hans Hao-Hsun Hsu, Mufei Li, Kaiqing Zhang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学 College Park 分校) Rutgers University(罗格斯大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型多代理系统在模拟动态网络中的能力,提出两种扩展方法以提升网络仿真精度,通过钓鱼合成案例验证了其在建模信息传播和网络安全威胁中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12730 2026-05-14 cs.AI cs.GR cs.MA physics.soc-ph 57%

BEHAVE: A Hybrid AI Framework for Real-Time Modeling of Collective Human Dynamics

BEHAVE:一种混合AI框架,用于实时建模集体人类动态

Helene Malyutina

机构 * Independent Researcher, Collective Dynamics Lab(独立研究者,集体动力学实验室)

专题命中 多智能体 :agent(abstract);分类 cs.AI

AI总结 BEHAVE框架通过建模连续行为场,实时捕捉群体动态,结合神经网络实现数据驱动学习,应用于群体安全、危机团队动态等场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28113 2026-05-14 cs.CY cs.AR cs.SE 57%

I hope we don't do to trust what advertising has done to love

我希望我们不要像广告对爱情所做的那样来信任

Jade Alglave

专题命中 多智能体 :agentic(abstract);分类 cs.SE

AI总结 本文探讨了AI时代信任的定义与测量,提出'信任支柱'概念,并探讨代理系统可能带来的隐性信任向量。

详情

展开后加载摘要…

URL PDF HTML 收藏