arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 234 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 69 篇

2602.17003 2026-05-28 cs.CL cs.AI 62%

Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History

Persona2Web: 基于用户历史进行上下文推理的个性化Web智能体基准

Serin Kim, Sangam Lee, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(人工智能系,延世大学,首尔,大韩民国)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Persona2Web基准,通过澄清-个性化原则评估Web智能体在真实开放网络中利用用户历史解决模糊查询的个性化能力,并引入推理感知评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28730 2026-05-28 cs.AI 57%

AlphaTransit: Learning to Design City-scale Transit Routes

AlphaTransit: 学习设计城市级公交线路

Bibek Poudel, Sai Swaminathan, Weizi Li

机构 * Department of EECS, University of Tennessee, Knoxville, TN, USA(田纳西大学电子工程与计算机科学系) Department of CSE, University of California, Riverside, CA, USA(加州大学河滨分校计算机科学与工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对公交线路设计中的延迟反馈问题,提出AlphaTransit框架,将蒙特卡洛树搜索与神经策略-价值网络结合,在布卢明顿基准上实现最高服务率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28372 2026-05-28 cs.LG cs.RO 57%

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

教师-学生表征对齐用于强化学习驱动的模仿学习

Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas Stork

机构 * Department of Computer Science(计算机科学系) Örebro University(奥雷布罗大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出一种通过自监督对比学习构建共享嵌入空间的方法,以减小教师和学生策略之间的不可模仿差距,从而提升学生策略性能。

Comments 6 pages, 5 figures. Accepted as an oral presentation at the RL4IL Workshop at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26277 2026-05-28 cs.CV cs.AI 57%

VesselSim: learning 3D blood vessel segmentation without expert annotations

VesselSim: 无需专家标注的3D血管分割学习

Erin Rainville, Melissa Ananian, Tristan Mirolla, Hassan Rivaz, Yiming Xiao

机构 * Department of Computer Science and Software Engineering, Concordia University, Montreal, Canada(计算机科学与软件工程系,康科迪亚大学,蒙特利尔,加拿大) Department of Electrical and Computer Engineering, Concordia University, Montreal, Canada(电气与计算机工程系,康科迪亚大学,蒙特利尔,加拿大)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出VesselSim两阶段框架,通过几何驱动的合成血管生成和自监督测试时适应,实现无需真实标注的3D血管分割,在多个临床数据集上达到与有监督方法竞争的性能。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI 57%

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28069 2026-05-28 cs.AI 57%

ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

ZipRL: 自适应多轮上下文压缩与事后响应回放

Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo, Wei Lin, Guojun Yin

机构 * Meituan(美团) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出ZipRL框架,通过多粒度压缩机制和事后响应回放技术,在可验证奖励强化学习中实现自适应上下文压缩,平衡信息保留与token效率,在多个智能体任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28065 2026-05-28 cs.AI 57%

Verifiable Benchmarking of Long-Horizon Spatial Biology

长程空间生物学的可验证基准测试

Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 提出 SpatialBench-Long 基准,通过 24 个评估任务测试 AI 代理从原始空间数据中推导科学结论的能力,发现当前最佳模型仅达到 11.1% 的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28063 2026-05-28 cs.SD cs.AI cs.MM 57%

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

自由文本提示的统一语音与声音合成

Yuyue Wang, Xihua Wang, Xin Cheng, Yijing Chen, Ruihua Song

机构 * Renmin University of China(中国人民大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出PlanAudio框架,利用大语言模型推理能力和语义潜在思维链机制,直接从自由文本生成包含语音和声音的统一音频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27969 2026-05-28 cs.CL 57%

Boundary Suppression Asymmetry in Post-trained Assistants: Over-expansion as a Controllability Cost

后训练助手中的边界抑制不对称性:过度扩展作为可控性代价

Jiarui Han

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究后训练语言模型助手中因避免回答不足而导致的边界抑制不对称性,发现反回答不足策略在边界控制评估中更难被抑制,且这种代价与内容预算超支和延续持续性相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27899 2026-05-28 cs.AI 57%

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

SKILLC: 通过对比信用分配学习LLM智能体的自主技能内化

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出SkillC框架,基于对比技能信用分配(CSCA)将技能帮助性对比转化为直接学习信号,实现LLM智能体的自主技能内化,在ALFWorld和WebShop上分别超越最强基线5.5%和4.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27896 2026-05-28 cs.CL cs.CE 57%

FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations

FinBoardBench: 通过棋盘游戏模拟基准测试大语言模型的动态财富管理和战略金融推理

Xuesi Hu, Peng Wang, Jinpeng Miao, Xilin Tao, Caiwei Li, Yue Ma, Jie He, Qiancheng Zhang, Yuntao Zou, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China(1 计算机科学与工程学院,澳门科技大学,澳门,中国) School of Economics, Anhui University, Anhui, China(2 经济学院,安徽大学,安徽,中国) SKLPlanets, Macau University of Science and Technology, Macau, China(3 SKLPlanets,澳门科技大学,澳门,中国) Department of Computer and Information Science, University of Macau, Macau, China(4 计算机与信息科学系,澳门大学,澳门,中国) School of Energy and Power Engineering, Huazhong University of Science and Technology, Hubei, China(5 能源与动力工程学院,华中科技大学,湖北,中国)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出基于三款经典金融棋盘游戏的评估套件FinBoardBench,测试大语言模型在动态财富管理、企业投资收购和竞争谈判等综合金融技能,发现模型虽具备基本规划能力但无法将静态推理转化为成功动态决策。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27429 2026-05-28 cs.IR cs.AI 57%

Ocean4Rec: Offline LLM-Derived OCEAN Profiles for Request-Time VOD Reranking

Ocean4Rec:离线LLM生成的OCEAN画像用于请求时VOD重排序

Wonkyun Kim, Sehyun Bae, Kwanki Ahn, Mungyu Bae, Saeun Choi, Soyeon You, Chandra Prabhakar, Sehyun Kim

机构 * Samsung Electronics Republic of Korea(韩国三星电子公司) Samsung Electronics India(印度三星电子公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出Ocean4Rec重排序层,利用LLM离线生成物品OCEAN画像,在请求时无需LLM调用,通过数值计算提升VOD推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12955 2026-05-28 cs.AI 57%

Text2Model: Modeling Copilots for Text-to-Model Translation

Text2Model: 用于文本到模型翻译的建模副驾驶

Serdar Kadioglu, Karthik Uppuluri, Akash Singirikonda

机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文提出Text2Model和Text2Zinc,通过统一架构和数据集、求解器无关的方式,利用多种LLM策略实现文本到组合优化与满足问题的模型翻译,并开源副驾驶和排行榜以缩小性能差距。

Comments AAAI'25 Bridge Program on Machine Learning and Operations Research CPAIOR'26 Master Class on LLMs for CP/OR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20780 2026-05-28 cs.CL cs.CY 57%

Large Language Models Approach Expert Pedagogical Quality in Math Tutoring but Differ in Instructional and Linguistic Profiles

大型语言模型在数学辅导中接近专家教学质量,但在教学和语言特征上存在差异

Ramatu Oiza Abdulsalam, Segun Aroyehun

机构 * African University of science and Technology(非洲科学与技术大学) University of Konstanz(康斯坦茨大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 通过分析数学辅导对话数据集,比较专家、新手教师和七种大型语言模型的教学质量,发现大型语言模型平均接近专家水平,但在教学策略和语言特征上存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14864 2026-05-28 cs.CL 57%

Shopping Companion: Benchmarking and Training LLM Agents for Long-Horizon Preference-Grounded E-Commerce Tasks

购物助手:面向长期偏好引导的电子商务任务的LLM智能体基准测试与训练

Zijian Yu, Kejun Xiao, Huaipeng Zhao, Tao Luo, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 针对电子商务中缺乏长期偏好感知购物任务基准和细粒度训练监督的问题,提出了Shopping Companion Bench基准和免标注工具级奖励方法,有效提升了LLM智能体的偏好捕获与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15541 2026-05-28 cs.LG cs.CV eess.IV 57%

An Empirical Study on Variance-based MC Dropout Uncertainty-Error Correlation in 2D Brain Tumor Segmentation

基于方差的MC Dropout不确定性-误差相关性在二维脑肿瘤分割中的实证研究

Saumya B

机构 * Project Associate DESE, Indian Institute of Science(DESE项目助理,印度科学研究院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 通过U-Net在四种增强设置下的实验,发现基于方差的MC Dropout不确定性在全局和边界上与分割误差的相关性较弱,表明其局限性。

Comments v2: Updated title and framing to clarify that findings are specific to variance-based uncertainty estimation via MC Dropout, not MC Dropout broadly. Minor textual improvements throughout. Code and results available at https://github.com/Saumya4321/mcd-error-correlation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28202 2026-05-28 cs.RO 50%

Natural Functional Gradients for Smooth Trajectory Optimization

平滑轨迹优化的自然函数梯度

Kisang Park, Chanwoo Kim, Kyungjae Lee, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea(韩国大学人工智能系,首尔,大韩民国) Department of Statistics, Korea University, Seoul, Republic of Korea(韩国大学统计系,首尔,大韩民国)

专题命中 规划决策 :planning(abstract)

AI总结 提出一种基于自然函数梯度的轨迹优化框架,通过函数空间中的几何感知更新和蒙特卡洛估计,在无解析梯度时生成更平滑、更可行的运动轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28154 2026-05-28 cs.HC cs.RO 50%

Robo-Blocks: Generative Scaffolding in End-User Design and Programming of Social Robots

Robo-Blocks:社交机器人终端用户设计与编程中的生成式支架

Arissa J. Sato, Callie Y. Kim, Nathan Thomas White, Abhinav Maneesh, Yuqing Wang, Hui-Ru Ho, Bilge Mutlu

机构 * Department of Computer Sciences\ of Wisconsin--Madison

专题命中 规划决策 :planning(abstract)

AI总结 通过研究通过设计(RtD)过程,提出基于LLM的积木式编程环境Robo-Blocks,利用生成式支架将高级想法转化为可执行机器人行为,支持新手程序员,并揭示了用户角色与使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27948 2026-05-28 cs.RO 50%

VLM-Based Advanced Rider Assistance System for Motorcycle Safety

基于VLM的摩托车安全高级骑手辅助系统

Mohamed Elnoor, Francesca Baldini, Ananya Trivedi, Faizan M. Tariq, Jovin D'sa, David Isele, Sangjae Bae, Dinesh Manocha, Yosuke Sakamoto

机构 * HRI Honda Research Institute(本田研究院) University of Maryland(马里兰大学) Northeastern University(东北大学)

专题命中 规划决策 :planning(abstract)

AI总结 提出一种利用视觉语言模型进行语义感知和风险感知规划的摩托车高级骑手辅助系统,通过构建密集风险地图并采用基于采样的规划器,在CARLA模拟器中实现更高的成功率和更低的风险暴露。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27895 2026-05-28 physics.comp-ph 50%

Application of Reinforcement Learning for Multigroup Energy Grid Optimization for Neutron Transport Criticality Problems

强化学习在多群中子输运临界问题能量网格优化中的应用

Ben Whewell, Nathan Gibson, Ajeeta Khatiwada

专题命中 规划决策 :agent(abstract)

AI总结 提出使用强化学习结合代理模型优化一维球k临界问题的能群结构,通过修改PPO算法奖励准确且少群的结构,并利用神经网络代理模型加速训练,在Godiva和BeRP球问题中优于常用群结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27699 2026-05-28 cs.RO 50%

AURA: Asymptotically Optimal Uncertainty-Robust Replanning Algorithm for Kinodynamic Systems

AURA: 动力学系统渐近最优的鲁棒重规划算法

Seyedali Golestaneh, Zhuoyun Zhong, Donghyung Lee, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯通理工大学)

专题命中 规划决策 :planning(abstract)

AI总结 提出AURA元规划框架,通过在线重规划和优化控制输入,在运动不确定性下实现渐近最优轨迹规划与跟踪精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11564 2026-05-28 cs.CV 50%

LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts

LUVE:基于双频专家的潜在级联超高分辨率视频生成

Chen Zhao, Jiawei Chen, Hongyu Li, Zhuoliang Kang, Shilin Lu, Xiaoming Wei, Kai Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :planning(abstract)

AI总结 提出LUVE框架,通过三阶段潜在级联架构(低分辨率运动生成、潜在空间上采样、高分辨率内容精炼)结合双频专家,解决超高分辨率视频生成中的运动建模、语义规划和细节合成难题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00501 2026-05-28 cs.CV 50%

CPPO: Contrastive Perception Policy Optimization for VLM Agents

CPPO: 面向VLM智能体的对比感知策略优化

Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad Asiful Hossain, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) Huawei Cloud(华为云)

专题命中 规划决策 :agentic(abstract)

AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02788 2026-05-28 physics.comp-ph physics.ins-det physics.med-ph 50%

Reconstruction of proton relative stopping power with a granular calorimeter detector model

基于颗粒量热计探测器模型的质子相对阻止本领重建

M. Aehle, J. Alme, G. G. Barnaföldi, G. Bíró, T. Bodova, V. Borshchov, A. van den Brink, M. Chaar, B. Dudás, V. Eikeland, G. Feofilov, C. Garth, N. R. Gauger, O. Grøttvik, H. Helstrup, S. Igolkin, Zs. Jólesz, R. Keidel, C. Kobdaj, T. Kortus, L. Kusch, V. Leonhardt, S. Mehendale, R. Ningappa, O. H. Odland, G. O'Neill, G. Papp, T. Peitzmann, H. E. S. Pettersen, P. Piersimoni, M. Protsenko, M. Rauch, A. Ur Rehman, M. Richter, D. Röhrich, J. Santana, A. Schilling, J. Seco, A. Songmoolnak, J. Rambo Sølie, G. Tambave, I. Tymchuk, K. Ullaland, M. Varga-Kőfaragó, L. Volz, B. Wagner, S. Wendzel, A. Wiebel, R. Xiao, S. Yang, H. Yokoyama, S. Zillien

专题命中 规划决策 :planning(abstract)

AI总结 本文提出一种神经网络辅助的径迹重建方法,结合颗粒量热计探测器模型,用于提高质子计算机断层扫描中质子相对阻止本领的重建精度,以优化强子治疗剂量规划。

Comments 14 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 54 篇

2605.27766 2026-05-28 cs.AI 92%

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Aman Priyanshu, Supriti Vijay, Esha Pahwa

机构 * Foundation AI USA(Foundation AI美国)

专题命中 多智能体 :agent(title,title_cn);multi-agent(title,title_cn);AI agent(abstract);agentic(abstract)

AI总结 本研究通过多智能体模拟平台评估LLM智能体在社交压力下的隐私泄露风险,发现多轮社交交互显著增加隐私泄露,且泄露具有社交传染性,即使有隐私指令也无法完全消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28816 2026-05-28 cs.CV 91%

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 多智能体 :agent(title,summary_cn);multi-agent(title,abstract)

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28321 2026-05-28 cs.SE cs.AI 91%

Multi-Agent LLM-based Metamorphic Testing for REST APIs

基于多智能体LLM的REST API蜕变测试

Shehroz Khan, Abdullah Mughees, Gaadha Sudheerbabu, Tanwir Ahmad, Dragos Truscan

机构 * Åbo Akademi University(阿博阿卡迪米大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 提出ARMeta方法,利用基于LLM的多智能体工作流自动识别蜕变测试场景并生成可执行测试,以解决REST API测试中的预言问题。

Comments Author submitted version accepted for publication the IEEE Conference on Computers, Software, and Applications (COMPSAC2026), July 7-11, 2026, Madrid Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-05-28 cs.AI cs.LG cs.MA 91%

EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 26 pages, 10 figures, to be published at IDETC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10185 2026-05-28 cs.CL cs.AI cs.MA 91%

Auditing medical multi-agent AI reveals risks of false consensus

审计医疗多智能体AI揭示虚假共识风险

Yinghao Zhu, Lei Gu, Zixiang Wang, Haoran Sang, Dehao Sui, Wen Tang, Lan Mi, Yasha Wang, Junyi Gao, Liang Yao, Tianfan Fu, Ewen Harrison, Lequan Yu, Liantao Ma

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院) Department of Nephrology, Peking University Third Hospital(北京大学第三医院肾内科) Key Laboratory of Carcinogenesis and Translational Research (Ministry of Education), Department of Lymphoma, Peking University Cancer Hospital & Institute(教育部癌症发生与转化研究重点实验室、北京大学肿瘤医院淋巴瘤科) Department of Automation, Tsinghua University(清华大学自动化系) Centre for Medical Informatics, The University of Edinburgh(爱丁堡大学医学信息学中心) Health Data Research UK(英国健康数据研究机构) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科贤医学院) State Key Laboratory for Novel Software Technology, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室、计算机科学学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 本研究提出MedAgentAudit框架,通过专家验证的审计流程诊断医疗多智能体系统中的协作失败模式,发现虚假共识、权威偏差等系统性风险。

Comments Code and Data: https://github.com/MedX-PKU/MedAgentAudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06511 2026-05-28 cs.LG 90%

EvoMAS: Evolutionary Generation of Multi-Agent Systems

EvoMAS:多智能体系统的进化生成

Yuntong Hu, Yuting Zhang, Matthew Trager, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);tool-use(abstract);planning(abstract)

AI总结 提出EvoMAS方法,将多智能体系统生成转化为结构化配置生成,通过进化算法在配置空间中优化,提升任务性能、可执行性和鲁棒性。

Comments ICML2026

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏