arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 56 篇

2606.05660 2026-06-05 cs.RO cs.AI 57%

Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation

面向长时域任务的安全具身AI:机器人操作跨层分析

Dabin Kim, Daemin Park, Sangyub Lee, Jinsik Kim, Yeongtak Oh, Jongho Shin, Sungroh Yoon

机构 * UNIST InnoCORE AI-Space Solar Initiative(UNIST创新核心人工智能空间太阳能计划) Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院) Automation and Systems Research Institute(自动化与系统研究所) Department of Electrical and Computer Engineering(电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence(人工智能跨学科项目) LG Electronics(LG电子)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文从具身AI视角,系统综述长时域机器人操作中的安全问题,按干预时机(规划时、策略时、执行时)组织文献,分析证据强度,并指出当前安全保证的不足与未来方向。

Comments 63 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05445 2026-06-05 cs.AI 57%

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

Brick-Composer: 使用多模态大语言模型进行多样化积木组装

Jiateng Liu, Bingxuan Li, Zhenhailong Wang, Rushi Wang, Kaiwen Hong, Cheng Qian, Jiayu Liu, Denghui Zhang, Katherine Driggs-Campbell, Manling Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本文提出Brick-Composer框架,通过人类设计火花、世界反馈和合成经验三种信号训练多模态大语言模型,解决积木组装中的积木选择和姿态估计问题,将步骤级组装成功率从低于1%提升至约15%。

Comments 10 Pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05247 2026-06-05 cs.LG stat.ML 57%

DiffSlack: Learning under Nonlinear Inequality Constraints via Learnable Slack Variables

DiffSlack: 通过可学习松弛变量在非线性不等式约束下学习

Ziqian Wang, Chenxi Fang, Zhen Zhang

机构 * State Key Laboratory of Tribology in Advanced Equipment, Tsinghua University(先进设备摩擦学国家重点实验室,清华大学) Beijing Key Laboratory of Transformative High-end Manufacturing Equipment and Technology, Department of Mechanical Engineering, Tsinghua University(transformative高端制造设备与技术北京市重点实验室,机械工程系,清华大学) Automotive Electronics Business Unit, Hirain Inc.(Hirain公司汽车电子事业部)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出DiffSlack,一种可微投影层,通过可学习松弛变量将非线性不等式约束转化为等式,结合阻尼高斯-牛顿投影实现端到端约束满足,在车辆路径规划中取得更高成功率和几何约束满足度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22067 2026-06-05 cs.AI 57%

Semantic Partial Grounding via LLMs

通过大语言模型实现语义部分 grounding

Giuseppe Canonaco, Alberto Pozanco, Daniel Borrajo

机构 * Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出SPG-LLM,利用大语言模型分析领域和问题文件,提前识别可能不相关的对象、动作和谓词,从而减少grounding任务的规模,提升grounding效率并在某些领域实现更优的计划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21288 2026-06-05 cs.AI cs.CV 57%

Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving

Drive-KD:自动驾驶中用于视觉语言模型的多教师知识蒸馏

Weitong Lian, Zecong Tang, Haoran Li, Tianjian Gao, Yifei Wang, Zixu Wang, Lingyi Meng, Tengju Ru, Zhejun Cui, Yichen Zhu, Hangshuo Cao, Qi Kang, Tianxing Chen, Kaixuan Wang, Yu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出Drive-KD框架,通过将自动驾驶分解为感知-推理-规划三元组,并利用知识蒸馏转移能力,构建了专用教师模型,并通过异构梯度投影缓解跨能力梯度冲突,验证了方法在不同模型家族和规模上的泛化能力,展示了蒸馏模型在自动驾驶任务中的优越性能。

Comments Preprint. 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16311 2026-06-05 stat.ML cs.LG stat.ME 57%

Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions

生成器介导的老虎机:面向生成式人工智能的自适应干预的汤普森采样

Marc Brooks, Gabriel Durham, Kihyuk Hong, Ambuj Tewari

机构 * Department of Statistics, University of Michigan, Ann Arbor, MI (USA)(密歇根大学统计学系,安阿伯,MI (美国))

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种生成器介导的老虎机算法(GAMBITTS),用于解决生成式人工智能(GenAI)驱动的自适应干预问题。该算法通过建模治疗和奖励生成过程,利用观察到的治疗信息加速策略学习,并在模拟研究中优于传统算法。

Comments 39 pages, 12 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06312 2026-06-05 cs.RO 50%

Meridian: Metric-Semantic Primitive Matching for Cross-View Geo-Localization Beyond Urban Environments

Meridian: 超越城市环境的跨视角地理定位的度量-语义基元匹配

Mason Peterson, Qingyuan Li, Yixuan Jia, Fernando Cladera, Carlos Nieto-Granda, Camillo Jose Taylor, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院) GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) U.S. Army Combat Capabilities Development Command, Army Research Laboratory(美国陆军战斗能力发展指挥部,陆军研究实验室)

专题命中 规划决策 :planning(abstract)

AI总结 提出Meridian方法,通过匹配航拍图像与地面机器人RGB-D数据中的高层度量-语义基元,无需特定区域训练即可实现跨多种环境的全局定位,平均轨迹误差2.4米。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06262 2026-06-05 physics.soc-ph 50%

Assessing Power System Vulnerability to Climate-Related Stressors and Shocks: The Case of Indonesia

评估电力系统对气候相关压力和冲击的脆弱性:以印度尼西亚为例

Hariadi Aji, Nihit Goyal, Stefan Pfenninger-Lee, Igor Nikolic

专题命中 规划决策 :planning(abstract)

AI总结 通过集成空间显式方法,量化印度尼西亚发电、输电和需求端的气候脆弱性,发现气候压力和冲击可导致备用容量减少高达36个百分点,表明系统韧性显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06239 2026-06-05 eess.SP 50%

Foundation Models for Wireless Communications: From PHY Intelligence to Network Autonomy

无线通信的基础模型:从物理层智能到网络自治

Le Liang, Jiajia Guo, Jun Zhang, Chan-Byoung Chae, Lu Lu, Shugong Xu, Octavia A. Dobre, Shi Jin, Geoffrey Ye Li

专题命中 规划决策 :agentic(abstract)

AI总结 本文综述了基础模型在无线通信中的应用,从适配预训练模型、构建无线原生模型到智能体模型,推动物理层处理和资源管理向网络自治演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05960 2026-06-05 cs.RO 50%

Towards a Data Flywheel for Embodied Intelligence in Logistics

面向物流具身智能的数据飞轮

Anlan Yu, Zaishu Chen, Zhiqing Hong, Daqing Zhang

机构 * Peking University(北京大学) JD Logistics(京东物流) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract)

AI总结 提出一种数据驱动的物流具身智能框架,通过构建数据飞轮将日常操作转化为可复用数据资产,利用世界模型生成长尾包裹操作的可靠监督,并整合多模态数据实现策略持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05285 2026-06-05 astro-ph.IM astro-ph.HE hep-ph 50%

Toward decision-aware AI for LSST-scale time-domain astronomy

面向LSST规模时域天文学的决策感知AI

C. R. Bom, A. Mahabal, F. Bianco, P. Darc, B. Fraga, R. Bonito, S. Chaini, M. W. Coughlin, S. Dillmann, F. Fontinele Nunes, A. Gomboc, N. Hernitschek, X. Li, F. Z. Majidi, A. I. Malz, A. Melandri, V. Petrecca, S. Piranomonte, M. Rabus, F. Ragosta, O. Razim, M. C. Romão, N. Sarin, A. Sasli, V. A. Srećković, A. Tramuto, V. Vujčić, M. J. Vyas, Rubin LSST Transients, Variable Stars Science Collaboration

专题命中 规划决策 :agentic(abstract)

AI总结 本文提出将LSST视为部分观测的动态环境,通过基础模型学习源状态表示并采用决策理论策略优化后续观测资源分配,以最大化长期科学价值。

Comments 12 pages, 2 figures, submitted as a Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04515 2026-06-05 math-ph math.MP physics.class-ph physics.ed-ph 50%

Discussion on the Physics Problem of a Boat Crossing a River

讨论船渡河的物理问题

Kyle Kou Yuchang, Simon Meng Zimin, Paul Zhang Yixing

专题命中 规划决策 :planning(abstract)

AI总结 通过构建三种水流模型(恒定流、线性分布、偶次幂函数分布),利用矢量加法、微积分和微分方程推导了固定航向角下船舶空间轨迹的解析表达式,并采用拉格朗日乘子法求解了最短时间控制问题的最优航向角,为内河船舶智能导航系统的路径规划提供了理论支持。

Comments 19 pages for high school students attempt on the optimization problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30278 2026-06-05 stat.CO 50%

modelimportance: An R package for evaluating model importance within a multi-model ensemble

modelimportance: 一个用于评估多模型集合中模型重要性的R包

Minsu Kim, Li Shandross, Evan L. Ray, Nicholas G. Reich

专题命中 规划决策 :planning(abstract)

AI总结 本文介绍R包modelimportance,通过多种集成方法和重要性指标量化每个组成模型对点预测和概率预测集合性能的贡献,支持缺失值处理,遵循hubverse框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01817 2026-06-05 physics.soc-ph physics.data-an 50%

Compact 15-minute cities exhibit lower carbon intensity in urban transport

紧凑的15分钟城市更绿色

Francesco Marzolla, Matteo Bruno, Hygor Piaget Monteiro Melo, Vittorio Loreto

专题命中 规划决策 :planning(abstract)

AI总结 通过比较全球664个城市,发现步行可达性更好的城市(如15分钟城市)人均交通碳排放更低,但需结合城市紧凑性和高效公共交通。

Journal ref Cities, 176, 107202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 32 篇

2510.22768 2026-06-05 cs.CL 90%

Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion

见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性

Haoyi Qiu, Yilun Zhou, Pranav Narayanan Venkit, Kung-Hsiang Huang, Jiaxin Zhang, Nanyun Peng, Chien-Sheng Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

专题命中 多智能体 :agent(title,title_cn);autonomous agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06025 2026-06-05 cs.CL cs.AI 90%

EGTR-Review: Efficient Evidence-Grounded Scientific Peer Review Generation via Multi-Agent Teacher Distillation

EGTR-Review: 基于多智能体教师蒸馏的高效证据支撑科学同行评审生成

Xinpeng Qiu, Wang Yihu, Zhifeng Liu, Xiaochen Wang, Jimin Wang

机构 * Department of Information Management, Peking University(北京大学信息管理系) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出EGTR-Review框架,通过多智能体教师蒸馏和证据加权目标,实现轻量级学生模型的高质量、可溯源同行评审生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00804 2026-06-05 cs.MA cs.AI cs.CL 90%

Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems

企业多智能体系统的动态协调策略选择

Thanh Luong Tuan

机构 * Golden Gate University(金门大学) Foundation AgenticOS (FAOS)(基础代理操作系统(FAOS))

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文通过大规模实验评估企业多智能体系统是否应根据问题类别动态选择协调策略,发现动态路由作为校准默认值有效,但无法确定唯一最优策略。

Comments 13 pages, 4 appendix. Code and data: https://github.com/frank-luongt/faos-research/tree/main/RA-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06011 2026-06-05 cs.RO cs.LG cs.MA 89%

Merging model-based control with multi-agent reinforcement learning for multi-agent cooperative teaming strategies

将基于模型的控制与多智能体强化学习相结合以实现多智能体协作团队策略

Christian Llanes, Spencer W. Jensen, Samuel Coogan

机构 * Georgia Institute of Technology(佐治亚理工学院) Sandia National Laboratories(桑地亚国家实验室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.LG

AI总结 提出一种结合多智能体强化学习与模型预测控制的框架(MA-AC-MPC),通过扩展演员-评论家模型预测控制实现安全、动态可行的协作策略,并在追逃场景和异构环境中验证其优于多层感知机模型。

Comments 12 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05304 2026-06-05 cs.AI 89%

What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems

智能体应该说什么?面向高效多智能体系统的动作-状态通信

Chen Huang, Yuhao Wu, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 针对多智能体系统中自由形式通信导致令牌膨胀和性能下降的问题,提出PACT协议,将通信视为公共状态更新问题,压缩为紧凑的动作-状态记录,在多种拓扑下实现性能与成本权衡的优化。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26179 2026-06-05 cond-mat.mtrl-sci cs.AI cs.CE 89%

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

AutoDFT:用于自主DFT计算的闭环多智能体框架

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wang, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Singapore Management University(新加坡管理大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出AutoDFT闭环多智能体框架,通过将LLM推理嵌入DFT计算全生命周期,实现从规划到执行的自主适应,在VASPBench基准上达到94.1%任务成功率,并可靠预测电子、磁性和能量性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05476 2026-06-05 cs.CR cs.MA 89%

SHIELDS: Automating OS Hardening with Iterative Multi-Agent Remediation

SHIELDS: 通过迭代多智能体修复实现操作系统加固自动化

Andrew Hamara, Dwight Horne, Aldehir Rojas, Timothy Kurniawan, Sophie Lamothe, Vishal Suresh, Nicholas Turoci, Lawrence Wong

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);tool use(abstract)

AI总结 提出SHIELDS多智能体系统,利用大语言模型通过迭代反馈驱动的方式自动修复操作系统安全配置错误,在多种虚拟机配置下成功修复高达73%的扫描发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05704 2026-06-05 cs.AI cs.LG 88%

Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

基于评论的异构多智能体推理用于可靠的数学问题求解

Muhammad Talha Sharif, Abdul Rehman

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于评论的异构多智能体框架,通过生成器-验证器结构和自适应学习系统,利用中间反馈评估和引导推理过程,在GSM8K基准上实现高达13%的准确率提升,并减少对大模型的依赖。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21700 2026-06-05 cs.CL cs.AI cs.IR cs.MA cs.SI 88%

Toward Culturally Aligned LLMs through Ontology-Guided Multi-Agent Reasoning

通过本体引导的多智能体推理实现文化对齐的大型语言模型

Wonduk Seo, Wonseok Choi, Junseo Koh, Juhyeon Lee, Hyunjin An, Minhyeong Yu, Jian Park, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * KAIST(韩国科学技术院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。

Comments Accepted by ICML 2026 Regular Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16965 2026-06-05 cs.LG 88%

Multi-Agent Lipschitz Bandits

多智能体Lipschitz老虎机

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校) INRIA Paris(巴黎国家信息与自动化研究所)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文研究了在连续Lipschitz结构动作空间上的去中心化多玩家随机老虎机问题,其中硬碰撞导致零奖励。研究提出了一种无需通信的策略,旨在最大化集体奖励,同时分离协调成本和学习成本。通过新颖的maxima-directed搜索识别并安排玩家到高价值区域,将问题分解为N个独立的单玩家Lipschitz老虎机。在共识模式下,得到端到端的 regrets bound,其主导学习项为~O(T^{(d+1)/(d+2)}),与单玩家Lipschitz速率匹配;前期协调成本在固定置信度下与时间无关,仅在期望 regrets 形式中为多项式对数。在额外的公共覆盖/调度假设下,还获得了无间隙~O(T^{(d+1)/(d+2)})保证。进一步推导了主导学习项的匹配下界,并将框架扩展到一般距离阈值碰撞模型。

Comments Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13255 2026-06-05 cs.AI cs.MA 88%

DPBench: Structural Determinants of Multi-Agent LLM Coordination Under Simultaneous Resource Contention

DPBench: 多智能体LLM在同时资源竞争下的协调结构决定因素

Najmul Hasan, Prashanth BusiReddyGari

机构 * Department of Mathematics and Computer Science University of North Carolina at Pembroke(数学与计算机科学系北卡罗来纳大学帕特森分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出DPBench,用于评估多智能体系统中协调性能的基准测试,通过分析不同协议、通信结构和群体规模对协调成功或失败的影响,揭示了多智能体LLM在资源竞争中的协调机制。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05013 2026-06-05 cs.AI cs.MA stat.ME 88%

Detecting Perspective Shifts in Multi-agent Systems

在多智能体系统中检测视角变化

Eric Bridgeford, Hayden Helm

机构 * Helivan, San Francisco, CA(San Francisco, CA 的 Helivan)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种名为TDKPS的框架,用于检测多智能体系统中智能体和群体层面的行为变化,通过模拟和自然实验验证了其在检测真实外部事件变化方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05795 2026-06-05 eess.SY cs.SY 88%

Efficient Multi-Agent Optimization of Optical Power in S+C+L-Band Systems

S+C+L波段系统中光功率的高效多智能体优化

Junzhe Xiao, Kaida Chen, Cong Wang, Zekun Niu, Minghui Shi, Yanhan Zhou, Lilin Yi

专题命中 多智能体 :agent(title,abstract);multi-agent(title);AI agent(abstract)

AI总结 提出一种面向多波段系统链路功率管理的AI智能体,通过多智能体优化高效实现多种优化目标,并在网络级评估中以每功率配置文件平均303次交互获得689.0 Tbps的总分配流量增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06301 2026-06-05 cs.SE 87%

More than a Judge: An Empirical Study of Agent-Human Interaction in Crowdsourced Testing Assessment

不仅仅是评判者:众包测试评估中智能体与人类交互的实证研究

Yue Wang, Yuan Zhao, Shengcheng Yu, Zhenyu Chen, Qing Gu

专题命中 多智能体 :agent(title,abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 通过受控实验研究基于LLM的多智能体评估系统生成的反馈能否提升众包测试者修改报告、后续任务表现及跨应用迁移能力。

Comments Accepted manuscript to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05670 2026-06-05 cs.AI 87%

Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

更多智能体有帮助吗?LLM智能体工作流的受控与协议对齐评估

Yuhang Fu, Ruishan Fang, Jiaqi Shao, Huiyu Zheng, Zhengtao Zhu, Bing Luo, Tao Lin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Duke Kunshan University(杜克大学昆山分校) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 多智能体 :agent(title,abstract);tool-use(abstract);workflow(abstract);multi-agent(abstract)

AI总结 提出BenchAgent框架,在统一协议下比较单智能体、固定多智能体和演化多智能体工作流,发现大多数多智能体系统在准确率上未超越单智能体基线,但运行时生成的工作流在GAIA上表现优异。

Comments https://github.com/LINs-lab/MASArena/tree/BenchAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06136 2026-06-05 cs.SC cs.AI 86%

A Finite Certificate for the Positive $n=9$ Vasc Inequality

正数 $n=9$ 的 Vasc 不等式的一个有限证书

Dakai Guo, Ruichen Qiu, Yichuan Cao, Ruyong Feng

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, and the School of Mathematics, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院,以及中国科学院大学数学系)

专题命中 多智能体 :agent(summary_cn,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI

AI总结 通过人工引导的 AI 代理 MechMath Agent Team,将有理不等式转化为齐次多项式不等式,并利用累积间隙参数化所有排序的固定最大值锥体,生成覆盖 40320 个锥体的有限证书,从而证明了正实数 $n=9$ 情况下的 Vasc 循环不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏