arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6764 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 1124 篇

2608.07532 2026-08-11 cs.AI cs.LG econ.TH 新提交 86%

Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems

基于技能的智能体人工智能系统中的动态联盟形成与通信定价

Mojtaba Eslami

机构 * University of Calgary(卡尔加里大学)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 针对技能型智能体 AI 系统通信低效问题,提出基于夏普利值的边际值激活与贪心路由方法,在合成实验中其效用达蛮力最优的 99.5%,激活智能体数远少于全广播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01001 2026-08-04 cs.AI cs.CR cs.SE 新提交 86%

From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and Manifestations in Agentic AI Systems

从AI技术债务到智能体技术债务:智能体AI系统中根本原因与表现形式的系统映射

Muhammad Tukur, Hayatullahi B. Adeyemo, Tao Chen, Nour Ali, Anis Zarrad, Marco Agus, Rick Kazman, Rami Bahsoon

机构 * University of Birmingham(伯明翰大学) Bournemouth University(伯恩茅斯大学) Brunel University London(伦敦布鲁内尔大学) HBKU(哈迈德·本·哈利法大学) University of Hawaii(夏威夷大学)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对智能体AI系统引入智能体技术债务(AgTD)概念,通过转换方法建立AITD到智能体表现的系统映射,明确其影响并提出管理框架与研究议程。

Comments 32 pages, 7 figures, 7 tables, submitted to IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 86%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07858 2026-07-10 cs.AI cs.LG 新提交 86%

Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting

直通式承保中的智能体人工智能与检索增强模型

Robert Richardson, Josh Meyers, Brian Hartman, David Sandberg

机构 * Brigham Young University

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能在精算实践中的应用,开发用于小型商业企业主保单直通式承保的智能体人工智能框架,通过构建实验环境比较三条承保管道,发现智能体系统总体表现最佳,在特定场景中优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26859 2026-06-29 cs.AI cs.CL cs.IR 新提交 86%

AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems

AgentX:迈向智能体驱动的工业推荐系统自迭代

Changxin Lao, Fei Pan, Guozhuang Ma, Han Li, Huihuang Lin, Jijun Shi, Kangzhi Zhao, Kun Gai, Mo Zhou, Qinqin Zhou, Quan Chen, Ruochen Yang, Shifu Bie, Shijie Yi, Shuang Yang, Shuo Yang, Wenhao Li, Wentao Xie, Xiao Lv, Xuming Wang, Yijun Wang, Yiming Chen, Yusheng Huang, Zhongyuan Wang, Zibo Zhao, Zijie Zhuang, Baoning Xia, Chao Liu, Chaoyi Ma, Chubo He, Dawei Cong, Feng Jiang, Gang Wang, Guilin Xia, Hanwen Xu, Jiahong Xie, Jiahui Qiao, Jian Liang, Jiangfan Yue, Jing Wang, Jinghan Yang, Jinghui Jia, Kan Qin, Lei Wang, Ming Li, Peilin Song, Pengbo Xu, Qiang Luo, Ruiming Tang, Shiyang Liu, Shuxian Jin, Tao Wang, Tao Zhang, Xiang Gao, Xianghan Li, Yingsong Luo, Yiwen Ning, Yongcheng Liu, Yueyang Liu, Yuan Guo, Zhaojie Liu, Zhenkai Cui

专题命中 多智能体 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AgentX多智能体系统,通过闭环迭代自动生成、实施、评估推荐实验,实现工业推荐系统的自进化,突破人工瓶颈。

Comments Authors are listed alphabetically by their first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24783 2026-06-24 cs.CL cs.AI 新提交 86%

Paying to Know: Micro-Transaction Markets for Verified Product Information in Agentic E-Commerce

付费知情:代理型电商中已验证产品信息的微交易市场

Filippos Ventirozos, Matthew Shardlow

机构 * Manchester Metropolitan University(曼彻斯特城市大学)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出代理型电商作为已验证信息的微交易市场,买家代理通过微支付逐步获取卖家与评论者提供的数据,以解决信息可信度瓶颈,并转化为具体NLP问题。

Comments 8 pages, 1 figure. Vision paper, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交 86%

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 多智能体 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26356 2026-06-26 cs.AI cs.IR cs.MA 新提交 86%

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

指令泄露:提示组合智能体系统中的跨模块干扰

Ching-Yu Lin, Yifan Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) FAGEN

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究提示组合智能体系统中模块间干扰问题,形式化定义为组合行为泄露(CBL),通过三通道协议实验验证内容通道产生可检测效应,贡献了操作定义、可复用协议和系统类特征。

Comments 8 pages, 2 tables. Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13889 2026-08-17 cs.CV 新提交 86%

Consensus-gated Multi-Agent Neural Architecture Search for Seismic Fault Segmentation

面向地震断层分割的共识门控多智能体神经架构搜索

Shehram Baig, Ahmad Mustafa

机构 * Information Technology University (ITU)(信息技术大学(ITU)) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿业大学)

专题命中 多智能体 :agent(title);multi-agent(title);agentic(abstract)

AI总结 提出共识门控多智能体NAS系统,利用三个LLM达成共识搜索架构,发现参数42.5万的\textit{ours}模型,在Thebe断层数据集上性能优于多个基准模型,成本低、效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14239 2026-08-17 eess.SY cs.RO cs.SY math.OC 新提交 86%

A Temporal Barrier Framework for Collision Avoidance in Multi-Agent Autonomous Aerial Vehicles

用于多智能体自主飞行器避障的时间屏障框架

Benedikt Barthel Sorensen, Mitchell Black, Erfaun Noorani, Themistoklis Sapsis

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 该研究针对多自主飞行器避障问题,提出对抗性碰撞时间嵌入控制屏障函数的aTTC-CBF方法,经仿真验证其在提升航路点推进速度的同时降低了碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19212 2026-07-22 quant-ph cs.SD 新提交 86%

Teleportation Game: Quantum Teleportation in Multi-Agent Systems for Interactive Music

隐形传态游戏:用于交互式音乐的多智能体系统中的量子隐形传态

Eduardo Reck Miranda, Scott Yeiichi Oshiro

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 研究用于交互式音乐的多智能体量子系统,通过单量子比特概率幅度调制和量子相位估计编码智能体行为,利用量子隐形传态通信,将噪声和退相干视为创意条件,开发评估方法,证明隐形传态是有前途的交互机制并指明未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交 86%

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

专题命中 多智能体 :agent(title);multi-agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25599 2026-06-25 eess.SY cs.SY 新提交 86%

Reference-Free Heterogeneous Multi-Agent Reinforcement Learning for Grid-Friendly Tie-Line Power Shaping in Industrial Microgrids

无参考异构多智能体强化学习实现工业微电网并网友好型联络线功率整形

Daniyaer Paizulamua, Lin Cheng, Fashun Shi, Haoyu Zheng, Pengfei He, Haiwang Zhong

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 提出顺序异构智能体协调框架,通过多时间尺度异构资源协同,实现无参考轨迹的联络线功率整形,显著降低购电成本、合同越限时间和爬坡越限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24462 2026-06-24 cs.RO 新提交 86%

Varying Bundle Size Reactive Multi-Task Assignment using Selective Cost Estimation for Multi-Agent Systems

基于选择性成本估计的多智能体系统变束大小反应式多任务分配

Niklas Dahlquist, Shridhar Velhal, George Nikolakopoulos

机构 * Luleå University of Technology(吕勒奥理工大学)

专题命中 多智能体 :agent(title);multi-agent(title);planning(abstract)

AI总结 提出一种分布式两阶段多保真束生成框架,通过低保真启发式搜索束空间,仅对最有希望候选进行高保真路径规划,实现反应式多机器人任务分配,提高拍卖方法性能。

Comments Accepted for publication at the 23rd World Congress of the International Federation of Automatic Control (IFAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13878 2026-06-15 cs.RO 新提交 86%

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

AnyGoal: 视觉-语言引导的多智能体探索实现免训练终身导航

MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 提出AnyGoal,一种免训练多机器人架构,利用视觉-语言模型(VLM)驱动前沿探索,通过共享2D高斯贝叶斯价值图(BVM)协调智能体,实现终身证据积累,在GOAT-Bench上达到52.4%子任务成功率,优于模块化方法27.7个百分点。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08283 2026-06-09 q-fin.PM q-fin.TR 新提交 86%

Macro Economists in the Machine: A Multi-Agent LLM Framework for Commodity-Related ETF Portfolio Construction

机器中的宏观经济学家:用于商品相关ETF投资组合构建的多智能体LLM框架

Yiqing Wang, Dehao Dai, Ding Ma, Kerui Geng

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 研究固定信息集和规则下,LLM在商品投资组合构建中能否增加价值。三种LLM策略(鹰派、鸽派、辩论)在夏普比率上优于规则代理,鹰派和辩论代理增益显著,但辩论代理未超越最佳单一代理,其贡献在于偏差校正。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18575 2026-08-20 cs.CL 新提交 85%

Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution

超越基于大语言模型的推理:用于智能体故障归因的轻量级图神经网络

Ting-Wei Li, Yuanchen Bei, Xiao Lin, Hanghang Tong

机构 * University of Illinois(伊利诺伊大学)

专题命中 多智能体 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本研究针对多智能体系统故障归因任务,提出轻量级图框架AFANet,其参数少、推理成本低,在域内基准上性能匹配或优于LLM基线,分布外基准可经低成本自适应提升,证明轻量级结构化方法可实现优异故障归因效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16578 2026-08-18 cs.AI cs.MA cs.SI 新提交 85%

Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

智能体物理学:统计力学预测AI智能体的集体行为

Batu El, Jinhee Paeng, Fatih Dinc, Shiye Su, Mete Erdogan, Aneesh Pappu, Haotian Ye, Wanjia Zhao, Surya Ganguli, James Zou

专题命中 多智能体 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究以10000余个语言模型智能体社区为对象,用统计力学模型将其集体动态分为三种状态,预测个体轨迹优于基线,揭示了AI智能体集体行为遵循可预测动力学规律。

Comments 51 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14560 2026-08-18 cs.DC cs.SE 新提交 85%

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA

智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核

Mao Luo, Hongbin Li, Feng Lin, Hanling Yi, Zhe Huang

专题命中 多智能体 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。

Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05026 2026-08-06 cs.HC cs.AI 新提交 85%

ArtAnno: Annotating Implicit Semantics in Artworks through LLM Agent-Driven Bidirectional Human-AI Augmentation

ArtAnno:通过大语言模型智能体驱动的双向人机增强对艺术品的隐式语义进行标注

Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen

专题命中 多智能体 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究针对艺术品隐式语义标注效率低的问题,提出双向人机增强框架并实现ArtAnno系统,经评估可提升标注效率、实现知识积累并减少标注员的信息处理工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03134 2026-08-05 cs.CR cs.SE 新提交 85%

CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection

CLEAR:基于因果上下文的智能体推理漏洞检测

Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02878 2026-08-05 cs.AI 新提交 85%

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

VeriTrace:类人时间探索完成智能体动作空间

Yu-Tung Liu, Cunxi Yu

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VeriTrace是一种多智能体系统,通过赋予Inspector智能体完整调试动作空间实现类人时间探索,在VerilogEval-V2基准测试上首次达到100% Pass@1,准确率较最强复现基线提升5.1%。

Comments ICLAD 2026, Long Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00104 2026-08-04 cs.CR cs.AI cs.NI 新提交 85%

Skillsets on the Chain: A Blockchain-based Zero-Trust Framework for Agentic AI Networking

链上技能集:一种基于区块链的智能体AI网络零信任框架

Yayu Gao, Yong Xiao, Hao Hu, Xubo Li, Zhiwei Liu, Yingyu Li, Guangming Shi, Ping Zhang

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对智能体AI网络的声明与能力不一致及安全漏洞问题,提出双层区块链零信任框架TrustAgentNet,通过技能集链与协作链保障安全,实验验证其开销低、准确率高且能自主恢复。

Comments Accepted at IEEE Transactions on Cognitive Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27709 2026-07-31 cs.AI 新提交 85%

MECA: A Mechanism-Centered Agent for Constructing Well-Specified and Valuable Mathematical Conjectures

MECA:一种以机制为中心的智能体,用于构建定义明确且有价值的数学猜想

Wentao Long, Yunfei Zhang, Chenyi Li, Zaiwen Wen

专题命中 多智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 MECA是一种以机制为中心的多智能体框架,可联合构建候选数学命题及其支撑机制,能生成定义明确且有研究价值的猜想,相关猜想对现有自动证明器仍具挑战性。

Comments 78 pages, 5 figures. Includes appendices and the full collection of 100 generated conjectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25566 2026-07-29 cs.MA cs.CE cs.SE 新提交 85%

ARCHER: Agentic Rule and Compliance Harness for Executable Regulations

ARCHER:用于可执行法规的智能规则与合规框架

Chiraag Singh Anand, Xue Wen Tan, Lionel Teo, Eric Tan

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 研究针对建筑合规验证难题,提出ARCHER这一测试驱动、确定性编排的多智能体程序合成框架,能从法规代码生成验证代码,经评估其在多骨干模型上准确率高,成本-准确率分析显示可降低成本实现数据主权合规检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 85%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09179 2026-07-13 cs.CR cs.SE 新提交 85%

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Malaika:通过三重基础的智能推理理解恶意软件

Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31498 2026-07-01 cs.MA cs.SE 新提交 85%

Governance Gaps in Agent Interoperability Protocols: What MCP, A2A, and ACP Cannot Express

代理互操作性协议中的治理差距:MCP、A2A 和 ACP 无法表达的内容

Richard Kang, Yudho Diponegoro

专题命中 多智能体 :agent(title,abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文系统分析了 MCP、A2A、ACP 等代理互操作性协议在治理方面的差距,发现投票和异议保留普遍缺失,需要新的架构层来支持受治理的代理社区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24839 2026-06-24 cs.AI stat.AP 新提交 85%

Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

给评分者打分:评估智能数据分析系统的经验教训

Tian Zheng, Kai-Tai Hsu

机构 * Columbia University(哥伦比亚大学)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对智能数据分析系统输出复杂、难以评估的问题,提出三层人机评分级联(严格正则匹配、LLM宽松评分、基于片段的人工检查),在153个任务上实现100%精确率,宽松评分召回率97%,并通过迭代提示机制将评分成功率从36%提升至97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22741 2026-06-23 cs.LG 新提交 85%

GRADE: Graph Representation of LLM Agent Dependency and Execution

GRADE: LLM智能体依赖与执行的图表示

Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 多智能体 :agent(title,abstract);tool use(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出GRADE,将LLM智能体的运行建模为具有执行边和依赖边的图,依赖边通过分级推断,在多个数据集上优于运行规模指标,并可用于故障定位。

Comments 18 pages, 5 figures, 8 tables. Code: https://github.com/yzhao062/grade

详情

展开后加载摘要…

URL PDF HTML 收藏