arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-08 至 2026-05-08 共收录 163 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 15 篇

2605.06457 2026-05-08 cs.AI 93%

Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems

超越任务成功:衡量基于大语言模型的代理支付系统的工作流保真度

Donghao Huang, Joon Kiat Chua, Zhaoxia Wang

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理学院) School of Computing(计算学院) Research and Development, Mastercard(Mastercard研发)

专题命中 工作流自动化 :agentic(title,summary_cn);workflow(title,abstract);agent(abstract,abstract_cn);multi-agent(abstract)

AI总结 本文提出Agentic Success Rate(ASR)指标,用于评估代理系统执行序列的保真度,发现18个模型中有10个在支付流程中跳过确认检查点,而GPT-4.1虽任务成功率为完美但存在隐藏的快捷方式,ASR诊断指导的提示优化显著提升了任务成功率。

Comments 6 pages, 2 tables. Accept at AI and Data Science for Digital Finance (AIDS4DF) Workshop, PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06205 2026-05-08 cs.CR 88%

ClawGuard: Out-of-Band Detection of LLM Agent Workflow Hijacking via EM Side Channel

ClawGuard: 通过电磁侧信道检测LLM代理工作流劫持

Leo Linqian Gan, Jeffery Wu, Longyuan Ge, Lanqing Yang, Yonghao Song, Jingkai Zhang, Haojia Jin, Weiyi Wang, Guangtao Xue

专题命中 工作流自动化 :agent(title,abstract);workflow(title,abstract)

AI总结 ClawGuard通过电磁侧信道检测LLM代理工作流劫持,利用电磁信号特征识别被篡改的代理行为,实现对主机软件 compromise 的物理验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 84%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06472 2026-05-08 cs.LG 83%

Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management

基于预测的动态代理工作流高效服务系统

Haoyu Zheng, Fangcheng Fu, Jia Wu, Binhang Yuan, Yongqiang Zhang, Hao Wang, Yuanyuan Zhu, Xiao Yan, Jiawei Jiang

机构 * Wuhan University(武汉大学) Dameng Database(达梦数据库) Shanghai Jiao Tong University(上海交通大学) Macquarie University(麦考瑞大学) HKUST(香港科技大学)

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.LG

AI总结 本文提出PBKV系统,通过预测未来代理调用并管理KV缓存,提升动态工作流的效率,实验显示在动态工作流中比LRU快1.85倍,在静态工作流中比KVFlow快1.26倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24768 2026-05-08 cs.AI 83%

Supervising Ralph Wiggum: Exploring a Metacognitive Co-Regulation Agentic AI Loop for Engineering Design

监督拉尔夫·维格姆:探索一种元认知共调节智能体循环用于工程设计

Zeda Xu, Nikolas Martelaro, Christopher McComb

机构 * Department of Mechanical Engineering(机械工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种自我调节循环和共调节设计智能体循环,通过元认知共调节缓解设计固定问题,提升工程设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03989 2026-05-08 cs.AI 83%

An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration

面向经验的可插拔经验型RAG技能:用于经验驱动的检索策略编排

Dutao Zhang, Tian Liao

机构 * Macao Polytechnic University(澳门理工学院)

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出经验型RAG技能,通过分析场景和经验记忆选择合适检索策略,提升多任务检索效果,实测在多个数据集上优于固定检索基线。

Comments Preprint. 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 79%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05921 2026-05-08 cs.AI cs.HC 70%

Intentmaking and Sensemaking: Human Interaction with AI-Guided Mathematical Discovery

意图生成与意义构建:人类与AI引导的数学发现的交互

Alex Bäuerle, Adam Connors, Alexander Novikov, Adam Zsolt Wagner, Ngân Vũ, Fernanda Viegas, Martin Wattenberg, Lucas Dixon

机构 * Google DeepMind(谷歌DeepMind)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文探讨了专家数学家使用AlphaEvolve进行高级问题研究的流程,提出意图生成与意义构建的协作框架,强调AI工具应作为协作而非黑箱助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05257 2026-05-08 cs.IR cs.AI cs.CL 62%

Career-Aware Resume Tailoring via Multi-Source Retrieval-Augmented Generation with Provenance Tracking: A Case Study

面向职业发展的简历定制:通过多源检索增强生成与溯源的多源检索增强生成:案例研究

Kumar Abhinav

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Resume Tailor系统,通过多源检索增强生成与溯源技术,利用纵向职业档案提升简历定制效果,实验显示在相关经验存在时,ATS匹配分数提升,但领域知识不足时分数下降。

Comments 6 pages, 1 figure, 5 tables. Also available on SSRN

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06625 2026-05-08 cs.CL 57%

Parser agreement and disagreement in L2 Korean UD: Implications for human-in-the-loop annotation

L2韩语UD中的解析一致与不一致:对人类在环标注的启示

Hakyung Sung, Gyu-Ho Shin

机构 * Rochester Institute of Technology(罗切斯特技术学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 本文提出一种简化的人工在环流程,利用两个领域适应解析器的一致性进行第二语言韩语形态语法标注,通过对比解析器与人类判断发现其高度一致,支持半自动标注的可行性,并指出解析分歧集中在语言可预测领域。

Comments To be published in the 20th Linguistic Annotation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06520 2026-05-08 cs.GT cs.LG cs.MA stat.ME 57%

Optimizing Social Utility in Sequential Experiments

在连续实验中优化社会效用

Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·platzer研究所)

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 本文提出一种统计协议,通过开发者连续进行随机对照试验并由监管机构部分补贴成本,以提高社会效用。通过动态规划和分治法,有效找到最优策略和补贴水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05410 2026-05-08 cs.AI cs.HC physics.ed-ph 57%

LaTA: A Drop-in, FERPA-Compliant Local-LLM Autograder for Upper-Division STEM Coursework

LaTA:一个符合FERPA规定的本地LLM自动评分器,用于大二STEM课程作业

Jesse A. Rodríguez

机构 * School of Mechanical, Industrial, and Manufacturing Engineering(机械、工业与制造工程学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 LaTA是一种本地LLM自动评分器,可有效减轻大二STEM课程的评分负担,通过本地运行和LaTeX流程,实现零成本评分,提升学生自信心并提高考试成绩。

Comments Submitted to Computers & Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10241 2026-05-08 cs.CL cs.IR 57%

ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement

ImCoref-CeS: 一种改进的轻量级管道用于基于LLM的检查-分割细化的指代消解

Kangyang Luo, Yuzhuo Bai, Shuzheng Si, Cheng Gao, Zhitong Wang, Yingli Shen, Wenhao Li, Zhu Liu, Yufeng Han, Jiayi Wu, Cunliang Kong, Maosong Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI, Tsinghua University(清华大学人工智能研究院) East China Normal University(华东师范大学) Jiangsu Collaborative Innovation Center for Language Ability(江苏省语言能力协同创新中心)

专题命中 工作流自动化 :agent(abstract);分类 cs.CL

AI总结 本文提出ImCoref-CeS框架,结合增强的监督模型与LLM推理,通过改进的指代消解方法和LLM多角色检查-分割代理提升性能。

Comments Accepted by ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11703 2026-05-08 physics.comp-ph cond-mat.dis-nn cond-mat.mtrl-sci 50%

AiiDA-TrainsPot: Towards automated training of neural-network interatomic potentials

AiiDA-TrainsPot:迈向神经网络互原子势自动训练

Davide Bidoggia, Nataliia Manko, Maria Peressi, Antimo Marrazzo

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出AiiDA-TrainsPot工具,通过自动化流程整合密度泛函理论计算、数据增强和分子动力学,提升神经网络互原子势的训练效率与准确性。

Journal ref Digital Discovery (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00164 2026-05-08 astro-ph.IM 50%

BOOM and Babamul: a real-time, multi-survey, optical alert broker system operating at scale

BOOM和Babamul:一个实时、多调查、光学警报代理系统,可大规模运行

Theophile Jegou du Laz, Michael W. Coughlin, Peter Bachant, Jacob E. Simones, Thomas Culino, Antoine Le Calloch, Sushant Sharma Chaudhary, Xander J. Hall, Tyler Barna, Daniel Warshofsky, Matthew Graham, Mansi M. Kasliwal, Ashish Mahabal, Joshua S. Bloom, Antonella Palmese, Frank J. Masci, Steven L. Groom, Richard Dekany, Reed L. Riddle, George Helou

专题命中 工作流自动化 :workflow(abstract)

AI总结 为应对高通量宽视场调查和多信使仪器的数据流,BOOM系统通过Rust栈和MongoDB数据库实现了实时警报处理,性能提升7倍,支持LSST大规模警报代理Babamul的开发。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 13 篇

2512.01270 2026-05-08 astro-ph.IM astro-ph.GA astro-ph.SR 89%

Egent: An Autonomous Agent for Equivalent Width Measurement

Egent:等效宽度测量的自主代理

Yuan-Sen Ting, Serat Mahmud Saad, Fan Liu, Yuting Shen

专题命中 软件智能体 :agent(title,abstract);autonomous agent(title,abstract);tool use(abstract)

AI总结 Egent结合传统多Voigt拟合与大语言模型视觉检查,实现自动化等效宽度测量,通过函数调用进行拟合推理,验证结果与专家测量一致,且能压缩专家工作量,提供开源代码和网页接口。

Comments 26 pages, 14 figures, 6 tables. Code available at https://github.com/tingyuansen/Egent. Published in the Open Journal of Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05400 2026-05-08 cs.SE cs.AI cs.HC 88%

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

代理编程的准备:作为情境工程方法论的刻意准备

Andrew Zigler

机构 * LinearB

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文提出了一种三阶段的代理编程准备方法,通过情境 grounding、协作规范和任务分解,提升 AI 编程的效率与质量,通过 hackathon 实验验证了准备阶段的重要性。

Comments 5 pages. Accepted at VibeX 2026, the 1st International Workshop on Vibe Coding and Vibe Researching, co-located with EASE 2026, Glasgow, June 9-12 2026. Camera-ready version. Research artifact: https://doi.org/10.5281/zenodo.19868258

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11535 2026-05-08 cs.AI 83%

Problem Reductions at Scale: Agentic Integration of Computationally Hard Problems

大规模问题规约:代理集成计算难题

Xi-Wei Pan, Shi-Wen An, Jin-Guo Liu

机构 * HKUST (GZ)(香港科技大学(广州)) Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过代理工程实现大规模问题规约库,利用无代码贡献路线、多层验证栈和自动化流程,快速构建包含100多种问题类型和200多种规约规则的工具,实现问题与求解器的高效连接。

Comments The source code is available at https://github.com/CodingThrust/problem-reductions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05584 2026-05-08 cs.SE cs.CY 83%

Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files

将伦理应用于AI代理:开发者如何将价值观编码到仓库上下文文件中

Christoph Treude, Sebastian Baltes, Marc Cheong

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文探讨开发者如何通过仓库上下文文件将伦理原则转化为AI代理的行为指令,分析价值观编码的多样性及治理动态,为AI治理提供软件工程实践基础。

Comments 3rd ACM International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06158 2026-05-08 cs.CR 82%

Stateful Agent Backdoor

具备状态的代理后门

Zhengchunmin Dai, Jiaxiong Tang, Liantao Wu, Peng Sun, Honglong Chen

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文提出一种具备状态的代理后门,通过持久化组件跨多个会话维持状态,实现自主递增执行。该方法基于Mealy机建模,并通过分解框架提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06136 2026-05-08 cs.SE cs.AI 81%

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

BUILD-AND-FIND: 一种考虑努力的协议用于评估代理管理的代码库

Jhen-Ke Lin

机构 * National Yang Ming Chiao Tung University

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究提出BUILD-AND-FIND协议,用于评估下游代理从生成代码库中恢复意图选择的能力及所需检查努力,通过分离行为正确性与恢复过程,评估准确性、稳定性、重复性、覆盖范围和努力程度。

Comments 25 pages, 8 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06445 2026-05-08 cs.SE cs.AI 62%

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

约束衰减:后端代码生成中LLM代理的脆弱性

Francesco Dente, Dario Satriani, Paolo Papotti

机构 * EURECOM University of Basilicata(巴利卡塔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16746 2026-05-08 cs.SE cs.CL 62%

SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents

SWE-Pruner: 为编码代理设计的自适应上下文修剪

Yuhang Wang, Yuling Shi, Mo Yang, Rongrui Zhang, Shilin He, Heng Lian, Yuting Chen, Siyu Ye, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出SWE-Pruner,一种针对编码代理的自适应上下文修剪框架,通过任务感知的动态修剪策略减少长上下文影响,提升代码生成效率与准确性。

Comments Code available at https://github.com/Ayanami1314/swe-pruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05700 2026-05-08 cs.SE cs.AI 62%

An Empirical Study of Proactive Coding Assistants in Real-World Software Development

对现实软件开发中主动编码助手的实证研究

Lehui Li, Ruixuan Jia, Guo-Ye Yang, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Fitten Tech Co., Ltd.(Fitten科技有限公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06125 2026-05-08 cs.SE 57%

Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution

打破、过时或缺失?基于项目级测试演变的基准测试

Ye Shang, Quanjun Zhang, Haichuan Hu, Chunrong Fang, Liang Xiao, Zhenyu Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI 57%

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08915 2026-05-08 cs.SE 57%

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

比较AI编码代理:一项任务分层的拉取请求接受分析

Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文通过分析7156个拉取请求,比较了五个AI编码代理在不同任务类型上的接受率差异,发现文档任务接受率显著高于新功能任务,且OpenAI Codex在多种任务类型中表现优异。

Comments Accepted by MSR'26 Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05258 2026-05-08 cs.SE 57%

PARNESS: A Paper Harness for End-to-End Automated Scientific Research with Dynamic Workflows, Full-Text Indexing, and Cross-Run Knowledge Accumulation

PARNESS:一种用于端到端自动化科学研究的论文工具,支持动态工作流、全文索引和跨运行知识积累

Yuchen Wang, Zhongzhi Luan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 PARNESS通过动态工作流、全文索引和跨运行知识积累,解决传统科研系统流程僵化、知识累积不足的问题,实现端到端自动化科研。

Comments 31 pages, 13 figures, includes appendix with a verbatim end-to-end-generated paper produced by the framework. Source: https://github.com/gtrhythm/PARNESS

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 1 篇

2605.05509 2026-05-08 cs.CR 82%

WAAA! Web Adversaries Against Agentic Browsers

WAAA! 网络对抗与代理浏览器

Sohom Datta, Alex Nahapetyan, William Enck, Alexandros Kapravelos

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文提出首个针对代理浏览器的网络威胁模型,识别20种攻击类型,展示代理浏览器在传统和LLM威胁下的五种主要失效模式,强调需重新设计代理浏览器。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 12 篇

2605.05716 2026-05-08 cs.AI cs.CL 88%

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

更多并不总是更好:LLM代理构建中的跨组件干扰

Ming Liu

机构 * Amazon(亚马逊)

专题命中 记忆与上下文管理 :agent(title,abstract);tool use(abstract,abstract_cn);planning(abstract);分类 cs.AI、cs.CL

AI总结 研究LLM代理系统中组件交互导致的性能下降,发现最优组件数量依赖任务和模型规模,贪心选择不可靠,需通过交互分析进行任务特定子集选择。

Comments 10 pages, 5 tables; preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏