arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15603 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15603 篇

2605.11946 2026-06-01 cs.AI 91%

Counterfactual Trace Auditing of LLM Agent Skills

LLM Agent技能的反事实痕迹审计

Xiaolin Zhou, Jinbo Liu, Li Li, Ryan A. Rossi, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :agent(title,title_cn);planning(abstract);分类 cs.AI

AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。

Comments Code and data are available at https://github.com/WillChow66/CTA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29560 2026-05-29 cs.AI 91%

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计

Jiawei Chen, Xiaofan Gui, Shikai Fang, Shengyu Tao, Shun Zheng, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Zhejiang University(浙江大学) Chalmers University of Technology(皇家理工学院)

专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI

AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14987 2026-05-22 cs.CL cs.DB 91%

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI

超越基准岛屿:面向代理AI的代表性可信度评估

Jinhu Qi, Yifan Li, Minghao Zhao, Wentao Zhang, Zijian Zhang, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工学院) Jilin University(吉林大学)

专题命中 Agent评测 :agentic(title,abstract);agent(summary_cn,abstract);tool use(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。

Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22569 2026-05-20 cs.CR cs.AI 91%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21936 2026-04-27 cs.AI cs.CV cs.MA 91%

An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing

基于 artifact 的 agent 框架用于自适应和可重复的医学图像处理

Lianrui Zuo, Yihao Liu, Gaurav Rudravaram, Karthik Ramadass, Aravind R. Krishnan, Michael D. Phillips, Yelena G. Bodien, Mayur B. Patel, Paula Trujillo, Yency Forero Martinez, Stephen A. Deppen, Eric L. Grogan, Fabien Maldonado, Kevin McGann, Hudson M. Holmes, Laurie E. Cutting, Yuankai Huo, Bennett A. Landman

机构 * Dept. of Electrical and Computer Engineering, Vanderbilt University(电气与计算机工程系,范德比尔特大学) Dept. of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) Dept. of Biomedical Engineering, Vanderbilt University(生物医学工程系,范德比尔特大学) Dept. of Surgery, Vanderbilt University Medical Center(外科系,范德比尔特大学医学中心) Dept. of Neurology, Vanderbilt University Medical Center(神经病学系,范德比尔特大学医学中心) Dept. of Medicine, Vanderbilt University Medical Center(医学系,范德比尔特大学医学中心) Dept. of Thoracic Surgery, Vanderbilt University Medical Center(胸外科系,范德比尔特大学医学中心) Dept. of Biomedical Informatics, Vanderbilt University Medical Center(生物医学信息学系,范德比尔特大学医学中心) Dept. of Radiology and Radiological Sciences, Vanderbilt University Medical Center(放射学与放射科学系,范德比尔特大学医学中心) Vanderbilt University Institute of Imaging Science(范德比尔特大学成像科学研究所) Veteran Affairs, Tennessee Valley Healthcare System(退伍军人事务,田纳西河流域医疗系统) Peabody College, Vanderbilt University(佩博利学院,范德比尔特大学) Vanderbilt Brain Institute, Vanderbilt University(范德比尔特脑研究院,范德比尔特大学)

专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI

AI总结 本文提出基于 artifact 的 agent 框架,用于在真实临床环境中实现自适应和可重复的医学图像处理,通过语义层和模块化规则库实现工作流配置和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 91%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05608 2026-06-11 cs.SE cs.AI 版本更新 91%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

软件工程的终结:AI代理如何根本性地重构软件范式

Zhenfeng Cao

机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。

Comments 15 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22302 2026-02-27 cs.AI cs.MA cs.SE 91%

Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents

智能体行为契约:为可靠自主AI智能体的正式规范与运行时执行

Varun Pratap Bhardwaj

机构 * Accenture(埃森哲)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出智能体行为契约框架,通过形式化规范和运行时执行,提升自主AI智能体的可靠性与行为可控性。

Comments 71 pages, 7 figures, 14 tables. Patent pending. Also available on Zenodo: DOI 10.5281/zenodo.18775393

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15940 2025-08-25 cs.AR cs.AI cs.CL cs.DC cs.MA 91%

ASIC-Agent: An Autonomous Multi-Agent System for ASIC Design with Benchmark Evaluation

Ahmed Allam, Youssef Mansour, Mohamed Shalan

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments 2025 IEEE International Conference on LLM-Aided Design (ICLAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01635 2025-02-04 cs.SE cs.AI 91%

The AI Agent Index

Stephen Casper, Luke Bailey, Rosco Hunter, Carson Ezell, Emma Cabalé, Michael Gerovitch, Stewart Slocum, Kevin Wei, Nikola Jurkovic, Ariba Khan, Phillip J. K. Christoffersen, A. Pinar Ozisik, Rakshit Trivedi, Dylan Hadfield-Menell, Noam Kolt

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);agentic(abstract)

Comments Accompanying website: https://aiagentindex.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27705 2026-05-28 cs.CR cs.MM 90%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16571 2026-05-11 cs.AI cs.IR cs.MA 90%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 Agent评测 :agent(title_cn,summary_cn);AI agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14989 2026-04-28 cs.AI cs.AR 90%

Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement

Dr. RTL:通过工具引导的自我改进实现自主代理RTL优化

Wenji Fang, Yao Lu, Shang Liu, Jing Wang, Ziyan Guo, Junxian He, Fengbin Tu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(title);agent(abstract);workflow(abstract)

AI总结 Dr. RTL通过真实环境下的闭环优化和群体相对技能学习,提升RTL时序优化的性能、功耗和面积指标,实现更高效的自改进优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12006 2025-11-12 cs.AI 90%

SOCIA-$\nabla$: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation

Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim

机构 * School of Computer Science Engineering, University of New South Wales(计算机科学工程学院,新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments 11 pages, 1 figure, 2 tables. The paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18551 2025-11-11 cs.AI 90%

SOCIA-Nabla: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation

Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments superseded by newest version of arXiv:2505.12006

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25612 2025-10-30 cs.AI cs.MA 90%

Counterfactual-based Agent Influence Ranker for Agentic AI Workflows

Amit Giloni, Chiara Picardi, Roy Betser, Shamik Bose, Aishvariya Priya Rathina Sabapathy, Roman Vainshtein

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究中心)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);workflow(abstract);multi-agent(abstract)

Comments Accepted to EMNLP 2025, 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 90%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 Agent评测 :agentic(title,summary_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 90%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03271 2026-07-30 cs.HC 90%

Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI Agents

代理关系伤害:AI代理中关系操纵的基准测试与门控

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 针对AI代理可能造成的关系操纵风险,提出了一个110提示的基准测试、关系特定标注框架和轻量级后生成策略门控,以评估和缓解代理关系伤害。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15579 2026-06-16 cs.AI cs.LG cs.MA cs.SE 新提交 90%

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

你的智能体有基因组:基于序列的LLM驱动自主智能体行为分析与运行时治理

Sidi Deng

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出XEPV序列编码框架,将LLM智能体行为建模为基因组序列,通过n-gram挖掘发现P-X-P高风险模式,设计Governor三层干预系统,使成功率提升6.2%并减少44% token消耗。

Comments 16 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 90%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 Agent评测 :planning(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22584 2025-10-08 cs.LG cs.AI cs.CL 90%

BenchAgents: Multi-Agent Systems for Structured Benchmark Creation

Natasha Butt, Varun Chandrasekaran, Neel Joshi, Besmira Nushi, Vidhisha Balachandran

机构 * University of Amsterdam(阿姆斯特丹大学) Microsoft Research(微软研究院) UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16832 2025-05-29 cs.AI cs.CL cs.CV cs.LG 90%

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

Haonian Ji, Shi Qiu, Siyang Xin, Siwei Han, Zhaorun Chen, Dake Zhang, Hongyi Wang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Rutgers University(罗格斯大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 16 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16989 2026-07-22 cs.CL cs.AI cs.DL cs.HC 版本更新 90%

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

人工智能代理起草转化影响摘要的实际评估

Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren R. Sureshbabu, Krishna R. Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对CTSA项目人工整理学者研究影响耗时久且难扩展的问题,构建人工参与的AI代理。该代理为学者整理证据档案、起草影响摘要,经评估,在CTSA中心工作流程中表现良好,能提高效率、实现队列规模影响报告。

Comments 15 pages, 5 figures, 2 tables. Submitted to the Journal of Clinical and Translational Science. Code: https://github.com/mo-arvan/scholar-dossier-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04455 2026-06-04 cs.AI cs.CL 90%

The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

元智能体挑战:当前智能体能否自主开发智能体?

Xinyu Lu, Tianshu Wang, Pengbo Wang, zujie wen, Zhiqiang Zhang, Jun Zhou, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出元智能体挑战(MAC)框架,评估前沿模型自主开发智能体系统的能力,发现多数元智能体难以匹敌人类设计的基线策略,且存在鲁棒性和对齐问题。

Comments Website: https://meta-agent-challenge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19779 2026-05-20 cs.AI cs.LG 90%

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

无分布不确定性量化用于连续AI代理评估

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。

Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 90%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05871 2026-06-02 cs.AI 90%

Agent Guide: A Simple Agent Behavioral Watermarking Framework

Agent Guide:一种简单的智能体行为水印框架

Kaibo Huang, Zipei Zhang, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 针对智能体行为难以标记和转换的问题,提出Agent Guide框架,通过概率偏差引导智能体高层决策嵌入水印,并利用z统计量检测,实现低误报率的水印嵌入与提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27428 2026-05-28 cs.LG 90%

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

$E^3$-Agent: 一种用于边缘生成式推理资源管理的可执行且可演化智能体

Rui Bao, Yaping Sun, Zhiyong Chen, Feng Yang, Meixia Tao, Nan Li, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学合作中位网创新中心,上海,中国) Department of Broadband Communication, Pengcheng Laboratory, Shenzhen 518000, China(鹏城实验室宽带通信部门,深圳,中国) China Mobile Research Institute, Beijing 100053, China(中国移动研究院,北京,中国)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.LG

AI总结 针对边缘生成式推理中设备性能未知且时变的问题,提出一种可执行且可演化的智能体$E^3$-Agent,通过分离快速路径路由器和慢速路径大语言模型元控制器,实现在线学习与自适应资源管理,在动态场景下平均延迟降低65%-73%。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20742 2026-05-21 cs.AI 90%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏