arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2605.11280 2026-05-13 gr-qc astro-ph.HE cs.AI 85%

Discovery of Interpretable Surrogates via Agentic AI: Application to Gravitational Waves

通过代理AI发现可解释的替代模型:应用于引力波

Tousif Islam, Digvijay Wadekar, Tejaswi Venumadhav, Matias Zaldarriaga, Ajit Kumar Mehta, Javier Roulet, Barak Zackay

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara(加州大学圣芭芭拉分校凯文利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin(德克萨斯大学奥斯汀分校重力物理中心) Department of Physics, University of California at Santa Barbara(加州大学圣芭芭拉分校物理系) International Centre for Theoretical Sciences, Tata Institute of Fundamental Research(塔塔基础研究机构国际理论科学研究中心) School of Natural Sciences, Institute for Advanced Study(高级研究院自然科学学院) Chennai Mathematical Institute(钦奈数学研究所) Kavli Institute for Cosmological Physics, The University of Chicago(芝加哥大学凯文利宇宙物理研究所) Department of Particle Physics & Astrophysics, Weizmann Institute of Science(魏茨曼科学研究所粒子物理与天体物理系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出GWAgent,一种基于大语言模型的流程,直接从模拟数据构建可解释的分析替代模型。通过物理指导的域假设提升模型精度,实现高精度、快速且可解释的引力波模拟替代。

Comments 25 pages, 9 figures, codes available at https://github.com/tousifislam/GWAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10384 2026-05-12 cs.AI cs.DC cs.NI 85%

Agentic Performance at the Edge: Insights from Benchmarking

边缘端的代理性能:基准测试中的见解

Shiqiang Wang, Herbert Woisetschläger

机构 * University of Exeter(埃克塞特大学) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文探讨了在边缘系统中,受限于内存、功率和延迟的模型规模对代理任务质量的影响,提出了一种领域条件评估方法,并揭示了模型选择与工具工作流联合设计的重要性。

Comments Accepted to AutoEdge workshop, co-located with MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08941 2026-05-12 cs.AI 85%

MDGYM: Benchmarking AI Agents on Molecular Simulations

MDGYM:在分子模拟上评估AI代理的基准测试

Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-05-12 cs.CR cs.AI 85%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 85%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 Agent评测 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06068 2026-05-08 cs.AI cs.DC 85%

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe: 人工智能代理能否构建定制化的LLM服务系统?

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI 85%

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01147 2026-05-05 cs.AI 85%

Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment

位置:代理AI的安全性与公平性取决于交互拓扑,而非模型规模或对齐

Tanav Singh Bajaj, Nikhil Singh, Karan Anand, Eishkaran Singh

机构 * Department of Computer Science, University of British Columbia, Vancouver, Canada(英属哥伦比亚大学计算机科学系) Department of Artificial Intelligence, IIT Hyderabad, Hyderabad, India(印度海得拉巴理工学院人工智能系) Amazon, Delhi, India(印度德里亚马逊公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文指出代理AI的安全性由交互拓扑决定,而非模型规模或对齐程度。研究揭示了顺序不稳定、信息级联和功能崩溃等拓扑驱动的问题,并强调需通过动态系统视角评估安全性和公平性。

Comments 18 pages, 8 figures. Position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00876 2026-05-05 cs.LG cs.CV 85%

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

GAZE:基于视图级工具和文献检索的 grounded 零样本评估

Duaa Alim, Mogtaba Alim, Liam Chalcroft

机构 * Imperial College London, UK(伦敦帝国学院) University of Toronto, Canada(多伦多大学) University College London, UK(伦敦大学学院)

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.LG

AI总结 GAZE框架通过调用视图级工具和文献检索工具,使医学VLM在迭代方式下工作,实现对罕见脑MRI的零样本评估,提升病变定位和诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19932 2026-05-04 cs.AI 85%

CASE: An Agentic AI Framework for Enhancing Scam Intelligence in Digital Payments

CASE:一种增强数字支付中诈骗情报的代理AI框架

Nitish Jaipuria, Lorenzo Gatto, Zijun Kan, Shankey Poddar, Bill Cheung, Diksha Bansal, Ramanan Balakrishnan, Aviral Suri, Jose Estevez

机构 * Google, Inc(谷歌公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CASE框架,通过收集和管理用户诈骗反馈,提升诈骗识别能力,实现在数字支付中21%的欺诈打击提升。

Comments 7 pages, 5 figures, Version published in IEEE Xplore

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2177-2183

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 85%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 85%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23280 2026-04-28 cs.AI cs.CR 85%

AI Identity: Standards, Gaps, and Research Directions for AI Agents

AI身份:面向AI代理的标准、缺口与研究方向

Takumi Otsuka, Kentaroh Toyoda, Alex Leung

机构 * AIFT, Singapore(新加坡AIFT) Graduate School of Fundamental Science and Engineering, Department of Computer Science and Communications Engineering, Waseda University, Japan(日本早稻田大学基础科学与工程研究生院计算机科学与通信工程系) Keio Global Research Institute (KGRI), Japan(日本庆应大学全球研究机构)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文探讨了AI代理身份识别与责任归属问题,指出现有技术与法规无法应对非确定性和跨边界实体的治理挑战,提出了五个关键缺口,并强调基础研究的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 85%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17989 2026-04-21 cs.AI 85%

AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum

AIT Academy:通过儒家三领域课程培养完整智能体

Jiaqi Li, Lvyang Zhang, Yang Zhao, Wen Lu, Lidong Zhai

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出AIT Academy框架,通过儒家三领域课程培养完整智能体,实验显示多领域视角在安全意识校准中有诊断价值。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10866 2026-04-17 cs.CL 85%

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11304 2026-04-14 cs.AI 85%

BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows

BankerToolBench:评估AI代理在端到端投资银行业务流程中的表现

Elaine Lau, Markus Dücker, Ronak Chaudhary, Hui Wen Goh, Rosemary Wei, Vaibhav Kumar, Saed Qunbar, Guram Gogia, Yi Liu, Scott Millslagle, Nasim Borazjanizadeh, Ulyana Tkachenko, Samuel Eshun Danquah, Collin Schweiker, Vijay Karumathil, Asrith Devalaraju, Varsha Sandadi, Haemi Nam, Punit Arani, Ray Epps, Abdullah Arif, Sahil Bhaiwala, Curtis Northcutt, Skyler Wang, Anish Athalye, Jonas Mueller, Francisco Guzmán

机构 * Handshake AI McGill University(麦吉尔大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BankerToolBench,一个模拟投资银行日常工作的开源基准,用于评估AI代理在高价值、高强度的专业流程中的能力,测试结果显示当前AI模型在关键指标上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10513 2026-04-14 cs.AI 85%

Agent Mentor: Framing Agent Knowledge through Semantic Trajectory Analysis

Agent Mentor: 通过语义轨迹分析框架代理知识

Roi Ben-Gigi, Yuval David, Fabiana Fournier, Lior Limonad, Dany Moshkovich, Hadar Mulian, Segev Shlomov

机构 * IBM Software Innovation Lab(IBM软件创新实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出通过语义轨迹分析框架提升代理性能,通过系统提示的监控和逐步调整,系统性地注入纠正指令以改进代理知识,实验显示在规范模糊性主导的场景中效果显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09568 2026-04-14 cs.HC cs.CL cs.CV 85%

EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution

EvoDiagram:通过设计专业知识进化实现代理可编辑的图示创建

Tianfu Wang, Leilei Ding, Ziyang Tao, Yi Zhan, Zhiyuan Ma, Wei Wu, Yuxuan Lei, Yuan Feng, Junyang Wang, Yin Wu, Yizhao Xu, Hongyuan Zhu, Qi Liu, Nicholas Jing Yuan, Yanyong Zhang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 EvoDiagram通过设计专业知识进化实现代理可编辑图示创建,解决自动系统在高保真图示生成中的挑战,提出中间画布方案和设计知识进化机制,释放CanvasBench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04265 2026-04-07 cs.CR cs.AI cs.MA 85%

Governance-Constrained Agentic AI: Blockchain-Enforced Human Oversight for Safety-Critical Wildfire Monitoring

受治理约束的代理AI:区块链强制的人类监督用于安全关键的野火监测

Ali Akarma, Toqeer Ali Syed, Salman Jan, Hammad Muneer, Abdul Khadar Jilani

机构 * AI Center, Faculty of Computer and Information Systems, Islamic University of Madinah(伊斯兰大学麦地那分校计算机与信息系统学院人工智能中心) Faculty of Computer Studies, Arab Open University-Bahrain(阿拉伯开放大学巴林分校计算机研究学院) Department of Computer Science, The Islamia University of Bahawalpur(巴哈瓦尔布尔伊斯兰大学计算机科学系) College of Computer Studies, University of Technology Bahrain(巴林科技大学计算机研究学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于区块链的治理意识代理AI架构,用于安全关键的野火预警,通过约束部分可观测马尔可夫决策过程模型,实现动态风险适应的无人机资源分配,并通过智能合约强制人类授权,确保警报完整性、人类控制和非否认性。

Comments This paper was presented at ICETAS 2026 Bahrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 85%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21551 2026-04-01 cs.SE 85%

AI In Cybersecurity Education -- Scalable Agentic CTF Design Principles and Educational Outcomes

AI在网络安全教育中的应用:可扩展的智能体CTF设计原则与教育成效

Haoran Xi, Minghao Shao, Kimberly Milner, Venkata Sai Charan Putrevu, Nanda Rani, Meet Udeshi, Prashanth Krishnamurthy, Brendan Dolan-Gavitt, Siddharth Garg, Sandeep Kumar Shukla, Farshad Khorrami, Alon Hillel-Tuch, Muhammad Shafique, Ramesh Karri

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文研究了基于大语言模型的CTF竞赛设计,探讨了自主性水平和参与者知识背景对问题解决性能和学习行为的影响,提出自主性特定的评分标准和证据要求,以提升网络安全教育的可扩展性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24775 2026-03-27 cs.CR cs.AI 85%

AIP: Agent Identity Protocol for Verifiable Delegation Across MCP and A2A

基于MCP和A2A的可验证代理身份协议

Sunil Prakash

机构 * Indian School of Business(印度商学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出AIP协议,通过融合身份、授权衰减和溯源绑定,解决MCP和A2A协议中代理身份验证问题,采用IBCTs实现多跳委托,并在实际部署中展示高效安全性能。

Comments 17 pages, 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23749 2026-03-26 cs.AI 85%

Efficient Benchmarking of AI Agents

高效评估AI代理

Franck Ndzomga

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15668 2026-03-18 cs.AI cs.CR quant-ph 85%

Quantum-Secure-By-Construction (QSC): A Paradigm Shift For Post-Quantum Agentic Intelligence

量子安全由设计(QSC):后量子代理智能的范式转变

Arit Kumar Bishwas, Mousumi Sen, Albert Nieto-Morales, Joel Jacob Varghese

机构 * PricewaterhouseCoopers USA(普华永道美国公司) Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出QSC范式,通过融合后量子密码学、量子随机数生成和量子密钥分发,为代理智能系统提供运行时自适应的安全架构,减少量子安全引入的复杂性和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 85%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04632 2026-03-17 cs.LG 85%

Risk-Sensitive Agent Compositions

风险敏感型代理组合

Guruprerana Shabadi, Rajeev Alur

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出一种风险最小化方法,用于在代理组合中平衡任务成功率与安全、公平和隐私要求,通过动态规划和联合界估算近优解。

Comments 19 pages, 6 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 85%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09882 2026-03-04 cs.AI cs.CR cs.CY 85%

Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing

将AI代理与网络安全专家在真实世界渗透测试中进行比较

Justin W. Lin, Eliot Krzysztof Jones, Donovan Julian Jasper, Ethan Jun-shen Ho, Anna Wu, Arnold Tianyi Yang, Neil Perry, Andy Zou, Matt Fredrikson, J. Zico Kolter, Percy Liang, Dan Boneh, Daniel E. Ho

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文比较了AI代理与网络安全专家在真实世界渗透测试中的表现,发现ARTEMIS在技术深度和提交质量上接近最强人类参与者,但在误报率和GUI任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00846 2026-03-03 cs.IR cs.LG 85%

Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models

Tiny-Critic RAG:赋能代理回退的参数高效小型语言模型

Yichao Wu, Penghao Liang, Yafei Xiang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan

机构 * Northeastern University(东北大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 Tiny-Critic RAG通过参数高效的Small Language Model实现低延迟的二进制路由,有效降低代理部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏