arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 402 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 36 篇

2605.17625 2026-05-19 cs.AI 57%

Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents

用于长周期科学代理的事件-语义记忆架构

Nikola Milosevic

机构 * Serbian Institute for Artificial Intelligence Research and Development(塞尔维亚人工智能研究与发展研究所) Bayer A.G.(勃林格殷曼有限公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种双过程记忆架构,用于解决科学代理在长周期任务中面临的情境窗口饱和问题,通过分离即时事件需求和长期知识整合,提升了在大规模科学工作流中的表现和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15338 2026-05-19 cs.CR cs.AI 57%

Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

记忆中的隐患:LLM代理中的潜伏记忆污染

Sidharth Pulipaka, Stanislau Hlebik, Leonidas Raghav, Sahar Abdelnabi, Vyas Raina, Ivaxi Sheth, Mario Fritz

机构 * SPAR ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) APTA CISPA Helmholtz Center for Information Security(信息安全海德堡中心)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理中由于持久化内存带来的安全风险,提出并研究了潜伏记忆污染攻击,该攻击通过操控外部上下文使代理存储伪造的记忆,影响后续交互,实验显示攻击可跨多次对话持续生效。

Comments 86 pages, 60 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17887 2026-05-19 cs.AI 57%

When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents

当个性化合理化风险:揭示个性化对话代理中的安全漏洞

Jiahe Guo, Xiangran Guo, Yulin Hu, Zimo Long, Xingyu Sui, Xuda Zhi, Yongbo Huang, Hao He, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES Group Co., Ltd(SERES集团有限公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文研究了个性化对话代理中的一种安全故障模式——意图合理化,通过引入PS-Bench基准测试,揭示了个性化记忆如何偏移意图推断并导致模型合理化有害查询,提出了一种轻量级的检测-反思方法以减少安全退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01611 2026-05-19 cs.AI 57%

A Machine With Human-Like Memory Systems

具有人类样记忆系统的机器

Taewoon Kim, Michael Cochez, Vincent Francois-Lavet, Mark Neerincx, Piek Vossen

机构 * Vrije Universiteit Amsterdam(荷兰瓦赫宁根大学) Technische Universiteit Delft(代尔夫特理工大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种同时具备语义记忆和事件记忆的智能体,证明双记忆系统优于单一记忆系统,并通过自研环境

Comments Submitted to Human-Centered Design of Symbiotic Hybrid Intelligence 2022 (https://ii.tudelft.nl/humancenteredsymbioticHI/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16647 2026-05-19 cs.CR cs.LG 57%

Public-Decay Homomorphic State Space Models for Private Sequence Inference

公共衰减同态状态空间模型用于隐私序列推断

Luis Brito

机构 * School of Technology and Management (ESTG-IPVC) Polytechnic Institute of Viana do Castelo(技术与管理学院(ESTG-IPVC)葡萄牙维亚纳多卡斯托尔理工大学)

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.LG

AI总结 本文提出公共衰减同态状态空间模型(HSSMs),通过加密-明文公共衰减更新状态,实现隐私序列推断,在保持加密状态的同时提升效率和准确性。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02098 2026-05-19 cs.AI 57%

A Machine with Short-Term, Episodic, and Semantic Memory Systems

具有短期、事件性和语义记忆系统的机器

Taewoon Kim, Michael Cochez, Vincent François-Lavet, Mark Neerincx, Piek Vossen

机构 * Vrije Universiteit Amsterdam(瓦赫宁海姆大学) Technische Universiteit Delft(代尔夫特理工大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种具有短期、事件性和语义记忆系统的智能体模型,通过知识图谱实现各记忆系统的建模,并在自研环境中验证了该模型在记忆编码、存储与检索上的优势。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (2023), 37(1), 48-56

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18707 2026-05-19 cs.DC 50%

Ranking Opinions with Few States in Population Protocols

用少量状态进行人口协议中的意见排名

Tom-Lukas Breitkopf, Julien Dallot, Antoine El-Hayek, Stefan Schmid

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究提出了一种使用$ k^3 $状态的人口协议,解决了相对多数问题,并进一步扩展以处理各种破 tie 机制和不同颜色的初始顺序情况。

Comments To appear at PODC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18569 2026-05-19 quant-ph physics.chem-ph 50%

Reinforcement Learning Assisted Quantum Simulation of Many-Body Excited States and Real-Time Dynamics

强化学习辅助的多体激发态和实时动力学量子模拟

Jiaji Zhang, Lipeng Chen, Carlos L. Benavides-Riveros

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种基于强化学习的量子模拟方法,用于计算多费米子系统的激发态和实时量子动力学,通过自适应选择二体算子提高模型的紧凑性和鲁棒性,并展示了该方法在化学系统中的高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17597 2026-05-19 eess.SY cs.SY 50%

Distributed Synthesis of Gray-Box Distributed H2 Controllers

分布式灰盒H2控制器合成

Michael C. A. Nestor, Fei Teng

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种分布式灰盒方法,结合部分已知的模型知识和输入-状态数据,设计可扩展且能处理未知动态的H2控制器,通过ADMM在无中心服务器的情况下实现迭代求解。

Comments Accepted for presentation at the 23rd IFAC World Congress, Busan, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10731 2026-05-19 quant-ph 50%

Error-Tolerant Quantum State Discrimination: Optimization and Quantum Circuit Synthesis

容错量子态鉴别:优化与量子电路综合

Chien-Kai Ma, Bo-Hung Chen, Tian-Fu Chen, Dah-Wei Chiou, Jie-Hong Roland Jiang

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出两种互补方法,CrossQSD通过可调置信度边界平衡准确性和效率,FitQSD通过优化测量结果分布近似理想无噪声情况,同时提供统一的混合目标QSD框架,允许灵活权衡不同目标,并通过改进的Naimark扩张和等距综合框架实现硬件高效实现,减少量子比特和门资源,提供开源工具包自动化优化和综合流程。

Journal ref International Conference on Tools and Algorithms for the Construction and Analysis of Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14462 2026-05-19 cond-mat.stat-mech physics.comp-ph 50%

The Varieties of Schelling Model Experience

施莱辛格模型经验的多样性

Marlyn Boke, Timothy Sorochkin, Jesse Anttila-Hughes, Alan O. Jamison

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文通过相图分类对施莱辛格模型的54种规则变体进行了全面分析,发现只有3种相图类别,揭示了相变的驱动因素,并为更复杂的施莱辛格类模型研究奠定了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05404 2026-05-19 econ.EM 50%

Causal State-Dependent Local Projections

基于状态的局部投影

Joel M. David, Raffaella Giacomini, Xiyu Jiao, Weining Wang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了基于状态的局部投影在微观-宏观环境中的因果解释,提出了一种 sieve-based LP estimator 以恢复因果响应并提供有效的推断。

Comments 80 pages, including appendices; 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05569 2026-05-19 cs.DC 50%

Self-Evolving Distributed Memory Architecture for Scalable AI Systems

自演化分布式内存架构用于可扩展AI系统

Zixuan Li, Chuanzhen Wang, Haotian Sun

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种三层架构,通过动态内存管理提升AI系统在计算、通信和部署层的效率,实现内存利用率提升和通信延迟降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16597 2026-05-19 physics.ins-det 50%

A Heavy Ion Monitor on a Chip Based on a Non-Volatile Memory Architecture -- Part II: Device Characterization & Modeling

基于非易失存储器架构的重离子监测器芯片——第二部分:器件特性与建模

Dale Julson, Mike Youngs, Hannah Lowrey, David Keltner, Tim Hossain, Clayton Fullwood

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本研究通过实验验证了HIMoC的灵敏度,并利用Geant4与DEVSIM模拟工具建模重离子诱导信号,证实其作为被动重离子剂量计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16522 2026-05-19 cs.RO cs.MA 50%

A Mechanistic Model for Collective Motion from Sensorimotor Regularities

从传感器运动规律出发的集体运动机制模型

Vito Mengers, Bao Duc Cao, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(技术大学柏林机器人与生物学实验室,德国) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(智能科学,卓越研究集群,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出基于机器人建模框架的集体运动机制模型,通过感知和动作的梯度下降实现群体行为,揭示了传感器运动规律在集体行为中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16333 2026-05-19 cs.DL cs.IR 50%

SotA Lens: A Network-Augmented Methodology and Tool for Exploratory State-of-the-Art Reviews

SotA Lens:一种网络增强的方法论和工具用于探索性现状综述

Diogo Peralta Cordeiro

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出SotA Lens,一种网络增强的方法和轻量级工具,用于探索性现状综述,通过结合多种技术手段帮助研究人员识别领域中的聚类和空白,产生可审计的综述成果。

Comments 11 pages, 3 figures, 2 tables; original methodology/software paper with proof-of-concept case study; software DOI: 10.5281/zenodo.19860899

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 77 篇

2604.21937 2026-05-19 cs.AI cs.MA 91%

MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization

MolClaw:一种具有分层技能的自主代理,用于药物分子评估、筛选和优化

Lisheng Zhang, Lilong Wang, Xiangyu Sun, Wei Tang, Haoyang Su, Yuehui Qian, Qikui Yang, Qingsong Li, Zhenyu Tang, Haoran Sun, Yingnan Han, Yankai Jiang, Wenjie Lou, Bowen Zhou, Xiaosong Wang, Lei Bai, Zhengwei Xie

机构 * Peking University Health Science Center, Peking University, Beijing, China(北京大学北京医院科学中心,北京大学,北京,中国) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China(北京大学先进跨学科研究学院,北京大学,北京,中国)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);AI agent(abstract);planning(abstract)

AI总结 MolClaw通过分层技能架构整合30余种领域资源,实现药物分子评估、筛选和优化的自动化,其在复杂工作流中的表现优于现有AI代理。

Comments 28 pages, 8 figures. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17475 2026-05-19 cs.SE 90%

Event-B Agent: Towards LLM Agent for Formal Model Synthesis and Repair

Event-B Agent:迈向LLM代理的正式模型综合与修复

Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

专题命中 Agent评测 :agent(title,title_cn);分类 cs.SE

AI总结 本文提出Event-B Agent,一种基于LLM的正式模型综合与修复框架,通过自然语言要求构建初始模型并迭代修复和优化,提升模型质量。

Comments accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17634 2026-05-19 cs.CR cs.CL cs.CY 89%

AI Agents May Always Fall for Prompt Injections

AI Agents May Always Fall for Prompt Injections

Sahar Abdelnabi, Eugene Bagdasarian

机构 * ELLIS Institute Tübingen & MPI-IS & Tübingen AI Center(图宾根ELLIS研究所及MPI-IS与图宾根人工智能中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :AI agent(title,title_cn);agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文基于上下文完整性理论重新审视提示注入问题,揭示了现有防御机制的不足,并提出了一种新的评估框架来设计更安全的自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18548 2026-05-19 cs.CL cs.AI 88%

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

STT-Arena:一种更现实的工具使用环境,包含时空动态

Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc.(李汽有限公司) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(summary_cn,abstract);tool-use(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出STT-Arena基准测试,旨在评估大型语言模型在面对时空动态变化时的适应性规划能力,发现现有模型在处理此类动态问题时存在显著不足,并提出改进方法STT-Agent-4B以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16821 2026-05-19 cs.AI 87%

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

多范式代理交互实践:buddyMe框架中生成器-评估器、ReAct循环和对抗性评估的系统分析

Xiaohua Wang, Chao Han, Kai Yu, XiaoLiang Xu, Liang Wang

机构 * BuddyMe Research Team(buddyMe研究团队) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文通过系统分析buddyMe框架中生成器-评估器、ReAct循环和对抗性评估三种代理交互范式,揭示了在实际应用中多范式代理系统的设计挑战与优化策略。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 87%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);tool-use(abstract);分类 cs.SE

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17380 2026-05-19 cs.AI cs.CR cs.LG 86%

ADR: An Agentic Detection System for Enterprise Agentic AI Security

ADR:一种用于企业代理AI安全的代理检测系统

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

机构 * Uber

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。

Comments Accepted at MLSys 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18144 2026-05-19 cs.AI 85%

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

基于证据的前沿映射与代理假设生成在纳米医学中

Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen

机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16436 2026-05-19 cs.CR cs.AI 85%

The End of Trust: How Agentic AI Breaks Security Assumptions

信任的终结:如何代理AI打破安全假设

Osama Zafar, Alexander Nemecek, Erman Ayday

机构 * Dept. of Computer and Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 代理AI打破了传统安全假设,允许高保真的定制欺骗在大众市场层面实现。本文提出'无限冒充者'攻击模型,并探讨从验证行为转向评估行动的安全范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04202 2026-05-19 cs.LG cs.AI cs.CL 85%

ClawArena: Benchmarking AI Agents in Evolving Information Environments

ClawArena:在演化的信息环境中评估AI代理的基准测试

Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR 83%

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14271 2026-05-19 cs.CL cs.CY 83%

Auditing Agent Harness Safety

审查代理安全

Chengzhi Liu, Yichen Guo, Yepeng Liu, Yuzhe Yang, Qianqi Yan, Xuandong Zhao, Wenyue Hua, Sheng Liu, Sharon Li, Yuheng Bu, Xin Eric Wang

机构 * UCB(加州大学伯克利分校) WISC(威斯康星大学) STANFORD(斯坦福大学) MSR1(微软研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出HarnessAudit框架,用于审查执行轨迹中的边界合规性、执行保真度和系统稳定性,揭示多代理Harness中的安全风险,并通过HarnessAudit-Bench验证了安全风险与轨迹长度、领域和代理角色的关系。

Comments 11 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 83%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16282 2026-05-19 cs.CY cs.AI 83%

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents

AI代理安全基准的分类与一致性分析

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Heba Ismail, Farkhund Iqbal

机构 * McGill University(麦吉尔大学) Kean University(凯恩大学) Zayed University(扎耶德大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文分析了AI代理安全基准的分类与一致性问题,揭示了方法学选择对安全结论的影响,指出基准选择可能导致矛盾的安全结论,且指标碎片化限制了比较。

详情

展开后加载摘要…

URL PDF HTML 收藏