arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-20 至 2026-05-20 共收录 210 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 11 篇

2605.19206 2026-05-20 cs.RO 50%

CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation

CLUE: 通过利用统一语义地图实现适应性优先级上下文线索

Taeyun Kim, Alvin Jinsung Choi, Dasol Hong, Hyun Myung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 CLUE通过利用统一语义地图,采用适应性优先级上下文线索的方法,有效解决零样本物体-目标导航问题,提高了导航的鲁棒性和效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01418 2026-05-20 cs.RO cs.CV 50%

SEMNAV: Enhancing Visual Semantic Navigation in Robotics through Semantic Segmentation

SEMNAV: 通过语义分割增强机器人中的视觉语义导航

Rafael Flor-Rodríguez, Carlos Gutiérrez-Álvarez, Francisco Javier Acevedo-Rodríguez, Sergio Lafuente-Arroyo, Roberto J. López-Sastre

机构 * University of Alcalá(阿尔卡萨大学) CAM-UAH Ministry of Science and Innovation of Spain(西班牙科学与创新部)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SEMNAV,一种利用语义分割作为环境主要视觉输入表示的方法,以增强机器人代理的感知和决策能力,通过引入高层面的语义信息,提升模型在未知环境中的泛化能力,并引入SEMNAV数据集进行训练。

Journal ref Applied Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 11 篇

2605.19988 2026-05-20 cs.SE cs.AI cs.DB cs.PF 76%

A Case for Agentic Tuning: From Documentation to Action in PostgreSQL

为代理调优辩护:从文档到PostgreSQL中的行动

Hongyu Lin, Mingyu Li, Weichen Zhang, Yihang Lou, Mingjie Xing, Yanjun Wu, Haibo Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Beihang University(北航) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出通过动态行动替代静态文档进行系统调优,引入PerfEvolve工具,利用LLM代理实现版本一致性验证、工作负载特定分析和多参数联合优化,实验表明其在PostgreSQL上比现有文档驱动调优方法提升35.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19077 2026-05-20 cs.CL cs.AI 76%

ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking

ReacTOD:用于零样本对话状态跟踪的受限神经符号代理NLU

Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

机构 * Amazon(亚马逊)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI、cs.CL

AI总结 该研究提出ReacTOD,一种受限神经符号架构,通过在自我纠正的ReAct循环中将NLU重新表述为离散工具调用来解决零样本对话状态跟踪问题,其核心方法是确定性验证,主要贡献是实现了新的零样本状态-of-the-art结果。

Comments Accepted at TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19952 2026-05-20 cs.CL 74%

Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory

重新思考如何记忆:超越原子事实的终身LLM代理记忆

Jingwei Sun, Jianing Zhu, Jiangchao Yao, Tongliang Liu, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 实验组) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Sydney AI Center, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 记忆与上下文管理 :agent(title);分类 cs.CL

AI总结 本文提出TriMem,一种能够维护三种共存表示粒度的内存系统,通过保留原始对话片段、提取原子事实以及合成轮廓来实现对积累对话历史的忠实存储、高效检索和深度推理,从而克服现有方法在细节丢失和推理能力不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18930 2026-05-20 cs.CR cs.AI cs.LG 73%

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

OEP: 通过局部正确但不可转移的经验污染自演化LLM代理

Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了通过局部正确但不可转移的经验污染自演化LLM代理的安全风险,提出OEP攻击方法,利用低权限黑盒攻击在无需直接控制系统提示或记忆数据库的情况下诱导有害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18813 2026-05-20 cs.LG cs.AI 62%

Composition of Memory Experts for Diffusion World Models

记忆专家的组合用于扩散世界模型

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Computer Vision Group(计算机视觉组) Department of Computer Science(计算机科学系) University of Bern(伯恩大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于扩散的世界模型框架,通过组合专门化的记忆专家来解决记忆与效率之间的权衡问题,提升了时间一致性、过去观察的回忆和导航性能。

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 57%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18890 2026-05-20 physics.soc-ph cs.AI cs.CY cs.MA 57%

Stop Drawing Scientific Claims from LLM Social Simulations Without Robustness Audits

不要在没有充分鲁棒性审计的情况下从LLM社会模拟中绘制科学结论

Jinyi Ye, Lei Cao, Ding Chen, Emilio Ferrara

机构 * Thomas Lord Department of Computer Science, University of Southern California(美国南加州大学计算机科学系汤姆·劳德部门) Marshall School of Business, University of Southern California(美国南加州大学马歇尔商学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文研究了从LLM社会模拟中得出的科学结论不应强于支持它们的鲁棒性审计,通过两个案例研究展示了小扰动如何影响模拟结果,并提出TRAILS框架以规范鲁棒性审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18842 2026-05-20 cs.LG 57%

Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

在非平稳环境下通过自适应安全约束实现安全的持续强化学习

Timofey Tomashevskiy

机构 * McMaster Centre for Software Certification(麦斯特软件认证中心) Department of Computing and Software(计算与软件系) McMaster University(麦斯特大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种结合三种自适应安全机制的框架,用于在非平稳环境下实现安全的持续强化学习,通过自适应约束机制减少分布偏移下的安全违规,同时保持任务性能。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19967 2026-05-20 eess.SY cs.SY 50%

Safe Deep Reinforcement Learning for Spacecraft Reorientation with Pointing Keep-Out Constraint

具有指向保持区约束的空间飞行器再定向的安全深度强化学习

Juntang Yang, Mohamed Khalil Ben-Larbi

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种用于具有单一指向保持区的空间飞行器再定向控制的深度强化学习方法,设计了新的状态空间表示,制定了奖励函数以实现控制目标并施加姿态约束,采用软演员评论家算法处理连续状态和动作空间,并通过课程学习方法训练智能体,通过基于控制屏障函数的安全过滤器保证姿态约束的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19134 2026-05-20 eess.SY cs.SY 50%

Continuous Aggregative LQG Games with Delayed Discrete Observations

具有延迟离散观测的连续聚集线性二次博弈

Farid Rajabali, Roland Malhame, Sadegh Bolouki

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了在延迟离散观测条件下,连续聚集线性二次博弈中的纳什均衡存在性及延迟观测对成本的影响。

Comments 11 pages, 3 figures. Submitted to Automatica

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18779 2026-05-20 physics.soc-ph cs.GT econ.TH 50%

Achieving Generational Peace in Mali through Intergenerational Mean-Field-Type Game-based Incentives

通过代际均场型博弈激励实现马里世代和平

Hamidou Tembine

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一个代际均场型博弈模型,研究马里及邻国多主体冲突生态系统,揭示代际报复型行为如何导致暴力持续传承,并通过代际兼容的激励机制推动系统性缓和。

Comments Presented at IA Mali 2025. At CSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 42 篇

2601.22569 2026-05-20 cs.CR cs.AI 91%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19779 2026-05-20 cs.AI cs.LG 90%

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

无分布不确定性量化用于连续AI代理评估

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。

Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18935 2026-05-20 econ.EM 89%

The Agentic Economy: Humans, AI Agents, Robots, and the Measurable Transition toward Distributed Economic Action

代理经济:人类、AI代理、机器人以及向分布式经济行动的可测量转型

Davit Gondauri, Mikheil Batiashvili

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract)

AI总结 本文提出代理经济的概念,并探讨其可测量的先决条件:经济行动在人类、AI代理、工业机器人、可执行协议、计算基础设施和能源系统之间日益分散。研究指出,传统类别如劳动、资本、企业、市场、生产率和信任仍然必要但不完整。方法上采用概念-实证定量诊断设计,利用公开的AI投资、AI采纳、机器人安装和运营库存、数据中心电力需求以及劳动力市场再分配数据。结果表明,AI采纳加速,AI投资信号广泛资本分配,工业机器人代表持续的网络物理行动能力,计算扩展增加数据中心电力压力,劳动力预测更一致于任务再分配而非劳动力消失。本文贡献了一个连接模型/软件代理能力、机器人能力、计算-能源耦合、协议化、可审计信任和人类主权的行动能力框架。结论是代理经济尚未成为全球秩序,但其转型压力足以要求独特的经济词汇、可重复的诊断和未来行业层面的测量。

Comments 52 pages, 5 figures, 16 tables, 8 algorithms. Original conceptual-empirical diagnostic article

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14102 2026-05-20 cs.AI 87%

ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation

ChromaFlow: 一种关于在工具增强代理评估中编排开销的负消融研究

Tarun Mittal

机构 * Octave-X

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);tool use(abstract);planning(abstract)

AI总结 该研究通过ChromaFlow框架分析了在工具增强自主推理中编排开销的影响,发现更激进的编排并未提升整体性能,反而增加了操作噪声,并强调了编排升级、确定性提取、证据协调、提供者健康门控和显式运行门控等作为可靠自主代理评估的第一要求。

Comments 12 pages, 6 tables, 1 figure. Updated with follow-up strict-provider full-Level-1 diagnostic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19410 2026-05-20 cs.CV 87%

Vision Harnessing Agent for Open Ad-hoc Segmentation

用于开放即兴分割的视觉引导代理

Zilin Wang, Stella X. Yu

机构 * University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19149 2026-05-20 cs.CL cs.CR 85%

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Rishi Jha, Harold Triedman, Arkaprabha Bhattacharya, Vitaly Shmatikov

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.CL

AI总结 研究探讨了代理在遇到错误时可能发生意外崩溃现象,通过实验发现64.7%的代理在遇到模拟错误时会出现不同程度的不安全行为,且这些行为未被现有安全标准所覆盖。

Comments 32 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19194 2026-05-20 cs.CL 83%

MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent

MMoA: 一个具有递归性的记忆混合代理框架

Rui Chu

机构 * Rui Chu(楚瑞)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出MMoA框架,通过引入LSTM门控机制,改进了传统混合代理方法在时间依赖性和上下文感知方面的不足,实现了更高效的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03140 2026-05-20 cs.HC cs.AI 83%

How to Model AI Agents as Personas?: Applying the Persona Ecosystem Playground to 41,300 Posts on Moltbook for Behavioral Insights

如何将AI代理建模为身份?:应用Persona生态系统游乐场分析Moltbook上的41,300条帖子以获取行为洞察

Danial Amin, Joni Salminen, Bernard J. Jansen

机构 * University of Vaasa(瓦萨大学) Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,HBKU)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过Persona生态系统游乐场分析Moltbook上的41,300条帖子,利用k均值聚类和检索增强生成技术生成并验证对话身份,揭示了AI代理行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19010 2026-05-20 cs.AI 83%

AgentNLQ: A General-Purpose Agent for Natural Language to SQL

AgentNLQ: 一个通用的自然语言到SQL代理

Olena Bogdanov, Yeunji Jung, Chandra Dhir, Pareekshitreddy Gaddam, Saurabh Jain, Lakshmi Tumati, Vijay Parthasarathy, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出了一种多代理方法,用于改进自然语言到SQL的转换,该方法在BIRD基准测试中实现了78.1%的语义准确率,并通过优化的多代理解决方案、先进的模式增强方法以及跨不同领域和数据集的评估,展示了方法的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19330 2026-05-20 cs.AI cs.LG cs.SE 82%

MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

MOCHA:多目标切比雪夫退火用于智能体技能优化

Md Mehrab Tanjim, Jayakumar Subramanian, Xiang Chen, Branislav Kveton, Subhojyoti Mukherjee, Anlan Zhang, Sungchul Kim, Somdeb Sarkhel, Sunav Choudhury

机构 * Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究提出MOCHA方法,通过切比雪夫标量化和指数退火解决智能体技能优化中的多目标问题,实现更优的帕累托前沿发现和性能提升。

Comments Preprint. 25 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19196 2026-05-20 cs.CL 81%

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

时间到REFLECT:我们能否信任LLM裁判来评估基于证据的研究代理?

Leyao Wang, Yanan He, Peng Chen, Asaf Yehudai, Yixin Liu, Rex Ying, Michal Shmueli-Scheuer, Arman Cohan

机构 * Yale University(耶鲁大学) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出REFLECT基准,用于评估LLM裁判在代理环境中的细粒度失败检测,揭示当前LLM裁判在推理、工具使用和报告质量上的可靠性不足,为构建更可靠的评估流程提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19351 2026-05-20 cs.MA cs.AI cs.CL 81%

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

PAVE:生成代理社会中的合法违规认知架构

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) University of Calgary(卡尔加里大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PAVE认知架构,通过四个模块处理生成代理在需要违规的场景中的推理问题,实现了合法违规、对权威的服从、有限的范围和恢复四个特性,同时提高了决策的结构化和可解释性。

Comments Preprint. 23 pages, 4 figures. Code and environment will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19099 2026-05-20 cs.AI cs.CL cs.MA 81%

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

机构 * OpenMesh AI University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。

Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19668 2026-05-20 cs.CR cs.SE 79%

SCARA: A Semantics-Constrained Autonomous Remediation Agent for Opaque Industrial Software Vulnerabilities

SCARA:一种用于不透明工业软件漏洞的语义约束自主修复代理

Bowei Ning, Xuejun Zong, Lian Lian, Kan He, Guogang Wang, Yifei Sun, Jinyang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SCARA,一种用于不透明工业软件漏洞的语义约束自主修复代理,通过四阶段流水线将二进制漏洞候选连接到条件验证的修复方案,实现了100%的精度和88.9%的修复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 79%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 79%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL 79%

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏