arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-17 至 2026-06-17 共收录 153 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 15 篇

2606.17223 2026-06-17 cs.CR 新提交 50%

Safety, Security, and Cognitive Risks in Neuro-Symbolic AI

神经符号AI中的安全性、安全性和认知风险

Manoj Parmar

专题命中 工作流自动化 :agentic(abstract)

AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。

Comments 28 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17907 2026-06-17 quant-ph 新提交 50%

SPICE-Q and Large-Scale Quantum Chip Production

SPICE-Q 与大规模量子芯片生产

Cai, Ling Qiao, Bin Yang, Fumin Luo, Chang Liu, WeiGui Guo, GuoRong Zhang, XueFei Liu, Qinglang Guo, Bin Wu

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出SPICE-Q框架,通过统一数据链连接超导量子处理器设计中的工艺、电磁仿真、电路量化、噪声分析和制造反馈,实现工程化工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23351 2026-06-17 physics.app-ph cond-mat.mtrl-sci 50%

Laser-Enhanced Contact Optimization in Silicon Photovoltaics: Mechanisms, Reliability, and Predictive Process Design

硅光伏中的激光增强接触优化:机制、可靠性与预测工艺设计

Donald Intal, Abasifreke U. Ebong

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文研究了激光增强接触优化在硅光伏中的机制与可靠性,提出预测性工艺设计方法,通过耦合多物理场过程提升电池效率和稳定性。

Journal ref Renewable and Sustainable Energy Reviews, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20738 2026-06-17 physics.comp-ph 50%

A Novel NPT Thermodynamic Integration Scheme to Derive Rigorous Gibbs Free Energies for Crystalline Solids

一种新颖的NPT热力学积分方案用于推导晶体固体的严格吉布斯自由能

Karel L. K. De Witte, Tom Braeckevelt, Massimo Bocus, Sander Vandenhaute, Veronique Van Speybroeck

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种基于NPT体系的热力学积分方法,通过改进参考体系实现对晶体固体吉布斯自由能的精确计算,方法在计算效率和准确性上均优于传统方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 9 篇

2606.16534 2026-06-17 cs.DC 新提交 85%

Generated, Parallel, Scalable? A Study of Agentic AI-Generated Julia Code on Supercomputers

生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究

Linus Bantel, Anna-Lena Roth, Jonas Posner, Dirk Pflüger

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16287 2026-06-17 cs.CR 新提交 82%

Dynamic Malicious Skills in Agentic AI

智能体AI中的动态恶意技能

Tianhao Chen, Zhengyuan Jiang, Yuepeng Hu, Yebei Gou, Neil Zhenqiang Gong

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究智能体AI中通过自然语言文档注入恶意指令实现动态恶意技能的攻击方法,并提出基于操作系统内核只读挂载的系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 81%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 软件智能体 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18168 2026-06-17 cs.SE cs.AI 新提交 81%

All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code

全是烟雾,没有警报:智能体编写的测试代码中的Oracle信号

Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

机构 * Dipayan Banik(迪帕扬·班克) Kowshik Chowdhury(克什基·乔乌德里) Shazibul Islam Shamim(沙齐布·伊斯兰·沙米)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能体编写的测试代码中Oracle信号的存在情况,发现80.2%的测试补丁缺乏强Oracle信号,但强Oracle与合并可能性显著正相关(OR=1.28)。

Comments Accepted at the 8th IEEE International Conference on Artificial Intelligence Testing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17076 2026-06-17 physics.ao-ph cs.AI 新提交 79%

CMIP-Forge: An Agentic System that Retrieves, Computes, and Self-Reviews Climate Science

CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统

Dmitrii Pantiukhin, Boris Shapkin, Ivan Kuznetsov, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。

Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-06-17 cs.CL 新提交 70%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03045 2026-06-17 cs.LG 版本更新 70%

Clarify Before You Draw: Proactive Agents for Robust Text-to-CAD Generation

先澄清再绘制:面向鲁棒文本到CAD生成的主动式智能体

Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 提出主动式智能体框架ProCAD,通过澄清代理在代码生成前解决用户提示中的歧义,再通过CAD编码代理生成可执行程序,显著提升鲁棒性,平均Chamfer距离降低79.9%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 67%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17058 2026-06-17 cs.DC 新提交 50%

Evaluating LLM Coding Agents on SZ-Family Lossy Compression Across Architectures

评估LLM编码代理在不同架构上的SZ系列有损压缩

Changqing Li, Shouwei Gao, Kai Zhao, Sheng Di, Wenqian Dong

专题命中 软件智能体 :agent(abstract)

AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。

Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 3 篇

2606.18235 2026-06-17 cs.AI 新提交 57%

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17929 2026-06-17 cs.AI 新提交 57%

PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

PreAct:在重复任务上加速的计算机使用代理

Bojie Li

机构 * Pine AI

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12666 2026-06-17 cs.CR cs.AI 新提交 57%

CAPED: Context-Aware Privacy Exposure Defense for Mobile GUI Agents

CAPED:面向移动GUI代理的上下文感知隐私暴露防御

Siyu Shen, Fenghao Xu, Wenrui Diao, Kehuan Zhang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对移动GUI代理截图上传导致的附带视觉隐私暴露问题,提出上下文感知的预上传暴露控制层CAPED,通过任务需求提取、屏幕上下文隐私先验和UI元素解析,选择性暴露任务所需内容,在保持高任务效用的同时显著降低隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 10 篇

2606.15903 2026-06-17 cs.CL cs.AI 新提交 81%

Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations

控制平面放置塑造遗忘:跨十三种系统配置的智能体记忆架构研究

Dongxu Yang

机构 * DeepLethe

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究LLM在智能体记忆管道中的位置(控制平面 vs 召回平面)对遗忘失败模式的影响,通过13种配置在385例对抗测试集上的实验,揭示了三种放置机制的互补覆盖范围,并提出了ForgetEval评估套件。

Comments 25 pages including appendices. Code, benchmark, and adapters released under MIT at https://github.com/deeplethe/lethe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17162 2026-06-17 cs.CL cs.HC cs.MA 新提交 74%

MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision

MemSlides:一种用于个性化幻灯片生成与多轮局部修订的层次化记忆驱动智能体框架

Ye Jin, Yangyang Xu, Jun Zhu, Yibo Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agent(title);分类 cs.CL

AI总结 提出MemSlides层次化记忆框架,通过分离长期记忆(用户画像和工具记忆)与工作记忆,结合局部修订机制,实现个性化幻灯片生成中的用户偏好保持、多轮修订和可靠局部编辑。

Comments Code, website, project page, and video are linked in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交 71%

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

专题命中 记忆与上下文管理 :planning(title)

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19838 2026-06-17 cs.AI cs.CL cs.LG 版本更新 67%

Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory

Branch-and-Browse:具有树状推理与动作记忆的高效可控网页探索

Shiqi He, Yue Cui, Xinyu Ma, Yaliang Li, Bolin Ding, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) Alibaba Group(阿里巴巴集团) McMaster University(麦马斯特大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Branch-and-Browse框架,通过树状结构化推理、网页状态重放和页面动作记忆,实现LLM网页代理的高效可控多分支探索,在WebArena上成功率35.8%,执行时间降低40.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17398 2026-06-17 cs.CR cs.AI cs.SE 新提交 62%

SoK: AI-Augmented Binary Reversing

SoK: AI增强的二进制逆向工程

Yujeong Kwon, Yiyue Zhang, Shakhzod Yuldoshkhujaev, Kexin Pei, Dokyung Song, Hyungjoon Koo

机构 * Sungkyunkwan University(成均馆大学) The University of Chicago(芝加哥大学) Yonsei University(延世大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 系统化梳理AI增强二进制逆向工程领域,提出统一分类法涵盖传统与AI方法,揭示LLM和智能体AI的新角色,识别技术挑战与评估缺口。

Comments 20 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11837 2026-06-17 cs.CL cs.AI 版本更新 62%

EmoFSM: A Finite State Machine for Emotional Support Conversation

EmoFSM:一种用于情感支持对话的有限状态机

Yue Zhao, Qingqing Gu, Xiaoyu Wang, Teng Chen, Zhonglin Jiang, Yong Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。

Comments 15 pages, 4 figures. PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17767 2026-06-17 cs.HC cs.AI 新提交 57%

Talking to Your Data: Exploring Embodied Conversation as an Interface for Personal Health Reflection

与你的数据对话:探索具身对话作为个人健康反思的界面

Nikola Kovacevic, Bastien Husler, Di Zhuang, Rafael Wampfler, Barbara Solenthaler

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出一种通过具身对话代理与可穿戴健康数据交互的新范式,采用双代理设计(观察者提取统计特征,呈现者以“口语化统计”沟通),通过模拟自我用户研究(N=5)与传统仪表盘对比,评估感知理解、行动具体性和认知转变。

Journal ref Joint Proceedings of the ACM Intelligent User Interfaces (IUI) Workshops 2026, Paphos, Cyprus, July 13-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17939 2026-06-17 stat.AP stat.ML 新提交 50%

Understanding Long-Term Dynamics of Individual Metro Usage: A Hidden Semi-Markov State Framework with Survival Analysis

理解个体地铁使用的长期动态:基于生存分析的隐半马尔可夫状态框架

Bingxun Wang, Valeria Maria Urbano, Shan He, Yang Chen, Wei Liu, Zhibin Jiang, Piercesare Secchi

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出融合隐半马尔可夫模型与离散时间生存分析的框架,利用上海地铁四年刷卡数据识别五种可解释的出行状态及其转移层次,揭示退出风险与状态相关但独立于时长,而重返风险随不活跃时长急剧衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18180 2026-06-17 cs.CV 新提交 50%

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

EgoCS-400K:面向世界模型的自我中心游戏数据集

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12556 2026-06-17 cs.DC 新提交 50%

ITME: Inference Tiered Memory Expansion with Disaggregated CXL-Hybrid Memories

ITME:基于解耦CXL混合内存的分层推理内存扩展

Hakbeom Jang, Younghoon Min, Sunwoong Kim, Taeyoung Ahn, Hanyee Kim, Youngpyo Joo, Hoshik Kim, Jongryool Kim

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 针对大语言模型推理中TB级上下文状态的内存瓶颈,提出ITME架构,利用CXL混合内存实现字节可寻址的远程内存扩展,通过确定性访问模式优化数据移动,提升吞吐量达35.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 35 篇

2605.12729 2026-06-17 cs.NI cs.AI cs.CR 版本更新 89%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 49 pages, 15 figures, 6 tables; survey article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新 85%

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17819 2026-06-17 cs.SE cs.AI cs.CL 新提交 82%

A Framework for Evaluating Agentic Skills at Scale

大规模评估智能体技能的框架

Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

机构 * Tessl London United Kingdom(伦敦英国Tessl)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出一个评估框架,通过构建真实任务和评分标准,大规模评估500个真实技能在19种智能体模型上的表现,发现模型对技能指令的遵循程度差异显著,且技能显著改变模型行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17519 2026-06-17 cs.CL cs.AI 新提交 81%

Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery

扩展企业智能体路由:退化、诊断与恢复

Kellen Gillespie, Robyn Perry

机构 * Superhuman, Inc.(Superhuman公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究企业助手工具库扩展时路由准确率下降问题,通过嵌入预选恢复F1分数10-17个百分点。

Comments 10 pages (6 main + 4 appendix), 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏