arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2606.03980 2026-06-03 cs.LG cs.CL 81%

Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

Skill-RM: 通过智能体技能统一异构评估标准

Tao Chen, Gangwei Jiang, Pengyu Cheng, Siyuan Huang, Yihao Liu, Jingwei Ni, Jiaqi Guo, Mengyu Zhou, Kai Tang, Junling Liu, Qinliang Su, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义千问大模型应用团队,阿里巴巴) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) ETH Zürich University of Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL、cs.LG

AI总结 提出Skill-RM框架,将奖励建模重构为可重用的奖励评估技能执行,通过动态选择和聚合证据统一异构评估标准,在奖励基准和下游任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15229 2026-06-02 cs.SE cs.AI 81%

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

PBT-Bench:基于属性测试的AI智能体基准

Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Beneficial AI Foundation(有益人工智能基金会)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27984 2026-05-28 cs.CL cs.AI 81%

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KVoiceBench, KOpenAudioBench 和 KMMAU:用于评估语音语言模型的智能体驱动的韩语语音基准

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee

机构 * KRAFTON Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对语音语言模型评估中英语中心化的问题,提出两种智能体驱动的基准构建框架,构建并发布了三个韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),通过评估八个最新模型揭示了英语-韩语性能差距和不同任务间的互补性弱点。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26731 2026-05-27 cs.AI cs.CL 81%

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

不是能力问题:LLM 智能体层级间的驾驭敏感性非单调

Yong-eun Cho

机构 * KailosLab(凯罗斯实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 通过 432 次实验,发现 LLM 智能体的驾驭敏感性随模型层级非单调变化,且依赖模型类型(聊天 vs. 推理),推翻了“更高能力模型需要更少结构指导”的假设。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22634 2026-05-26 cs.SE cs.AI 81%

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

合同技能:面向企业AI代理的GovernSpec设计框架

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出一种基于GovernSpec的合同技能设计框架,通过组织SKILL.md文件为可读任务合同,明确任务意图、边界和验收标准,实验表明该框架能提升生成质量并降低关键错误率。

Comments 15 pages, 5 figures, 4 tables. v2 adds a public-skill A/B study, updates experimental results, and adds a public replication package link: AGI/contractual-skill" target="_blank" rel="noopener">https://github.com/SymbolicLight-AGI/contractual-skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24279 2026-05-26 cs.CL cs.SE 81%

ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions

ContextEcho: 长智能编码会话中角色漂移的基准测试

Xianzhong Ding, Yangyang Yu, Changwei Liu, Bill Zhao

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.SE

AI总结 提出ContextEcho基准测试,通过25探针身份套件和快照-探针协议,测量部署规模下长编码会话中语言模型角色漂移的普遍性、压缩影响及下游效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 81%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03674 2026-05-22 cs.CL cs.AI 81%

STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking

STRUCTSENSE:一种任务无关的代理框架,用于结构化信息提取,具有人机协同评估和基准测试

Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, Cambridge, MA, USA(麦戈文脑科学研究所,麻省理工学院,马萨诸塞州剑桥市) Fylo Labs Inc., New York, NY, USA(Fylo实验室公司,纽约州纽约市) Allen Institute for Brain Science, Seattle, WA, USA(艾伦脑科学研究所,华盛顿州西雅图市)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出STRUCTSENSE框架,通过整合本体引导的符号知识、代理自我评估细化和人机协同验证,实现了结构化信息提取的鲁棒性,并在三个领域展示了其跨任务泛化能力。

Comments -

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19351 2026-05-20 cs.MA cs.AI cs.CL 81%

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

PAVE:生成代理社会中的合法违规认知架构

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) University of Calgary(卡尔加里大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PAVE认知架构,通过四个模块处理生成代理在需要违规的场景中的推理问题,实现了合法违规、对权威的服从、有限的范围和恢复四个特性,同时提高了决策的结构化和可解释性。

Comments Preprint. 23 pages, 4 figures. Code and environment will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19099 2026-05-20 cs.AI cs.CL cs.MA 81%

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

机构 * OpenMesh AI University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。

Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17169 2026-05-19 cs.AI cs.CL cs.MA 81%

Responsible Agentic AI Requires Explicit Provenance

负责任的代理AI需要明确的来源

Jinwei Hu, Xinmiao Huang, Qisong He, Youcheng Sun, Yi Dong, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利兹大学计算机科学与信息学学院) Department of Computer Science, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学计算机科学系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了代理AI中责任归属的问题,指出需要在整个代理生命周期中明确来源,以使责任可计算和可执行,提出了通过因果归因函数和责任张量来形式化所需信息,并通过初步实验验证了在线估计和干预的可能性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12824 2026-05-19 cs.MA cs.AI cs.CL cs.CY 81%

Mechanism Plausibility in Generative Agent-Based Modeling

生成基于代理的建模中的机制合理性

Patrick Zhao, David Huu Pham, Nicholas Vincent

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出机制合理性量表,区分生成充分性与机制合理性,探讨生成式代理模型的生成能力与解释能力。

Comments Accepted at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 81%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15664 2026-05-13 cs.LG cs.AI 81%

Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints

Stargazer:一种可扩展的AI代理在天体物理约束下的模型拟合基准环境

Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin, Kristen Menou

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 Stargazer通过120个任务评估AI代理在动态物理约束下的模型拟合能力,揭示了数值优化与物理约束间的差距,并提供了可扩展的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 81%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI 81%

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 81%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20087 2026-04-23 cs.CL cs.LG 81%

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19767 2026-04-23 cs.LG cs.AI 81%

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

通过投机解码加速PayPal的商业代理:基于EAGLE3的实证研究,使用微调的Nemotron模型

Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

机构 * PayPal

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过EAGLE3进行投机解码优化PayPal商业代理的性能,使用微调的Nemotron模型,在不同配置下验证了吞吐量和延迟的提升,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00451 2026-04-22 cs.LG cs.AI cs.DS cs.IT math.IT stat.ML 81%

Best Agent Identification for General Game Playing

多任务领域中最佳代理的识别

Matthew Stephenson, Alex Newcombe, Eric Piette, Dennis Soemers

机构 * College of Science and Engineering, Flinders University, Adelaide, South Australia, Australia(科学与工程学院,弗林德斯大学,阿德莱德,澳大利亚,南澳大利亚州) Information and Communication Technologies, Electronics, and Applied Mathematics Institute, UCLouvain, Louvain-la-Neuve, Belgium(信息与通信技术、电子学和应用数学研究所,UCLouvain,洛林-拉-纽夫,比利时) Department of Advanced Computing Sciences, Maastricht University, Maastricht, the Netherlands(高级计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效通用方法,通过多臂老虎机中的最佳臂识别问题,确定多任务领域中表现最佳的算法。在GVGAI和Ludii框架上验证,相比传统方法,显著降低简单遗憾和错误概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16385 2026-04-21 cs.SE cs.AI 81%

StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability

StressWeb: 一个用于评估网络代理在现实交互变异下的鲁棒性的诊断基准

Haoyue Bai, Dong Wang, Long Chen, Bingguang Hao, Pengyang Shao, Yonghui Yang, Yicheng He, Chenyi Zhuang

机构 * Inclusion AI, Ant Group(Inclusion AI,蚂蚁集团) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出StressWeb基准,通过构建可控的网络环境和引入结构化扰动,评估网络代理在现实交互中的鲁棒性,揭示隐藏的失败模式和鲁棒性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 81%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13954 2026-04-16 cs.LG cs.AI 81%

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

HINTBench:地平线代理内在非攻击轨迹基准

Jiacheng Wang, Jinchang Hou, Fabian Wang, Ping Jian, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究内在风险审计,提出HINTBench基准,包含629条轨迹,评估风险检测、风险步定位和内在故障识别,发现强LLM在风险步定位上表现差,揭示内在风险审计的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18436 2026-04-16 cs.OS cs.AI cs.FL cs.SE 81%

VeruSAGE: A Study of Agent-Based Verification for Rust Systems

VeruSAGE:Rust系统代理验证的研究

Chenyuan Yang, Natalie Neamtu, Chris Hawblitzel, Jacob R. Lorch, Shan Lu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM在Rust系统验证中的能力,提出VeruSAGE-Bench基准测试集,并设计不同代理系统以匹配不同LLM的特性,结果显示最佳组合能完成超过80%的验证任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 81%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09579 2026-04-14 cs.AI cs.SE 81%

Help Without Being Asked: A Deployed Proactive Agent System for On-Call Support with Continuous Self-Improvement

无需被要求的帮助:一个用于轮班支持的主动代理系统,具备持续自我改进

Fengrui Liu, Xiao He, Tieying Zhang

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出Vigil系统,通过主动提供帮助减少人工支持负担,持续学习提升能力,已在Volcano Engine部署超过十个月,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02360 2026-04-09 cs.NI cs.AI cs.CY cs.ET cs.LG 81%

Fighting AI with AI: AI-Agent Augmented DNS Blocking of LLM Services during Student Evaluations

用AI对抗AI:AI代理增强的DNS阻断LLM服务以应对学生评估

Yonas Kassa, James Bonacci, Ping Wang

机构 * School of Data Intelligence and Technology, Robert Morris University(罗伯特莫里斯大学数据智能与技术学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI-Sinkhole框架,利用AI代理和DNS阻断动态阻止考试期间出现的LLM聊天服务,通过量化LLM实现可解释分类,提升学术严谨性。

Comments accepted at ITNG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00842 2026-04-02 cs.AI cs.LG cs.MA 81%

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

主动代理研究环境:模拟活跃用户以评估主动助手

Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Apple, USA(苹果公司(美国)) University of Washington(华盛顿大学) Independent Researcher, USA(独立研究员(美国))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pare框架,通过状态机模拟用户交互,构建并评估主动代理,同时引入Pare-Bench基准测试143种不同任务,测试上下文感知、目标推理和多应用协调能力。

Comments 34 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00477 2026-04-02 cs.AI cs.CL cs.HC cs.MA 81%

Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation

对数评分,幂律发现:在基于代理的评估中区分测量与覆盖

HyunJoon Jung, William Na

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文通过960次实验展示基于代理的评估在Turing式验证中与人类评分无差异,发现评分与独特问题发现之间存在对数与幂律的分离,揭示了发现空间的幂律分布特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19837 2026-04-02 cs.AI cs.LG 81%

Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent

Björn Hoppmann, Christoph Scholz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏