ReLAX: Reinforcement Learning Agent eXplainer for Arbitrary Predictive Models
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
Comments 32 pages, 6 figures, ICLR 2023
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
Comments 33 pages
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
Comments This paper was published In Proceeding of NeurIPS 2022
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
Comments The Second International Conference on AIML Systems, October 12--15, 2022, Bangalore, India
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
Comments ACL 2022 Insights Workshop (6 pages)
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
Comments 7 pages, 3 figures, 3 Tables. Accepted to be presented at COLING 2020 conference: https://coling2020.org/pages/accepted_papers_industry_track
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG
Comments Deep Reinforcement Learning Symposium, NIPS 2017
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL
Comments 10 pages. In Proceedings of Conference on Human Computation & Crowdsourcing (HCOMP 2016), 2016, Austin, TX, USA
小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型
专题命中 Agent评测 :agentic(title,comments);分类 cs.AI
AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。
Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks
专题命中 Agent评测 :agent(title,comments);分类 cs.LG
Comments The main results in this draft have been subsumed by our later paper "Persuading a Learning Agent"
专题命中 Agent评测 :agent(title);分类 cs.LG;autonomous agent(comments)
Comments -Updated to the most recent and completed version (to be presented at AAMAS 2015) -Updated author list. in Autonomous Agents and Multiagent Systems (AAMAS) 2015, Istanbul, Turkey, May 2015
专题命中 Agent评测 :agent(title);分类 cs.CL;autonomous agent(journal_ref)
Comments 10 pages, uses aaai.sty, lingmacros.sty, psfig.sty
Journal ref Proceedings of the First International Conference on Autonomous Agents, Marina del Rey, California, USA. 1997. pp 96-105
工具可及性对LLM代理安全对齐的因果影响
机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) ; Harvard Medical School(哈佛医学院) ; Clark University(克拉克大学) ; Harvard University(哈佛大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。
连贯性更弱,互惠性更弱:对比Moltbook与Reddit的语义及社交组织
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)
AI总结 该研究对比AI智能体社交网络Moltbook与早期Reddit,发现Reddit在语义连贯性、多样性及交互互惠性上更优,且未被Moltbook复现。
VICBench:一个用于代码漏洞检测的多语言基准测试集
专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本研究构建了多语言代码漏洞检测基准VICBench,包含100个CVE对应的VIC,规模显著大于现有数据集,经评估现有漏洞检测算法性能有限,该基准可用于可靠评估漏洞检测方法。
评估自主编程代理中的计划合规性
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(IBM公司)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。
HarnessOpt-Bench:评估大型语言模型的 harness 优化能力
机构 * Scale AI
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
Nautilus:从一个提示到即插即用的机器人学习
机构 * TU Darmstadt(图宾根大学) ; KIT(卡尔斯鲁厄理工学院) ; FZI(弗劳恩霍夫研究所) ; Robotics Institute Germany(德国机器人研究所) ; Honda Research Institute Europe(本田欧洲研究院)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)
AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。
教它停止,而不仅仅是点击
机构 * Cabal AI ; Para AI
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。
Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source
用于受约束智能体的集合转移行为测试
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。
超越黑盒混淆:白盒监测器的机制分析与防御
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。
具有通用交互的无限世界
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)
AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。
Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2
ResearchClawBench: 端到端自主科学研究基准
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。
TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。
Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com
GMO-E$^2$DIT:面向电商图像的接地多操作编辑
机构 * Wuhan University(武汉大学) ; Xi’an Jiaotong University(西安交通大学) ; Sun Yat-sen University(中山大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)
AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。
LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试
机构 * Samsung Research(三星研究院) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学) ; City University of Hong Kong(香港城市大学)
专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。