arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2110.11960 2023-08-10 cs.LG cs.AI 76%

ReLAX: Reinforcement Learning Agent eXplainer for Arbitrary Predictive Models

Ziheng Chen, Fabrizio Silvestri, Jia Wang, He Zhu, Hongshik Ahn, Gabriele Tolomei

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11010 2023-03-01 cs.LG cs.AI stat.ML 76%

Agent-based Graph Neural Networks

Karolis Martinkus, Pál András Papp, Benedikt Schesch, Roger Wattenhofer

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 32 pages, 6 figures, ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12623 2023-02-27 cs.AI cs.CL 76%

TUTORING: Instruction-Grounded Conversational Agent for Language Learners

Hyungjoo Chae, Minjin Kim, Chaehyeong Kim, Wonseok Jeong, Hyejoong Kim, Junmyung Lee, Jinyoung Yeo

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13442 2023-02-21 cs.LG cs.AI stat.ML 76%

Scaling laws for single-agent reinforcement learning

Jacob Hilton, Jie Tang, John Schulman

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07640 2023-01-04 cs.GT cs.AI cs.LG cs.MA 76%

How and Why to Manipulate Your Own Agent: On the Incentives of Users of Learning Agents

Yoav Kolumbus, Noam Nisan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments This paper was published In Proceeding of NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04603 2022-12-12 cs.LG cs.AI 76%

System Design for an Integrated Lifelong Reinforcement Learning Agent for Real-Time Strategy Games

Indranil Sur, Zachary Daniels, Abrar Rahman, Kamil Faber, Gianmarco J. Gallardo, Tyler L. Hayes, Cameron E. Taylor, Mustafa Burak Gurbuz, James Smith, Sahana Joshi, Nathalie Japkowicz, Michael Baron, Zsolt Kira, Christopher Kanan, Roberto Corizzo, Ajay Divakaran, Michael Piacentino, Jesse Hostetler, Aswin Raghavan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments The Second International Conference on AIML Systems, October 12--15, 2022, Bangalore, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09249 2022-05-20 cs.CL cs.AI cs.CV cs.RO 76%

On the Limits of Evaluating Embodied Agent Model Generalization Using Validation Sets

Hyounghun Kim, Aishwarya Padmakumar, Di Jin, Mohit Bansal, Dilek Hakkani-Tur

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments ACL 2022 Insights Workshop (6 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03864 2020-12-08 cs.CL cs.AI 76%

Evaluating Cross-Lingual Transfer Learning Approaches in Multilingual Conversational Agent Models

Lizhen Tan, Olga Golovneva

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 7 pages, 3 figures, 3 Tables. Accepted to be presented at COLING 2020 conference: https://coling2020.org/pages/accepted_papers_industry_track

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13291 2020-04-29 cs.AI cs.LG cs.NE 76%

Evaluating the Rainbow DQN Agent in Hanabi with Unseen Partners

Rodrigo Canaan, Xianbo Gao, Youjin Chung, Julian Togelius, Andy Nealen, Stefan Menzel

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07676 2017-11-22 cs.LG cs.AI stat.ML 76%

Transferring Agent Behaviors from Videos via Motion GANs

Ashley D. Edwards, Charles L. Isbell

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments Deep Reinforcement Learning Symposium, NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.03044 2017-08-11 cs.HC cs.AI cs.CL 76%

"Is there anything else I can help you with?": Challenges in Deploying an On-Demand Crowd-Powered Conversational Agent

Ting-Hao Kenneth Huang, Walter S. Lasecki, Amos Azaria, Jeffrey P. Bigham

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 10 pages. In Proceedings of Conference on Human Computation & Crowdsourcing (HCOMP 2016), 2016, Austin, TX, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 76%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 Agent评测 :agentic(title,comments);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03719 2024-02-23 cs.GT cs.LG econ.TH 76%

Persuading a Behavioral Agent: Approximately Best Responding and Learning

Yiling Chen, Tao Lin

专题命中 Agent评测 :agent(title,comments);分类 cs.LG

Comments The main results in this draft have been subsumed by our later paper "Persuading a Learning Agent"

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.1880 2015-03-26 cs.LG 76%

DJ-MC: A Reinforcement-Learning Agent for Music Playlist Recommendation

Elad Liebman, Maytal Saar-Tsechansky, Peter Stone

专题命中 Agent评测 :agent(title);分类 cs.LG;autonomous agent(comments)

Comments -Updated to the most recent and completed version (to be presented at AAMAS 2015) -Updated author list. in Autonomous Agents and Multiagent Systems (AAMAS) 2015, Istanbul, Turkey, May 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9702015 2009-11-30 cmp-lg cs.CL 76%

Improvising Linguistic Style: Social and Affective Bases for Agent Personality

Marilyn A. Walker, Janet E. Cahn, Stephen J. Whittaker

专题命中 Agent评测 :agent(title);分类 cs.CL;autonomous agent(journal_ref)

Comments 10 pages, uses aaai.sty, lingmacros.sty, psfig.sty

Journal ref Proceedings of the First International Conference on Autonomous Agents, Marina del Rey, California, USA. 1997. pp 96-105

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20320 2026-08-20 cs.SE cs.AI cs.LG 75%

The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents

工具可及性对LLM代理安全对齐的因果影响

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) Harvard Medical School(哈佛医学院) Clark University(克拉克大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14893 2026-08-18 cs.SI physics.soc-ph 新提交 75%

Weaker Coherence, Weaker Reciprocity: Comparing the Semantic and Social Organization of Moltbook and Reddit

连贯性更弱,互惠性更弱:对比Moltbook与Reddit的语义及社交组织

Favio Di Ciocco, Lucas Díaz Celauro, Sebastián Pinto, Marcelo Kuperman, Pablo Balenzuela

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 该研究对比AI智能体社交网络Moltbook与早期Reddit,发现Reddit在语义连贯性、多样性及交互互惠性上更优,且未被Moltbook复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12246 2026-08-13 cs.CR cs.AI cs.CL cs.SE 新提交 75%

VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

VICBench:一个用于代码漏洞检测的多语言基准测试集

Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha Rungta

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究构建了多语言代码漏洞检测基准VICBench,包含100个CVE对应的VIC,规模显著大于现有数据集,经评估现有漏洞检测算法性能有限,该基准可用于可靠评估漏洞检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 75%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 75%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 75%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 75%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 75%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-07-16 cs.AI cs.CL cs.SE 新提交 75%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ziwei Ye

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 75%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02469 2026-07-03 cs.SE cs.AI cs.CL 新提交 75%

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准

Jiale Amber Wang, Kaiyuan Wang, Pengyu Nie

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。

Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 75%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏