arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2501.07572 2025-08-12 cs.CL cs.AI 73%

WebWalker: Benchmarking LLMs in Web Traversal

Jialong Wu, Wenbiao Yin, Yong Jiang, Zhenglin Wang, Zekun Xi, Runnan Fang, Linhai Zhang, Yulan He, Deyu Zhou, Pengjun Xie, Fei Huang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02694 2025-08-06 cs.AI cs.CL cs.MA 73%

Efficient Agents: Building Effective Agents While Reducing Cost

Ningning Wang, Xavier Hu, Pai Liu, He Zhu, Yue Hou, Heyuan Huang, Shengyu Zhang, Jian Yang, Jiaheng Liu, Ge Zhang, Changwang Zhang, Jun Wang, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments Work in progress. For GitHub repository, see https://github.com/OPPO-PersonalAI/OAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00141 2025-08-04 cs.LG cs.AI 73%

INSPIRE-GNN: Intelligent Sensor Placement to Improve Sparse Bicycling Network Prediction via Reinforcement Learning Boosted Graph Neural Networks

Mohit Gupta, Debjit Bhowmick, Rhys Newbury, Meead Saberi, Shirui Pan, Ben Beck

机构 * School of Public Health and Preventive Medicine, Monash University, Melbourne, Australia(公共卫生与预防医学学院,墨尔本大学) Department of Electrical and Computer System Engineering, Monash University, Melbourne, Australia(电气与计算机系统工程系,墨尔本大学) School of Civil and Environmental Engineering, UNSW, Sydney, Australia(土木与环境工程学院,新南威尔士大学) School of Information and Communication Technology, Griffith University, Brisbane, Australia(信息与通信技术学院,格里菲斯大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22947 2025-08-01 cs.CY cs.CL cs.LG 73%

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Shou'ang Wei, Xinyun Wang, Shuzhen Bi, Jian Chen, Ruijia Li, Bo Jiang, Xin Lin, Min Zhang, Yu Song, BingDong Li, Aimin Zhou, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) Department of Educational Information Technology(教育信息技术系) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23836 2025-07-17 cs.CL cs.AI 73%

Large Language Models Often Know When They Are Being Evaluated

Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, Marius Hobbhahn

机构 * MATS Apollo Research ML Alignment & Theory Scholars (MATS)(机器学习对齐与理论学者(MATS))

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07544 2025-07-11 cs.AI cs.LG 73%

Position: We Need An Algorithmic Understanding of Generative AI

Oliver Eberle, Thomas McGee, Hamza Giaffar, Taylor Webb, Ida Momennejad

机构 * BIFOLD--Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究院) University of California Los Angeles(加州大学洛杉矶分校) Halıcıoğlu Data Science Institute, University of California San Diego(哈里卡鲁斯数据科学研究所,加州大学圣地亚哥分校) Microsoft Research NYC(微软研究院纽约)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICML 2025 as a Spotlight Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06825 2025-07-11 cs.LG cs.AI 73%

Artificial Generals Intelligence: Mastering Generals.io with Reinforcement Learning

Matej Straka, Martin Schmid

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15740 2025-07-10 cs.AI cs.CR cs.LG 73%

SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents

Jonathan Kutasov, Yuqi Sun, Paul Colognese, Teun van der Weij, Linda Petrini, Chen Bo Calvin Zhang, John Hughes, Xiang Deng, Henry Sleight, Tyler Tracy, Buck Shlegeris, Joe Benton

机构 * Anthropic Reduct Video Scale AI Constellation Redwood Research

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11010 2025-07-08 cs.CL cs.AI 73%

ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models

Jiangxu Wu, Cong Wang, TianHuang Su, Jun Yang, Haozhi Lin, Chao Zhang, Ming Peng, Kai Shi, SongPan Yang, BinQing Pan, ZiXian Li, Ni Yang, ZhenYu Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ACL2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20249 2025-06-26 cs.AI cs.CL cs.MA 73%

Language Modeling by Language Models

Junyan Cheng, Peter Clark, Kyle Richardson

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15741 2025-06-24 cs.AI cs.CL 73%

OAgents: An Empirical Study of Building Effective Agents

He Zhu, Tianrui Qin, King Zhu, Heyuan Huang, Yeyi Guan, Jinxiang Xia, Yi Yao, Hanhao Li, Ningning Wang, Pai Liu, Tianhao Peng, Xin Gui, Xiaowan Li, Yuhui Liu, Yuchen Eleanor Jiang, Jun Wang, Changwang Zhang, Xiangru Tang, Ge Zhang, Jian Yang, Minghao Liu, Xitong Gao, Jiaheng Liu, Wangchunshu Zhou

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15756 2025-06-23 cs.MA cs.AI cs.LG 73%

RecBayes: Recurrent Bayesian Ad Hoc Teamwork in Large Partially Observable Domains

João G. Ribeiro, Yaniv Oren, Alberto Sardinha, Matthijs Spaan, Francisco S. Melo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12841 2025-06-17 cs.AI cs.CL 73%

WereWolf-Plus: An Update of Werewolf Game setting Based on DSGBench

Xinyuan Xia, Yuanyi Song, Haomin Ma, Jinyu Cai

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22531 2025-06-16 cs.LG cs.AI cs.CR 73%

Training RL Agents for Multi-Objective Network Defense Tasks

Andres Molina-Markham, Luis Robaina, Sean Steinle, Akash Trivedi, Derek Tsui, Nicholas Potteiger, Lauren Brandt, Ransom Winder, Ahmad Ridley

机构 * The MITRE Corporation(MITRE公司) NSA(国家安全局)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04540 2025-06-12 cs.LG cs.AI cs.CV cs.MA cs.RO 73%

Sim-to-Real Causal Transfer: A Metric Learning Approach to Causally-Aware Interaction Representations

Ahmad Rahimi, Po-Chien Luan, Yuejiang Liu, Frano Rajič, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09160 2025-06-11 cs.AI cs.LG cs.RO 73%

Innate-Values-driven Reinforcement Learning based Cognitive Modeling

Qin Yang

机构 * Intelligent Social Systems and Swarm Robotics Lab (IS$^3$R)(智能社会系统与群体机器人实验室) Computer Science and Information Systems Department(计算机科学与信息系统系) Bradley University(布拉德利大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments The paper had been accepted by the 2025 IEEE Conference on Cognitive and Computational Aspects of Situation Management (CogSIMA). arXiv admin note: text overlap with arXiv:2401.05572

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07982 2025-06-10 cs.AI cs.CL 73%

$τ^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment

Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06020 2025-06-09 cs.CL cs.AI 73%

When to Trust Context: Self-Reflective Debates for Context Reliability

Zeqi Zhou, Fang Wu, Shayan Talaei, Haokai Zhao, Cheng Meixin, Tinson Xu, Amin Saberi, Yejin Choi

机构 * Brown University(布朗大学) Stanford University(斯坦福大学) University of New South Wales(新南威尔士大学) Xi’an University of Electronic Science and Technology(西安电子科技大学) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17767 2025-06-09 cs.CL cs.LG 73%

ResearchTown: Simulator of Human Research Community

Haofei Yu, Zhaochen Hong, Zirui Cheng, Kunlun Zhu, Keyang Xuan, Jinwei Yao, Tao Feng, Jiaxuan You

机构 * Haofei Yu Zhaochen Hong Zirui Cheng Kunlun Zhu Keyang Xuan Jinwei Yao Tao Feng Jiaxuan You

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

Comments 9 pages, ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05431 2025-06-09 cs.CV cs.AI cs.LG 73%

Robustness Evaluation for Video Models with Reinforcement Learning

Ashwin Ramesh Babu, Sajad Mousavi, Vineet Gundecha, Sahand Ghorbanpour, Avisek Naug, Antonio Guillen, Ricardo Luna Gutierrez, Soumyendu Sarkar

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09560 2025-06-06 cs.AI cs.CL cs.CV 73%

EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella, Marziyeh Movahedi, Manling Li, Heng Ji, Huan Zhang, Tong Zhang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01716 2025-06-03 cs.AI cs.CL 73%

Self-Challenging Language Model Agents

Yifei Zhou, Sergey Levine, Jason Weston, Xian Li, Sainbayar Sukhbaatar

机构 * UC Berkeley(伯克利大学) FAIR at Meta(Meta 公司人工智能研究部)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23852 2025-06-02 cs.CL cs.AI cs.MA stat.AP 73%

Large Language Model-Based Agents for Automated Research Reproducibility: An Exploratory Study in Alzheimer's Disease

Nic Dobbins, Christelle Xiong, Kristine Lan, Meliha Yetisgen

机构 * Biomedical Informatics & Data Science, Johns Hopkins University(约翰霍普金斯大学生物医学信息学与数据科学) Biomedical & Health Informatics, University of Washington(华盛顿大学生物医学与健康信息学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20732 2025-05-28 cs.CL cs.LG 73%

SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution

Hanlin Wang, Chak Tou Leong, Jiashuo Wang, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机学系,香港理工大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15114 2025-05-28 cs.LG cs.AI 73%

RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts

Hjalmar Wijk, Tao Lin, Joel Becker, Sami Jawhar, Neev Parikh, Thomas Broadley, Lawrence Chan, Michael Chen, Josh Clymer, Jai Dhyani, Elena Ericheva, Katharyn Garcia, Brian Goodrich, Nikola Jurkovic, Holden Karnofsky, Megan Kinniment, Aron Lajko, Seraphina Nix, Lucas Sato, William Saunders, Maksym Taran, Ben West, Elizabeth Barnes

机构 * METR AI R&D Evaluation(METR AI R&D评估)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13311 2025-05-27 cs.CL cs.AI 73%

Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors

Jian Wang, Yinpei Dai, Yichi Zhang, Ziqiao Ma, Wenjie Li, Joyce Chai

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

Comments Accepted to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06051 2025-05-21 cs.AI cs.HC cs.LG 73%

On the Utility of Accounting for Human Beliefs about AI Intention in Human-AI Collaboration

Guanghui Yu, Robert Kasumba, Chien-Ju Ho, William Yeoh

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09595 2025-05-15 cs.CL cs.AI cs.CY cs.MA 73%

WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models

Abdullah Mushtaq, Imran Taj, Rafay Naeem, Ibrahim Ghaznavi, Junaid Qadir

机构 * Information Technology University Department of Computer Science(信息科技大学计算机科学系) Zayed University College of Interdisciplinary Studies(扎耶德大学跨学科研究学院) Computer Science and Engineering Department(计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Preprint. Submitted to the Journal of Artificial Intelligence Research (JAIR) on April 29, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08120 2025-05-14 cs.CL cs.LG 73%

Putting It All into Context: Simplifying Agents with LCLMs

Mingjian Jiang, Yangjun Ruan, Luis Lastras, Pavan Kapanipathi, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01639 2025-05-13 cs.LG cs.AI cs.CY 73%

Moral Alignment for LLM Agents

Elizaveta Tennant, Stephen Hailes, Mirco Musolesi

机构 * University College London(伦敦大学学院) University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments Published at the 13th International Conference on Learning Representations (ICLR'25), Singapore, Apr 2025. https://openreview.net/forum?id=MeGDmZjUXy

详情

展开后加载摘要…

URL PDF HTML 收藏