arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15686 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15686 篇

2503.22673 2025-07-18 cs.AI cs.CL 79%

ActionStudio: A Lightweight Framework for Data and Training of Large Action Models

Jianguo Zhang, Thai Hoang, Ming Zhu, Zuxin Liu, Shiyu Wang, Tulika Awalgaonkar, Akshara Prabhakar, Haolin Chen, Weiran Yao, Zhiwei Liu, Juntao Tan, Juan Carlos Niebles, Shelby Heinecke, Huan Wang, Silvio Savarese, Caiming Xiong

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 16 pages; large action models; xLAM; ActionStudio

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00406 2025-07-09 cs.AI cs.CL 79%

Agents Are All You Need for LLM Unlearning

Debdeep Sanyal, Murari Mandal

机构 * RespAI Lab, School of Computer Engineering, KIIT Bhubaneswar(RespAI实验室,计算机工程学院,KIIT大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08403 2025-06-12 cs.CL cs.AI 79%

TACTIC: Translation Agents with Cognitive-Theoretic Interactive Collaboration

Weiya Li, Junjie Chen, Bei Li, Boyang Liu, Zichen Wen, Nuanqiao Shan, Xiaoqian Liu, Anping Liu, Huajie Liu, Hu Song, Linfeng Zhang

机构 * Big Data&AI Lab, ICBC(大数据与人工智能实验室,ICBC) Shanghai Jiao Tong University(上海交通大学) Meituan Inc.(美团公司) Tongji University(同济大学) Fudan University(复旦大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments 20 pages, 4 figures, Under review. Code: https://github.com/weiyali126/TACTIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18878 2025-05-27 cs.CL cs.AI 79%

CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions

Kung-Hsiang Huang, Akshara Prabhakar, Onkar Thorat, Divyansh Agarwal, Prafulla Kumar Choubey, Yixin Mao, Silvio Savarese, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19400 2025-05-27 cs.AI cs.CL cs.CV cs.MM 79%

TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding

Max Ku, Thomas Chong, Jonathan Leung, Krish Shah, Alvin Yu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Votee AI Vector Institute(向量研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments accepted to ACL 2025 main, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13291 2025-05-20 cs.LG cs.AI 79%

TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents

Yifu Cai, Xinyu Li, Mononito Goswami, Michał Wiliński, Gus Welter, Artur Dubrawski

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments Open source code available at https://github.com/moment-timeseries-foundation-model/TimeSeriesGym. YC, XL, MG and MW contributed equally, and should be considered joint first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02254 2025-04-04 cs.CL cs.AI 79%

LLMs as Deceptive Agents: How Role-Based Prompting Induces Semantic Ambiguity in Puzzle Tasks

Seunghyun Yoo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11613 2025-02-25 cs.CL cs.AI cs.ET cs.HC cs.PL 79%

Conversation Routines: A Prompt Engineering Framework for Task-Oriented Dialog Systems

Giorgio Robino

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Minor typos revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05590 2025-02-19 cs.CR cs.AI cs.CY cs.LG 79%

NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security

Minghao Shao, Sofija Jancheska, Meet Udeshi, Brendan Dolan-Gavitt, Haoran Xi, Kimberly Milner, Boyuan Chen, Max Yin, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

专题命中 Agent评测 :planning(abstract);workflow(abstract);function calling(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00170 2025-01-03 cs.HC cs.AI cs.LG 79%

CREW: Facilitating Human-AI Teaming Research

Lingyu Zhang, Zhengran Ji, Boyuan Chen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Our project website is at: http://generalroboticslab.com/CREW

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02959 2024-09-24 cs.CL cs.AI 79%

AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentation

Zhitao He, Pengfei Cao, Chenhao Wang, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05337 2024-04-09 cs.CL cs.AI 79%

Towards Objectively Benchmarking Social Intelligence for Language Agents at Action Level

Chenxu Wang, Bin Dai, Huaping Liu, Baoyuan Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03526 2023-08-08 cs.LG cs.AI 79%

AlphaStar Unplugged: Large-Scale Offline Reinforcement Learning

Michaël Mathieu, Sherjil Ozair, Srivatsan Srinivasan, Caglar Gulcehre, Shangtong Zhang, Ray Jiang, Tom Le Paine, Richard Powell, Konrad Żołna, Julian Schrittwieser, David Choi, Petko Georgiev, Daniel Toyama, Aja Huang, Roman Ring, Igor Babuschkin, Timo Ewalds, Mahyar Bordbar, Sarah Henderson, Sergio Gómez Colmenarejo, Aäron van den Oord, Wojciech Marian Czarnecki, Nando de Freitas, Oriol Vinyals

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 13 figures, previous version published as a NeurIPS 2021 workshop: https://openreview.net/forum?id=Np8Pumfoty

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12658 2023-06-07 cs.LG cs.AI cs.MA 79%

Learning Intuitive Policies Using Action Features

Mingwei Ma, Jizhou Liu, Samuel Sokota, Max Kleiman-Weiner, Jakob Foerster

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.10944 2022-06-23 cs.LG cs.AI cs.MA 79%

POGEMA: Partially Observable Grid Environment for Multiple Agents

Alexey Skrynnik, Anton Andreychuk, Konstantin Yakovlev, Aleksandr I. Panov

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12808 2021-08-03 cs.LG cs.AI cs.MA 79%

Open-Ended Learning Leads to Generally Capable Agents

Open Ended Learning Team, Adam Stooke, Anuj Mahajan, Catarina Barros, Charlie Deck, Jakob Bauer, Jakub Sygnowski, Maja Trebacz, Max Jaderberg, Michael Mathieu, Nat McAleese, Nathalie Bradley-Schmieg, Nathaniel Wong, Nicolas Porcel, Roberta Raileanu, Steph Hughes-Fitt, Valentin Dalibard, Wojciech Marian Czarnecki

专题命中 Agent评测 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02636 2020-06-05 cs.CV cs.AI cs.LG cs.RO stat.ML 79%

The Importance of Prior Knowledge in Precise Multimodal Prediction

Sergio Casas, Cole Gulino, Simon Suo, Raquel Urtasun

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05759 2019-04-12 cs.LG cs.AI cs.MA 79%

Safer Deep RL with Shallow MCTS: A Case Study in Pommerman

Bilal Kartal, Pablo Hernandez-Leal, Chao Gao, Matthew E. Taylor

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

Comments Adaptive Learning Agents (ALA) Workshop at AAMAS 2019. arXiv admin note: substantial text overlap with arXiv:1812.00045

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05521 2018-01-30 cs.AI cs.LG 79%

Playing FPS Games with Deep Reinforcement Learning

Guillaume Lample, Devendra Singh Chaplot

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments The authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16809 2025-07-25 cs.CL 78%

LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs

Da-Chen Lian, Ri-Sheng Huang, Pin-Er Chen, Chunki Lim, You-Kuan Lin, Guan-Yu Tseng, Zi-Cheng Yang, Zhen-Yu Lin, Pin-Cheng Chen, Shu-Kai Hsieh

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);multi-agent(abstract);分类 cs.CL

Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06323 2025-03-11 cs.AI cs.MA 78%

Higher-Order Belief in Incomplete Information MAIDs

Jack Foxabbott, Rohan Subramani, Francis Rhys Ward

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

Journal ref 24th International Conference on Autonomous Agents and Multiagent Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17733 2026-08-19 cs.CC cs.MA 新提交 78%

The Influence of Agent Models on the Complexity of Bus Routing

智能体模型对公交线路规划问题复杂度的影响

Eva Deltl, Christian Komusiewicz, Jurek Rostalsky, Johannes Schröder, Luca Pascal Staus

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究分析公交线路规划问题的复杂度,发现智能体成本模型、是否允许智能体选择步行等因素会影响问题难度,相关结果还证明了其NP-hard性与参数化难解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17614 2026-08-19 cs.MA cs.SY eess.SY 新提交 78%

Adaptive Incentive Design in Dynamic Principal-Agent Problem via Kernelized Bandits

基于核化多臂老虎机的动态委托代理问题中的自适应激励设计

Arghya Mallick, Anuj S. Vora, Sergio Grammatico, Peyman Mohajerin Esfahani

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对动态委托代理问题的现有局限,提出引入随机效用模型的Heteroscedastic GP-UCB算法,建立了累积遗憾界,并在V2G激励设计中验证了其更优的经济性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19359 2026-08-18 econ.TH cs.GT 版本更新 78%

How damaging is zero-sum thinking to an agent's interests when the world is positive-sum?

零和思维对代理利益的损害在正和世界中有多大?

Shaun Hargreaves Heap, Mehmet Mars Seven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09546 2026-08-18 q-fin.TR cs.SI 版本更新 78%

A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency Trading

一种用于指导零样本加密货币交易的反思型大语言模型智能体

Yuan Li, Bingqiao Luo, Qian Wang, Nuo Chen, Xu Liu, Bingsheng He

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。

Comments Published at EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 78%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 78%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10866 2026-08-12 astro-ph.SR astro-ph.IM 新提交 78%

Spectroscopic Binary Detection as Agent-Callable Tools: Detecting 40,000+ Main-Sequence Binary Candidates from SDSS DR19 APOGEE Spectra

作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体

Serat M. Saad, Yuan-Sen Ting

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。

Comments 23 pages, 16 figures, submitted to OJAp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 78%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29191 2026-08-03 cs.SC 新提交 78%

A Proof of the Dittert Conjecture in Dimension 4 via an Exact Constrained Sum-of-Squares Certificate

通过智能体引导的精确平方和证书证明4维下的Dittert猜想

Jinhui Li, Beibei Xiong, Zhengfeng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。

详情

展开后加载摘要…

URL PDF HTML 收藏