arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2509.21651 2025-11-24 cs.AI 70%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22568 2025-11-21 cs.RO cs.AI cs.MA cs.SY eess.SY 70%

SPIRAL: Self-Play Incremental Racing Algorithm for Learning in Multi-Drone Competitions

SPIRAL:基于自博弈增量竞赛算法的多无人机竞赛学习

Onur Akgün

机构 * Department of Mechatronics Engineering Faculty of Engineering Turkish-German University(机械工程系 工程学院 德土大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SPIRAL通过自博弈机制实现多无人机竞赛中的自主学习,提供灵活且可扩展的学习框架,提升竞赛策略的稳健性和适应性。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 70%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14780 2025-11-20 cs.AI 70%

Ask WhAI:Probing Belief Formation in Role-Primed LLM Agents

Keith Moore, Jun W. Kim, David Lyu, Jeffrey Heo, Ehsan Adeli

机构 * Department of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Preprint. Accepted for publication at AIAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09904 2025-11-19 cs.AI 70%

CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D

Francis Rhys Ward, Teun van der Weij, Hanna Gábor, Sam Martin, Raja Mehta Moreno, Harel Lidar, Louis Makower, Thomas Jodrell, Lauren Robson

机构 * LawZero Apollo Research Imperial College London(帝国理工学院伦敦校区)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 53 pages, 21 figures, 8 tables. Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13186 2025-11-18 cs.LG cs.SY eess.SY 70%

DiffFP: Learning Behaviors from Scratch via Diffusion-based Fictitious Play

Akash Karthikeyan, Yash Vardhan Pant

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments Initial results presented at the IJCAI 2025 Workshop on User-Aligned Assessment of Adaptive AI Systems. Project page: https://aku02.github.io/projects/difffp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12133 2025-11-18 cs.CL 70%

AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing

Qingyu Zhang, Chunlei Xin, Xuanang Chen, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Qing Ye, Qianlong Xie, Xingxing Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10049 2025-11-14 cs.SE 70%

Continuous Benchmark Generation for Evaluating Enterprise-scale LLM Agents

Divyanshu Saxena, Rishikesh Maurya, Xiaoxuan Ou, Gagan Somashekar, Shachee Mishra Gupta, Arun Iyer, Yu Kang, Chetan Bansal, Aditya Akella, Saravan Rajmohan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07678 2025-11-12 cs.AI 70%

AIA Forecaster: Technical Report

Rohan Alur, Bradly C. Stadie, Daniel Kang, Ryan Chen, Matt McManus, Michael Rickert, Tyler Lee, Michael Federici, Richard Zhu, Dennis Fogerty, Hayley Williamson, Nina Lozinski, Aaron Linsky, Jasjeet S. Sekhon

机构 * Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06771 2025-11-12 cs.RO cs.LG cs.MA 70%

JaxRobotarium: Training and Deploying Multi-Robot Policies in 10 Minutes

Shalin Anand Jain, Jiazhen Liu, Siva Kailas, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 22 pages, 14 figures, 10 tables. https://github.com/GT-STAR-Lab/JaxRobotarium. Manuscript accepted for publication at the 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09667 2025-11-11 cs.CL 70%

BLADE: Benchmarking Language Model Agents for Data-Driven Science

Ken Gu, Ruoxi Shang, Ruien Jiang, Keying Kuang, Richard-John Lin, Donghe Lyu, Yue Mao, Youran Pan, Teng Wu, Jiaqian Yu, Yikun Zhang, Tianmai M. Zhang, Lanyi Zhu, Mike A. Merrill, Jeffrey Heer, Tim Althoff

机构 * University of Washington(华盛顿大学) UC Berkeley(伯克利大学) New York University(纽约大学) Stanford University(斯坦福大学) University of British Columbia(不列颠哥伦比亚大学) Microsoft(微软) George Washington University(乔治·华盛顿大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05804 2025-11-11 cs.LG cs.SY eess.SP eess.SY stat.ML 70%

Catching Contamination Before Generation: Spectral Kill Switches for Agents

Valentin Noël

机构 * Devoteam

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

Comments Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01396 2025-11-11 cs.AI 70%

DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded Tasks

Haiyuan Wan, Chen Yang, Junchi Yu, Meiqi Tu, Jiaxuan Lu, Di Yu, Jianbao Cao, Ben Gao, Jiaqing Xie, Aoran Wang, Wenlong Zhang, Philip Torr, Dongzhan Zhou

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08878 2025-11-11 cs.NI cs.IT cs.LG eess.SP math.IT 70%

Large Language Model Empowered Next-Generation MIMO Networks: Fundamentals, Challenges, and Visions

Zhe Wang, Jiayi Zhang, Hongyang Du, Ruichen Zhang, Dusit Niyato, Bo Ai, Khaled B. Letaief

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行状态关键实验室) Beijing Jiaotong University(北京交通大学) School of Electronics and Information Engineering(电子与信息工程学院) University of Hong Kong(香港大学) College of Computing & Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

Comments 9 pages, 4 figures, 1 table, to appear in Digital Communications and Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08973 2025-11-11 cs.LG cs.SY eess.SY 70%

Enhancing Cyber Resilience of Networked Microgrids using Vertical Federated Reinforcement Learning

Sayak Mukherjee, Ramij R. Hossain, Yuan Liu, Wei Du, Veronica Adetola, Sheik M. Mohiuddin, Qiuhua Huang, Tianzhixi Yin, Ankit Singhal

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 13 pages, 5 figures

Journal ref 2023 IEEE Power & Energy Society General Meeting (PESGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02778 2025-11-05 cs.CV cs.CL 70%

VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation

Kevin Qinghong Lin, Yuhao Zheng, Hangyu Ran, Dantong Zhu, Dongxing Mao, Linjie Li, Philip Torr, Alex Jinpeng Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

Comments Project page: https://csu-jpg.github.io/VCode Github: https://github.com/CSU-JPG/VCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02560 2025-11-05 cs.HC cs.AI cs.CV 70%

SigmaCollab: An Application-Driven Dataset for Physically Situated Collaboration

Dan Bohus, Sean Andrist, Ann Paradiso, Nick Saw, Tim Schoonbeek, Maia Stiber

机构 * Microsoft Research(微软研究院) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06289 2025-11-04 q-fin.PM cs.LG q-fin.PR 70%

Automate Strategy Finding with LLM in Quant Investment

Zhizhuo Kou, Holam Yu, Junyu Luo, Jingshu Peng, Xujia Li, Chengzhong Liu, Juntao Dai, Lei Chen, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00619 2025-11-04 cs.SE 70%

GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android

Huaijin Ran, Haoyi Zhang, Xunzhu Tang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06389 2025-11-04 q-fin.TR cs.LG 70%

Optimal Execution with Reinforcement Learning

Yadh Hafsi, Edoardo Vittori

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17734 2025-10-29 cs.LG 70%

URB -- Urban Routing Benchmark for RL-equipped Connected Autonomous Vehicles

Ahmet Onur Akman, Anastasia Psarou, Michał Hoffmann, Łukasz Gorczyca, Łukasz Kowalski, Paweł Gora, Grzegorz Jamróz, Rafał Kucharski

机构 * Doctoral School of Exact and Natural Sciences, Jagiellonian University(杰尔吉利亚大学精确与自然科学博士学院) Faculty of Mathematics and Computer Science, Jagiellonian University(杰尔吉利亚大学数学与计算机科学学院) Urban Policy Observatory, Institute of Urban and Regional Development(城市政策观察所,城市与区域发展研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025), Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23182 2025-10-28 cs.CL 70%

SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations

Shuai Huang, Wenxuan Zhao, Jun Gao

机构 * Hello Group(Hello集团)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23671 2025-10-28 cs.SE cs.AI cs.CL cs.LG 70%

GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents

Manish Shetty, Naman Jain, Jinjian Liu, Vijay Kethanaboyina, Koushik Sen, Ion Stoica

机构 * UC Berkeley(伯克利大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Website: https://gso-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21603 2025-10-27 cs.IR cs.CL 70%

Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research

Kuicai Dong, Shurui Huang, Fangda Ye, Wei Han, Zhi Zhang, Dexun Li, Wenjun Li, Qu Yang, Gang Wang, Yichao Wang, Chen Zhang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21442 2025-10-27 cs.GT cs.LG cs.MA 70%

Scalable Neural Incentive Design with Parameterized Mean-Field Approximation

Nathan Corecco, Batuhan Yardim, Vinzenz Thoma, Zebang Shen, Niao He

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 52 pages, to appear at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15887 2025-10-27 cs.SE cs.AI cs.CL cs.LG 70%

AlgoTune: Can Language Models Speed Up General-Purpose Numerical Programs?

Ori Press, Brandon Amos, Haoyu Zhao, Yikai Wu, Samuel K. Ainsworth, Dominik Krupke, Patrick Kidger, Touqir Sajed, Bartolomeo Stellato, Jisun Park, Nathanael Bosch, Eli Meril, Albert Steppi, Arman Zharmagambetov, Fangzhao Zhang, David Perez-Pineiro, Alberto Mercurio, Ni Zhan, Talor Abramovich, Kilian Lieret, Hanlin Zhang, Shirley Huang, Matthias Bethge, Ofir Press

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Princeton University(普林斯顿大学) Meta (FAIR)(Meta(FAIR)) TU Braunschweig(Braunschweig技术大学) Cradle Bio LG Electronics Canada(LG加拿大电子公司) Seoul National University(首尔国立大学) Tel Aviv University(特拉维夫大学) Quansight PBC Stanford University(斯坦福大学) Norwegian University of Science and Technology(挪威科学与技术大学) EPFL(苏黎世联邦理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09702 2025-10-27 cs.AI 70%

MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?

Yunxiang Zhang, Muhammad Khalifa, Shitanshu Bhushan, Grant D Murphy, Lajanugen Logeswaran, Jaekyeom Kim, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

Comments NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19327 2025-10-23 cs.MA cs.AI 70%

SORA-ATMAS: Adaptive Trust Management and Multi-LLM Aligned Governance for Future Smart Cities

Usama Antuley, Shahbaz Siddiqui, Sufian Hameed, Waqas Arif, Subhan Shah, Syed Attique Shah

机构 * organization= Department of Computer Science, National University of Computer \& Emerging Sciences , addressline= St-4 Sector 17-D On National Highway , city= Karachi , postcode= 75160 , state= , country= Pakistan organization= Balochistan University of Information Technology, Engineering organization= Department of Computer Science, Birmingham City University , addressline= STEAMhouse, Belmont Row , city= Birmingham , postcode= B4 7RQ , country= United Kingdom

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11791 2025-10-23 cs.LG cs.CR 70%

SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks

Hwiwon Lee, Ziqi Zhang, Hanxiao Lu, Lingming Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14049 2025-10-20 cs.LG cs.MS 70%

CausalVerse: Benchmarking Causal Representation Learning with Configurable High-Fidelity Simulations

Guangyi Chen, Yunlong Deng, Peiyuan Zhu, Yan Li, Yifan Shen, Zijian Li, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏