arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2506.17834 2025-06-24 cs.AI cs.HC 70%

Reflective Verbal Reward Design for Pluralistic Alignment

Carter Blair, Kate Larson, Edith Law

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 9 pages, 3 figures, accepted to the IJCAI 2025 Human-Centred AI track. Project repository at: https://osf.io/8yxf2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11302 2025-06-23 cs.CV cs.AI 70%

TARDIS STRIDE: A Spatio-Temporal Road Image Dataset and World Model for Autonomy

Héctor Carrión, Yutong Bai, Víctor A. Hernández Castro, Kishan Panaganti, Ayush Zenith, Matthew Trang, Tony Zhang, Pietro Perona, Jitendra Malik

机构 * Tera AI UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) California Institute of Technology(加州理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

Comments Computer Vision, Pattern Recognition, Early-Fusion, Dataset, Data Augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11310 2025-06-19 cs.LG cs.NI 70%

Digital Twin Vehicular Edge Computing Network: Task Offloading and Resource Allocation

Yu Xie, Qiong Wu, Pingyi Fan

机构 * School of Internet of Things Engineering(物联网工程学院) Jiangnan University(江南大学) Department of Electronic Engineering(电子工程系) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments This paper has been accepted by ICICSP 2024. The source code has been released at:https://github.com/qiongwu86/Digital-Twin-Vehicular-Edge-Computing-Network_Task-Offloading-and-Resource-Allocation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14074 2025-06-18 cs.LG cs.AR 70%

Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification

Nathaniel Pinckney, Chenhui Deng, Chia-Tung Ho, Yun-Da Tsai, Mingjie Liu, Wenfei Zhou, Brucek Khailany, Haoxing Ren

机构 * NVIDIA

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

Comments 16 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13651 2025-06-17 cs.LG 70%

xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations

Kaiyuan Chen, Yixin Ren, Yang Liu, Xiaobo Hu, Haotong Tian, Tianbao Xie, Fangfu Liu, Haoye Zhang, Hongzhang Liu, Yuan Gong, Chen Sun, Han Hou, Hui Yang, James Pan, Jianan Lou, Jiayi Mao, Jizheng Liu, Jinpeng Li, Kangyi Liu, Kenkun Liu, Rui Wang, Run Li, Tong Niu, Wenlong Zhang, Wenqi Yan, Xuanzheng Wang, Yuchen Zhang, Yi-Hsin Hung, Yuan Jiang, Zexuan Liu, Zihan Yin, Zijian Ma, Zhiwen Mo

机构 * Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Imperial College London(伦敦帝国学院) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) The Ohio State University(俄亥俄州立大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) University of Oxford(牛津大学) University of Pennsylvania(宾夕法尼亚大学) University of Science and Technology of China(中国科学技术大学) University of Sydney(悉尼大学) University of Toronto(多伦多大学) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

Comments Project page: https://xbench.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19466 2025-06-17 cs.LG 70%

A Probabilistic Neuro-symbolic Layer for Algebraic Constraint Satisfaction

Leander Kurscheidt, Paolo Morettin, Roberto Sebastiani, Andrea Passerini, Antonio Vergari

机构 * School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院) DiSI, University of Trento, Italy(特伦托大学迪西研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.LG

Comments Accepted as oral presentation at UAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10384 2025-06-13 cs.AI 70%

NeuroPAL: Punctuated Anytime Learning with Neuroevolution for Macromanagement in Starcraft: Brood War

Jim O'Connor, Yeonghun Lee, Gary B Parker

机构 * Computer Science Department(计算机科学系) Connecticut College(康涅狄格学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

Comments IEEE Conference on Games 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10264 2025-06-13 cs.AI 70%

WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models

Qiyue Yin, Pei Xu, Qiaozhe Li, Shengda Liu, Shengqi Shen, Tong Wang, Yihong Han, Xiaonan Zhao, Likun Yang, Shiyue Cao, Shiyu Qiu, Yuxuan Liu, Shizhao Yu, Lei Cui, Chengxin Yan, Jie Sun, Xiangquan Tang, Kaiqi Huang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06352 2025-06-10 cs.AI cs.CY 70%

Will artificial agents pursue power by default?

Christian Tarsney

机构 * June 2025(2025年6月)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06325 2025-06-10 cs.NE cs.AI cs.GT cs.MA 70%

Evolutionary model for energy trading in community microgrids using Hawk-Dove strategies

Viorica Rozina Chifu, Tudor Cioara, Cristina Bianca Pop, Ionut Anghel

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05538 2025-06-09 cs.LG cs.MM 70%

SocialDF: Benchmark Dataset and Detection Model for Mitigating Harmful Deepfake Content on Social Media Platforms

Arnesh Batra, Anushk Kumar, Jashn Khemani, Arush Gumber, Arhan Jain, Somil Gupta

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔信息技术学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05109 2025-06-06 cs.AI 70%

Truly Self-Improving Agents Require Intrinsic Metacognitive Learning

Tennison Liu, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

Comments Published as a conference paper at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04481 2025-06-06 cs.AI 70%

CogMath: Assessing LLMs' Authentic Mathematical Ability from a Human Cognitive Perspective

Jiayu Liu, Zhenya Huang, Wei Dai, Cheng Cheng, Jinze Wu, Jing Sha, Song Li, Qi Liu, Shijin Wang, Enhong Chen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17934 2025-06-06 cs.HC cs.CL cs.CR 70%

Toward a Human-Centered Evaluation Framework for Trustworthy LLM-Powered GUI Agents

Chaoran Chen, Zhiping Zhang, Ibrahim Khalilov, Bingcan Guo, Simret A Gebreegziabher, Yanfang Ye, Ziang Xiao, Yaxing Yao, Tianshi Li, Toby Jia-Jun Li

机构 * University of Notre Dame(圣约翰大学) Northeastern University(东北大学) Virginia Tech(弗吉尼亚理工大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03546 2025-06-05 cs.RO cs.AI cs.MA 70%

From Virtual Agents to Robot Teams: A Multi-Robot Framework Evaluation in High-Stakes Healthcare Context

Yuanchen Bai, Zijian Ding, Angelique Taylor

机构 * Cornell University(康奈尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01859 2025-06-03 cs.CL 70%

CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level Interactions

Tamer Alkhouli, Katerina Margatina, James Gung, Raphael Shu, Claudia Zaghi, Monica Sunkara, Yi Zhang

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.CL

Comments ACL 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01344 2025-06-03 cs.CL 70%

Follow the Flow: Fine-grained Flowchart Attribution with Neurosymbolic Agents

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Vivek Gupta, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Adobe Research(Adobe研究) ASU(亚利桑那州立大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01055 2025-06-03 cs.CR cs.CL 70%

Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution

Meysam Alizadeh, Zeynab Samei, Daria Stetsenko, Fabrizio Gilardi

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

Comments 25 pages, 18 figures, NeurIPS formatting style

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04231 2025-06-03 cs.MA cs.AI cs.CY cs.GT 70%

Quantifying Misalignment Between Agents: Towards a Sociotechnical Understanding of Alignment

Aidan Kierans, Avijit Ghosh, Hananel Hazan, Shiri Dori-Hacohen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 7 pages, 8 figures, 3 tables, forthcoming at the AAAI-25 Special Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00468 2025-06-03 cs.GT cs.AI 70%

When Should a Leader Act Suboptimally? The Role of Inferability in Repeated Stackelberg Games

Mustafa O. Karabag, Sophia Smith, Negar Mehr, David Fridovich-Keil, Ufuk Topcu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

Comments Extended journal version of the ACC 2024 paper "Encouraging Inferable Behavior for Autonomy: Repeated Bimatrix Stackelberg Games with Observations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20023 2025-05-27 cs.CL 70%

Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking

Yihan Chen, Benfeng Xu, Xiaorui Wang, Yongdong Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone技术公司)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13862 2025-05-27 cs.CR cs.CL 70%

PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks

Guobin Shen, Dongcheng Zhao, Linghao Feng, Xiang He, Jihang Wang, Sicheng Shen, Haibo Tong, Yiting Dong, Jindong Li, Xiang Zheng, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, CASIA(CASIA脑认知实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19828 2025-05-27 cs.SE 70%

SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection

Md Basim Uddin Ahmed, Nima Shiri Harzevili, Jiho Shin, Hung Viet Pham, Song Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17104 2025-05-26 cs.CL cs.MM 70%

P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark

Tao Sun, Enhao Pan, Zhengkai Yang, Kaixin Sui, Jiajun Shi, Xianfu Cheng, Tongliang Li, Wenhao Huang, Ge Zhang, Jian Yang, Zhoujun Li

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19260 2025-05-26 cs.CV cs.AI 70%

EMT: A Visual Multi-Task Benchmark Dataset for Autonomous Driving

Nadya Abdel Madjid, Murad Mebrahtu, Abdulrahman Ahmad, Abdelmoamen Nasser, Bilal Hassan, Naoufel Werghi, Jorge Dias, Majid Khonji

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06835 2025-05-22 cs.LG 70%

Reinforcement Learning on Dyads to Enhance Medication Adherence

Ziping Xu, Hinal Jajal, Sung Won Choi, Inbal Nahum-Shani, Guy Shani, Alexandra M. Psihogios, Pei-Yao Hung, Susan Murphy

机构 * Harvard University(哈佛大学) University of Michigan(密歇根大学) Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14706 2025-05-21 cs.AI cs.RO 70%

Building reliable sim driving agents by scaling self-play

Daphne Cornelisse, Aarav Pandya, Kevin Joseph, Joseph Suárez, Eugene Vinitsky

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments v3

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13435 2025-05-07 cs.AI cs.CR 70%

The Adaptive Arms Race: Redefining Robustness in AI Security

Ilias Tsingenopoulos, Vera Rimmer, Davy Preuveneers, Fabio Pierazzi, Lorenzo Cavallaro, Wouter Joosen

机构 * KU Leuven(卢森堡大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00711 2025-05-06 cs.LG 70%

GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments

Enjun Du, Xunkai Li, Tian Jin, Zhihan Zhang, Rong-Hua Li, Guoren Wang

机构 * Department of Cyberspace Science and Technology(网络空间科学与技术系) Beijing Institude of Technology(北京理工大学) Department of Computer Science and Technology(计算机科学与技术系) Pittsburgh Institute Sichuan University(四川大学 Pittsburgh 院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01085 2025-05-05 cs.CY cs.AI 70%

Artificial Intelligence in Government: Why People Feel They Lose Control

Alexander Wuttke, Adrian Rauchfleisch, Andreas Jungherr

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏