arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2510.09558 2025-10-16 cs.CL 70%

AutoPR: Let's Automate Your Academic Promotion!

Qiguang Chen, Zheng Yan, Mingda Yang, Libo Qin, Yixin Yuan, Hanjing Li, Jinhao Liu, Yiyan Ji, Dengyun Peng, Jiannan Guan, Mengkang Hu, Yantao Du, Wanxiang Che

机构 * LARG Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) The University of Hong Kong(香港大学) ByteDance China (Seed)(字节跳动中国(种子))

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments Preprint. Code: https://github.com/LightChen233/AutoPR . Benchmark: https://huggingface.co/datasets/yzweak/PRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19515 2025-10-15 cs.HC cs.AI cs.CY 70%

A Longitudinal Randomized Control Study of Companion Chatbot Use: Anthropomorphism and Its Mediating Role on Social Impacts

Rose E. Guingrich, Michael S. A. Graziano

机构 * Princeton University Department of Psychology(普林斯顿大学心理学系) Princeton School of Public & International Affairs(普林斯顿公共与国际事务学院) Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20996 2025-10-15 cs.AI 70%

ChatThero: An LLM-Supported Chatbot for Behavior Change and Therapeutic Support in Addiction Recovery

Junda Wang, Zonghai Yao, Lingxi Li, Junhui Qian, Zhichao Yang, Hong Yu

机构 * Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA Bedford Health Care 医疗组织与实施研究中心) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) Miner School of Computer and Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校计算机与信息科学学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11065 2025-10-15 cs.CE cs.AI cs.MA 70%

Time Travel is Cheating: Going Live with DeepFund for Real-Time Fund Investment Benchmarking

Changlun Li, Yao Shi, Chen Wang, Qiqi Duan, Runke Ruan, Weijie Huang, Haonan Long, Lijun Huang, Nan Tang, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Paradoox AI Research(Paradoox AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11389 2025-10-14 cs.CL 70%

Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies

Zirui Song, Yuan Huang, Junchang Liu, Haozhe Luo, Chenxi Wang, Lang Gao, Zixiang Xu, Mingfei Han, Xiaojun Chang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments 34 pages, 32figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00096 2025-10-10 q-bio.QM cs.AI 70%

BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology

Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

Comments 8 main text pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09050 2025-10-07 cs.AI 70%

ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering

Yuki Imajuku, Kohki Horie, Yoichi Iwata, Kensho Aoki, Naohiro Takahashi, Takuya Akiba

机构 * Sakana AI The University of Tokyo(东京大学) AtCoder

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025 Datasets & Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21185 2025-10-06 cs.LG 70%

Amelia: A Large Dataset and Benchmark for Airport Surface Movement Forecasting

Ingrid Navarro, Pablo Ortega-Kral, Jay Patrikar, Haichuan Wang, Alonso Cano, Zelin Ye, Jong Hoon Park, Sebastian Scherer, Jean Oh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 40 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01815 2025-10-03 cs.AI 70%

Human-AI Teaming Co-Learning in Military Operations

Clara Maathuis, Kasper Cools

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments Submitted to Sensors + Imaging; presented on 18th of September (Artificial Intelligence for Security and Defence Applications III)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01398 2025-10-03 cs.AI 70%

Automating Data-Driven Modeling and Analysis for Engineering Applications using Large Language Model Agents

Yang Liu, Zaid Abulawi, Abhiram Garimidi, Doyeong Lim

机构 * Department of Nuclear Engineering, Texas A\&M University(核工程系,德克萨斯A&M大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00627 2025-10-02 cs.AI 70%

Collaborative-Distilled Diffusion Models (CDDM) for Accelerated and Lightweight Trajectory Prediction

Bingzhang Wang, Kehua Chen, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(华盛顿大学土木与环境工程系)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00311 2025-10-02 cs.CL 70%

CORTEX: Collaborative LLM Agents for High-Stakes Alert Triage

Bowen Wei, Yuan Shen Tay, Howard Liu, Jinhao Pan, Kun Luo, Ziwei Zhu, Chris Jordan

机构 * George Mason University(乔治·马歇尔大学) Fluency Security(流畅安全)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24127 2025-09-30 cs.AI cs.DB 70%

Transparent, Evaluable, and Accessible Data Agents: A Proof-of-Concept Framework

Nooshin Bahador

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22735 2025-09-30 cs.CY cs.AI 70%

Regulating the Agency of LLM-based Agents

Seán Boddy, Joshua Joseph

机构 * Berkman Klein Center for Internet & Society(互联网与社会伯克曼克莱因中心) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19566 2025-09-25 cs.AI q-bio.GN 70%

Nano Bio-Agents (NBA): Small Language Model Agents for Genomics

George Hong, Daniel Trejo Banos

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14315 2025-09-25 cs.LG physics.ao-ph 70%

FedRAIN-Lite: Federated Reinforcement Algorithms for Improving Idealised Numerical Weather and Climate Models

Pritthijit Nath, Sebastian Schemm, Henry Moss, Peter Haynes, Emily Shuckburgh, Mark Webb

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) School of Mathematical Sciences, Lancaster University(兰卡斯特大学数学科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Met Office Hadley Centre(英国气象局哈德利中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments Accepted for poster presentation at the NeurIPS 2025 workshop on Tackling Climate Change with Machine Learning. 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17488 2025-09-23 cs.CR cs.AI 70%

Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agents

Shouju Wang, Fenglin Yu, Xirui Liu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Wuhan University(武汉大学) Microsoft(微软公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

Comments To appear at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16610 2025-09-23 cs.CL 70%

LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts

Junhao Chen, Jingbo Sun, Xiang Li, Haidong Xin, Yuhao Xue, Yibin Xu, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Tongji University(同济大学) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15160 2025-09-19 cs.HC cs.CL cs.GR 70%

An Evaluation-Centric Paradigm for Scientific Visualization Agents

Kuangshi Ai, Haichao Miao, Zhimin Li, Chaoli Wang, Shusen Liu

机构 * Univ. Notre Dame(内布拉斯加大学) LLNL(劳伦斯利弗莫尔国家实验室) Vanderbilt Univ.(范德比大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

Journal ref 1st Workshop on GenAI, Agents, and the Future of VIS (IEEE VIS Conference 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14386 2025-09-19 cs.LG 70%

Disproving the Feasibility of Learned Confidence Calibration Under Binary Supervision: An Information-Theoretic Impossibility

Arjun S. Nair, Kristina P. Sinaga

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

Comments 30 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09356 2025-09-12 cs.AI cs.RO 70%

Curriculum-Based Multi-Tier Semantic Exploration via Deep Reinforcement Learning

Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Abderrezzak Debilou

机构 * Department of Electrical Engineering - Mohamed Khider, University of Biskra, Biskra (Algeria)(巴尔克拉大学电子工程系) Department of Engineering - University of Basilicata, Potenza (Italy)(巴塞里卡大学工程系) Department of Computer, Control, and Management Engineering ``Antonio Ruberti'', Sapienza University of Rome, Rome (Italy)(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

Comments The 19th International Conference on Intelligent Autonomous Systems (IAS 19), 2025, Genoa

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04809 2025-09-09 cs.AI cs.HC 70%

TalkToAgent: A Human-centric Explanation of Reinforcement Learning Agents with Large Language Models

Haechang Kim, Hao Chen, Can Li, Jong Min Lee

机构 * Department of Chemical and Biological Engineering, Seoul National University, Republic of Korea(化学与生物工程系,首尔国立大学) Davidson School of Chemical Engineering, Purdue University, United States(化学工程大卫森学院,普渡大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 31 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04638 2025-09-09 cs.CL cs.CY 70%

Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective

Yiqun Zhang, Xiaocui Yang, Xingle Xu, Zeran Gao, Yijie Huang, Shiyi Mu, Shi Feng, Daling Wang, Yifei Zhang, Kaisong Song, Ge Yu

机构 * Northeastern University, China(东北大学) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13087 2025-09-09 cs.CV cs.AI 70%

Can Machines Imitate Humans? Integrative Turing-like tests for Language and Vision Demonstrate a Narrowing Gap

Mengmi Zhang, Elisa Pavarino, Xiao Liu, Giorgia Dellaferrera, Ankur Sikarwar, Caishun Chen, Marcelo Armendariz, Noga Mudrik, Prachi Agrawal, Spandan Madan, Mranmay Shetty, Andrei Barbu, Haochen Yang, Tanishq Kumar, Shui'Er Han, Aman Raj Singh, Meghna Sadwani, Stella Dellaferrera, Michele Pizzochero, Brandon Tang, Yew Soon Ong, Hanspeter Pfister, Gabriel Kreiman

机构 * College of Computing and Data Science(计算与数据科学学院) Agency for Science Technology and Research(科技研究局) IBM Research - Zürich Rüschlikon(苏黎世IBM研究院) Institute of Neuroinformatics University of Zürich and ETH Zürich(苏黎世大学与ETH神经信息学研究所) Biomedical Engineering Johns Hopkins University(约翰霍普金斯大学生物医学工程) Birla Institute of Technology and Science Pilani(比拉理工学院帕利尼) School of Engineering and Applied Sciences Harvard University(哈佛大学工程与应用科学学院) CSAIL MIT(MIT计算机科学与人工智能实验室) Harvard University(哈佛大学) Jawaharlal Nehru Medical College(尼赫鲁医学院) University of Turin(都灵大学) Symbiosis Institute of Technology(共生技术学院) Children’s Hospital Harvard Medical School(哈佛医学院儿童医院) Center for Brains Minds and Machines(大脑、心灵与机器中心) Department of Physics University of Bath(巴斯大学物理系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 83 pages, 4 main figures, 17 supp figures, and 4 supp tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04794 2025-09-08 cs.CL 70%

Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects

Gunmay Handa, Zekun Wu, Adriano Koshiyama, Philip Treleaven

机构 * University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03331 2025-09-04 cs.SE cs.CR 70%

VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities

Weizhe Wang, Wei Ma, Qiang Hu, Yao Zhang, Jianfei Sun, Bin Wu, Yang Liu, Guangquan Xu, Lingxiao Jiang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00987 2025-09-03 cs.AI 70%

Causal MAS: A Survey of Large Language Model Architectures for Discovery and Effect Estimation

Adib Bazgir, Amir Habibdoust, Yuwen Zhang, Xing Song

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 24 pages. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00244 2025-09-03 cs.AI 70%

Universal Deep Research: Bring Your Own Model and Strategy

Peter Belcak, Pavlo Molchanov

机构 * NVIDIA Research(NVIDIA研究)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19096 2025-08-27 cs.AI 70%

Trustworthy Agents for Electronic Health Records through Confidence Estimation

Yongwoo Song, Minbyul Jeong, Mujeen Sung

机构 * Kyung Hee University(庆熙大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18091 2025-08-26 cs.AI math.OC 70%

Teaching LLMs to Think Mathematically: A Critical Study of Decision-Making via Optimization

Mohammad J. Abdel-Rahman, Yasmeen Alslman, Dania Refai, Amro Saleh, Malik A. Abu Loha, Mohammad Yahya Hamed

机构 * Data Science Department, Princess Sumaya University for Technology(普里姆斯萨大学技术学院数据科学系) Electrical and Computer Engineering Department, Virginia Tech(弗吉尼亚理工大学电气与计算机工程系) Computer Science Department, Princess Sumaya University for Technology(普里姆斯萨大学技术学院计算机科学系) Computer Science Department, King Fahd University of Petroleum and Minerals(国王法赫德石油与矿物大学计算机科学系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏