arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2512.04111 2026-05-22 cs.SE cs.AI cs.HC 76%

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10990 2026-05-13 cs.SE cs.AI 76%

Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries

技能漂移是合同违约:为LLM代理技能库的主动维护

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

AI总结 本文提出通过提取可执行环境合同来检测LLM代理技能库中的技能漂移,通过区分噪声监控与精准维护信号,提升检测精度和修复效果,同时发布了一个技能退化基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE 76%

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22934 2026-04-28 cs.AI cs.CL 76%

PExA: Parallel Exploration Agent for Complex Text-to-SQL

PExA:复杂文本到SQL的并行探索代理

Tanmay Parekh, Ella Hofmann-Coyle, Shuyi Wang, Sachith Sri Ram Kothur, Srivas Prasad, Yunmo Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Bloomberg(彭博)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出PExA,通过软件测试覆盖视角解决文本到SQL的延迟与性能权衡问题,通过并行执行测试用例确保语义覆盖,最终生成准确的SQL。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12261 2026-04-21 cs.CL cs.AI 76%

Infherno: End-to-end Agent-based FHIR Resource Synthesis from Free-form Clinical Notes

Infherno:从非结构化临床笔记到端到端的FHIR资源合成

Johann Frei, Nils Feldhus, Lisa Raithel, Roland Roller, Alexander Meyer, Frank Kramer

机构 * IT-Infrastructure for Translational Medical Research(转化医学研究信息基础设施) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林) IKIM, Charité - Universitätsmedizin Berlin(IKIM,柏林夏里特大学医学中心)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出Infherno框架,利用LLM代理、代码执行和医疗术语数据库工具,解决从非结构化临床笔记到FHIR资源的端到端合成问题,实现与人类基线的竞争力。

Comments EACL 2026 System Demonstrations | Code: https://github.com/j-frei/Infherno | Demo: https://infherno.misit-augsburg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01508 2026-04-03 cs.SE cs.AI 76%

ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems

ToolMisuseBench: 一个用于代理系统中工具误用和恢复的离线确定性基准

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出ToolMisuseBench,用于评估代理系统中工具误用和恢复的性能,包含6800个任务和可复现的评估流程,展示了基于模式意识方法的故障恢复优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 76%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 76%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03142 2026-03-04 cs.CL cs.AI 76%

APRES: An Agentic Paper Revision and Evaluation System

APRES:一种代理论文修订与评估系统

Bingchen Zhao, Jenny Zhang, Chenxi Whitehouse, Minqi Jiang, Michael Shvartsman, Abhishek Charnalia, Despoina Magka, Tatiana Shavrina, Derek Dunfield, Oisin Mac Aodha, Yoram Bachrach

机构 * Meta Superintelligence Labs(Meta 超智能实验室) University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL

AI总结 APRES利用大型语言模型改进论文质量,通过评估标准提升引用预测,79%的专家更喜欢修订后的论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00377 2026-01-15 cs.HC cs.AI cs.CV cs.LG 76%

Beyond One-Size-Fits-All: A Survey of Personalized Affective Computing in Human-Agent Interaction

超越通用方案:人机交互中个性化情感计算的综述

Jialin Li, Maha Elgarf, Alia Waleed, Hanan Salam

机构 * Social Machines & Robotics (SMART) Lab, and the Center of AI & Robotics (CAIR), New York University, Abu Dhabi(社会机器与机器人(SMART)实验室,以及人工智能与机器人中心(CAIR),纽约大学阿布扎克分校) SMART Lab, New York University, Abu Dhabi(社会机器与机器人实验室,纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文综述了人机交互中个性化情感计算的方法与挑战,提出分类体系并分析了不同交互模式和情境下的个性化技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00316 2025-11-05 cs.LG cs.AI q-bio.QM 76%

Surrogate modeling of Cellular-Potts Agent-Based Models as a segmentation task using the U-Net neural network architecture

Tien Comlekoglu, J. Quetzalcóatl Toledo-Marín, Tina Comlekoglu, Douglas W. DeSimone, Shayn M. Peirce, Geoffrey Fox, James A. Glazier

机构 * Department of Biomedical Engineering, University of Virginia(生物医学工程系,弗吉尼亚大学) Department of Cell Biology, University of Virginia(细胞生物学系,弗吉尼亚大学) TRIUMF, Vancouver, BC, Canada(TRIUMF,加拿大温哥华,不列颠哥伦比亚省) Perimeter Institute for Theoretical Physics, Waterloo, ON, Canada(理论物理研究所,加拿大水疗,安大略省) Beirne B. Carter Center for Immunology Research, University of Virginia(免疫学研究中心,弗吉尼亚大学) Biocomplexity Institute and the Department of Computer Science, University of Virginia(生物复杂性研究所和计算机科学系,弗吉尼亚大学) Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03665 2025-11-04 cs.LG cs.AI 76%

A DbC Inspired Neurosymbolic Layer for Trustworthy Agent Design

Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26298 2025-10-31 cs.CL cs.AI 76%

Can Agent Conquer Web? Exploring the Frontiers of ChatGPT Atlas Agent in Web Games

Jingran Zhang, Ning Li, Justin Cui

机构 * UC San Deigo(圣德戈大学) UCLA(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16275 2025-09-23 cs.CR cs.AI cs.SE 76%

SecureFixAgent: A Hybrid LLM Agent for Automated Python Static Vulnerability Repair

Jugal Gajjar, Kamalasankari Subramaniakuppusamy, Relsy Puthal, Kaustik Ranaware

机构 * Computer Science Department(计算机科学系) Applied Economics Department(应用经济学系)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

Comments 6 pages, 3 figures, 4 tables, 1 algorithm, accepted in the Robustness and Security of Large Language Models (ROSE-LLM) special session at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11415 2025-07-15 cs.CL cs.AI 76%

Political Bias in LLMs: Unaligned Moral Values in Agent-centric Simulations

Simon Münker

机构 * Journal for Language Technology and Computational Linguistics(语言技术与计算语言学期刊)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 14 pages, 2 tables

Journal ref JLCL 2025, Band 38(2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05284 2025-06-17 cs.AI cs.LG 76%

Can a Bayesian Oracle Prevent Harm from an Agent?

Yoshua Bengio, Michael K. Cohen, Nikolay Malkin, Matt MacDermott, Damiano Fornasiere, Pietro Greiner, Younesse Kaddar

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments Accepted at UAI 2025 (Uncertainty in Artificial Intelligence). 20 pages, 2 figures. Code available at: https://github.com/saifh-github/conservative-bayesian-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21138 2025-05-19 cs.AI cs.LG math.ST stat.ML stat.TH 76%

A Computational Theory for Efficient Mini Agent Evaluation with Causal Guarantees

Hedong Yan

机构 * Institute of Computing Technology Chinese Academy of Sciences(计算技术研究所中国科学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00049 2025-05-02 cs.CY cs.CL cs.HC cs.LG 76%

Humanizing LLMs: A Survey of Psychological Measurements with Tools, Datasets, and Human-Agent Applications

Wenhan Dong, Yuemeng Zhao, Zhen Sun, Yule Liu, Zifan Peng, Jingyi Zheng, Zongmin Zhang, Ziyi Zhang, Jun Wu, Ruiming Wang, Shengmin Xu, Xinyi Huang, Xinlei He

机构 * Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)信息中心) School of Psychology, South China Normal University(华南师范大学心理学学院) College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全学院) College of Cyber Security, Jinan University(济南大学网络安全学院)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

Comments 26 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05295 2025-04-23 cs.CR cs.AI cs.LG 76%

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

Xiaogeng Liu, Peiran Li, Edward Suh, Yevgeniy Vorobeychik, Zhuoqing Mao, Somesh Jha, Patrick McDaniel, Huan Sun, Bo Li, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Cornell University(康奈尔大学) Washington University, St. Louis(圣路易斯华盛顿大学) University of Michigan, Ann Arbor(安娜堡大学) The Ohio State University(俄亥俄州立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments ICLR 2025 Spotlight. Project Page: https://autodans.github.io/AutoDAN-Turbo Code: https://github.com/SaFoLab-WISC/AutoDAN-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20513 2025-03-03 cs.HC cs.AI cs.LG 76%

Personas Evolved: Designing Ethical LLM-Based Conversational Agent Personalities

Smit Desai, Mateusz Dubiel, Nima Zargham, Thomas Mildner, Laura Spillner

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12633 2025-02-20 cs.CL cs.AI 76%

One Size doesn't Fit All: A Personalized Conversational Tutoring Agent for Mathematics Instruction

Ben Liu, Jihan Zhang, Fangquan Lin, Xu Jia, Min Peng

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14735 2025-02-18 cs.CL cs.AI cs.NE 76%

Agent Skill Acquisition for Large Language Models via CycleQD

So Kuroki, Taishi Nakamura, Takuya Akiba, Yujin Tang

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments To appear at the 13th International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02576 2025-02-07 cs.LG cs.AI 76%

CTD4 -- A Deep Continuous Distributional Actor-Critic Agent with a Kalman Fusion of Multiple Critics

David Valencia, Henry Williams, Yuning Xing, Trevor Gee, Bruce A MacDonald, Minas Liarokapis

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13125 2024-12-16 cs.CL cs.AI 76%

TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning

Xiang Li, Yunshi Lan, Chao Yang

专题命中 Agent评测 :planning(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09114 2024-11-05 cs.CR cs.AI cs.LG cs.PF 76%

Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities

Andrey Anurin, Jonathan Ng, Kibo Schaffer, Jason Schreiber, Esben Kran

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments https://cybercapabilities.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15232 2024-10-21 cs.CL cs.AI cs.IR 76%

Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent Conversations

Yucheng Jiang, Yijia Shao, Dekun Ma, Sina J. Semnani, Monica S. Lam

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17695 2024-10-16 cs.AI cs.CL 76%

Enhancing Agent Learning through World Dynamics Modeling

Zhiyuan Sun, Haochen Shi, Marc-Alexandre Côté, Glen Berseth, Xingdi Yuan, Bang Liu

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12716 2024-05-22 cs.AI cs.LG cs.MA 76%

Reinforcement Learning Enabled Peer-to-Peer Energy Trading for Dairy Farms

Mian Ibad Ali Shah, Enda Barrett, Karl Mason

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.LG

Comments Proc. of the Main Track of 22nd International Conference on Practical Applications of Agents and Multi-Agent Systems, 26th-28th June, 2024, https://www.paams.net/. Includes 6 figures, 1 table and 32 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01574 2024-05-06 cs.SE cs.AI 76%

On Using Agent-based Modeling and Simulation for Studying Blockchain Systems

Önder Gürcan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

Comments 2 pages, "JFMS 2020 -- Les Journees Francophones de la Modelisation et de la Simulation -- Convergences entre la Theorie de la Modelisation et la Simulation et les Systemes Multi-Agents"

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03220 2024-01-17 cs.CL cs.AI cs.GT 76%

ALYMPICS: LLM Agents Meet Game Theory -- Exploring Strategic Decision-Making with AI Agents

Shaoguang Mao, Yuzhe Cai, Yan Xia, Wenshan Wu, Xun Wang, Fengyi Wang, Tao Ge, Furu Wei

专题命中 Agent评测 :AI agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏