arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-06 至 2026-04-06 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2509.19185 2026-04-06 cs.SE cs.ET 92%

An Empirical Study of Testing Practices in Open Source AI Agent Frameworks and Agentic Applications

对开源AI代理框架和代理应用测试实践的实证研究

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.SE

AI总结 本文通过分析39个开源代理框架和439个代理应用,发现确定性组件消耗了70%的测试资源,而FM-based Plan Body测试不足,提出改进测试方法和促进Prompt回归测试的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02792 2026-04-06 cs.CY cs.HC 85%

Generative AI Use in Professional Graduate Thesis Writing: Adoption, Perceived Outcomes, and the Role of a Research-Specialized Agent

生成AI在专业研究生论文写作中的应用:采用情况、感知成果及研究专用代理的作用

Kenji Saito, Rei Tajika, Satoru Shibuya, Hiroshi Kanno

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 研究探讨了生成AI在研究生论文写作中的应用现状、学生感知效果及研究专用代理的作用,发现AI使用广泛,学生普遍认为其提升了论文结构、修订质量和写作效率,但对输出准确性仍存顾虑。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02837 2026-04-06 cs.CR cs.AI 83%

Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis

面向安全的智能体技能:架构、威胁分类与安全分析

Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文首次系统分析了智能体技能框架的安全性,识别各生命周期阶段的攻击面,构建了包含七类十七种场景的威胁分类,并提出针对各威胁类别的防御方向和研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21064 2026-04-06 cs.LG cs.AI 82%

Textual Equilibrium Propagation for Deep Compound AI Systems

文本平衡传播用于深度复合人工智能系统

Minghui Chen, Wenlong Deng, James Zou, Han Yu, Xiaoxiao Li

机构 * Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出文本平衡传播(TEP),通过局部学习原理解决长周期工作流中文本梯度爆炸和消失问题,提升深度复合AI系统的准确性和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03131 2026-04-06 cs.CR cs.AI 81%

A Systematic Security Evaluation of OpenClaw and Its Variants

对OpenClaw及其变种的系统性安全评估

Yuhang Wang, Haichang Gao, Zhenxing Niu, Zhaoxiang Liu, Wenjing Zhang, Xiang Wang, Shiguo Lian

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文系统评估了六个OpenClaw系列代理框架的安全性,发现代理系统存在显著安全漏洞,且其风险高于孤立使用的基础模型。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 79%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27176 2026-04-06 cs.AI cs.CL cs.DC 79%

Glia: A Human-Inspired AI for Automated Systems Design and Optimization

Glia:一种受人类启发的AI,用于自动化系统设计与优化

Pouya Hamadanian, Pantea Karimi, Arash Nasr-Esfahany, Kimia Noorbakhsh, Joseph Chandler, Ali ParandehGheibi, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Glia通过人类启发的多智能体工作流利用大语言模型,生成可解释的系统设计,展示了AI在复杂系统问题中创造性和可理解性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02648 2026-04-06 cs.SE cs.AI 73%

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

GBQA:用于评估LLM作为质量保证工程师的博弈基准

Shufan Jiang, Chios Chen, Zhiyang Chen

机构 * The University of Hong Kong(香港大学) Independent Researcher(独立研究者) Westlake University(西湖大学) Datawhale Org(Datawhale组织)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出GBQA基准,通过30款游戏和124个经人类验证的bug测试LLM自主发现软件缺陷的能力,实验表明最佳模型仅能识别48.39%的bug。

Comments Accepted as a workshop paper at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18985 2026-04-06 cs.SI 71%

Simulating Online Social Media Conversations on Controversial Topics Using AI Agents Calibrated on Real-World Data

利用真实数据校准的AI代理模拟争议性话题的在线社交媒体对话

Elisa Composta, Nicolo' Fontana, Francesco Corso, Francesco Pierri

专题命中 Agent评测 :AI agent(title)

AI总结 本文研究了基于LLM的代理在模拟微博客社交网络中的行为,探讨了其在不同场景下生成内容、互动及意见演变的机制,发现其生成内容在语气和毒性方面不如真实数据多样,需更精细的认知建模以模拟人类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI 70%

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :autonomous agent(abstract);tool use(abstract);分类 cs.AI

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 70%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 62%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02869 2026-04-06 cs.AI 57%

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

多轮强化学习用于工具调用代理的迭代奖励校准

Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(Amity研究与应用中心(ARAC))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出MT-GRPO与GTPO结合的方法,通过迭代奖励校准提升工具调用代理性能,在真实客服任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02834 2026-04-06 cs.AI 57%

ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents

ESL-Bench: 一个基于事件的合成纵向基准用于健康代理

Chao Li, Cailiang Liu, Ang Gao, Kexin Deng, Shu Zhang, Langping Xu, Xiaotong Shi, Xionghao Ding, Jian Pei, Xun Jiang

机构 * Shanda Group(盛大集团)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 ESL-Bench通过合成100个用户数据,涵盖健康档案、多阶段叙事计划、日常设备测量、定期检查记录和事件日志,评估健康代理在多源轨迹推理中的性能,发现数据库代理在比较和解释任务中显著优于记忆增强RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 57%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02666 2026-04-06 cs.AI math.OC 57%

Let's Have a Conversation: Designing and Evaluating LLM Agents for Interactive Optimization

让我们交谈:设计和评估用于交互优化的LLM代理

Joshua Drossman, Alexandre Jacquillat, Sébastien Martin

机构 * Operations Research Center and Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院运筹学研究中心和斯隆管理学院) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的评估方法,通过对话评估优化代理,展示交互优化代理在解决学校调度问题时能获得更高质量的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02348 2026-04-06 cs.LG 57%

Contextual Intelligence The Next Leap for Reinforcement Learning

情境智能:强化学习的下一步

André Biedenkapp

机构 * Albert-Ludwigs-Universität(弗莱堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出情境智能的新框架,通过区分环境驱动和代理驱动因素,探索异构情境学习、多时间尺度建模和抽象高层情境整合,以提升强化学习的泛化能力与现实应用效率。

Comments Accepted to AAMAS 2025 (Blue Sky Ideas Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02862 2026-04-06 q-fin.MF cs.GT 50%

When cooperation is beneficial to all agents

当合作对所有智能体有利时

Alessandro Doldi, Marco Frittelli, Marco Maggis

专题命中 Agent评测 :agent(abstract)

AI总结 本文在一般半鞅框架下研究集体市场效率与个体理性之间的关系,推导了存在增加间接效用的交换的充要条件,并阐述了偏好与集体定价措施的兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏