arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-24 至 2026-04-24 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2601.18491 2026-04-24 cs.AI cs.CC cs.CL cs.CV cs.LG 91%

AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

AgentDoG:一种面向AI代理安全与安全的诊断防护框架

Dongrui Liu, Qihan Ren, Chen Qian, Shuai Shao, Yuejin Xie, Yu Li, Zhonghao Yang, Haoyu Luo, Peng Wang, Qingyu Liu, Binxin Hu, Ling Tang, Jilin Mei, Dadi Guo, Leitao Yuan, Junyao Yang, Guanxu Chen, Qihao Lin, Yi Yu, Bo Zhang, Jiaxuan Guo, Jie Zhang, Wenqi Shao, Huiqi Deng, Zhiheng Xi, Wenjie Wang, Wenxuan Wang, Wen Shen, Zhikai Chen, Haoyu Xie, Jialing Tao, Juntao Dai, Jiaming Ji, Zhongjie Ba, Linfeng Zhang, Yong Liu, Quanshi Zhang, Lei Zhu, Zhihua Wei, Hui Xue, Chaochao Lu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11044 2026-04-24 cs.AI 89%

AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts

AgencyBench:在100万token现实场景中自主代理的前沿评估

Keyu Li, Junhao Shi, Yang Xiao, Mohan Jiang, Jie Sun, Yunze Wu, Dayuan Fu, Shijie Xia, Xiaojie Cai, Tianze Xu, Weiye Si, Wenjie Li, Dequan Wang, Pengfei Liu

机构 * SII Open Source(SII开源)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract,abstract_cn);tool-use(abstract);agentic(abstract)

AI总结 本文提出AgencyBench,通过138个现实场景评估6种核心代理能力,揭示闭源模型在资源效率和反馈修正上的优势,为下一代自主代理的发展提供测试平台。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21131 2026-04-24 cs.CR cs.AI cs.CL cs.LG 82%

Cross-Session Threats in AI Agents: Benchmark, Evaluation, and Algorithms

AI代理中的跨会话威胁:基准测试、评估与算法

Ari Azarafrooz

机构 * Intrinsec AI

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出CSTM-Bench基准数据集,通过信息瓶颈方法评估跨会话检测,并引入CSR_prefix指标,用于评估检测算法的召回率与服务稳定性。

Comments 46 pages, 8 figures. Dataset: https://huggingface.co/datasets/intrinsec-ai/cstm-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21510 2026-04-24 cs.CL 81%

OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving

OptiVerse:一个面向优化问题求解的综合基准

Xinyu Zhang, Boxuan Zhang, Yuchen Wan, Lingling Zhang, YiXing Yao, Bifan Wei, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) Lenovo Research(联想研究院)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.CL

AI总结 OptiVerse通过1000个跨领域问题评估LLM在复杂优化任务中的表现,揭示模型在难题上的性能下降,并提出Dual-View Auditor Agent提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21480 2026-04-24 cs.AI 79%

Efficient Agent Evaluation via Diversity-Guided User Simulation

通过多样性引导的用户模拟实现高效的代理评估

Itay Nakash, George Kour, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出DIVERT框架,通过快照和覆盖引导的方式高效探索代理与用户交互,提升评估效率和覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21090 2026-04-24 cs.SE cs.AI 73%

Structural Quality Gaps in Practitioner AI Governance Prompts: An Empirical Study Using a Five-Principle Evaluation Framework

实践者AI治理提示的结构质量缺口:基于五原则评估框架的实证研究

Christo Zietsman

机构 * Nuphirho Research(Nuphirho研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究通过五原则框架评估34个AGENTS.md治理文件,发现37%的文件模型对数据分类和评估标准缺失,揭示了AI治理提示的结构不完整问题及改进方向。

Comments 8 pages. Experiment, corpus, and evaluation framework publicly available at https://github.com/czietsman/nuphirho.dev/tree/main/experiments/governance-prompts-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28342 2026-04-24 cs.CL cs.LG 73%

Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization

Kernel-Smith:一种统一的进化核优化配方

He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng Yuan, Qinxiu Cheng, Xinchen Xie, Yicheng Chen, Yining Li, Jiaxing Xie, Huanan Dong, Yaguang Wu, Xiangjun Huang, Jian Yang, Hui Wang, Bowen Zhou, Bowen Li, Qipeng Guo, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) MetaX

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 Kernel-Smith结合稳定评估驱动的进化代理与进化导向的后训练配方,通过GPU核与运算符生成实现高性能优化,其在KernelBench上取得最佳速度提升,超越多个前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17085 2026-04-24 cs.LG cs.AI 73%

Why Do Language Model Agents Whistleblow?

为何语言模型代理会泄露信息?

Kushal Agrawal, Frank Xiao, Guido Bergman, Asa Cooper Stickland

机构 * Relativity California Institute of Technology(加州理工学院) BAISH

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在作为工具使用代理时的对齐训练新表现,发现模型可能在无用户指令的情况下披露疑似违规行为,通过多样化场景评估发现模型泄露行为受模型家族、任务复杂度、道德提示和工具提供影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21287 2026-04-24 quant-ph 67%

StabilizerBench: A Benchmark for AI-Assisted Quantum Error Correction Circuit Synthesis

StabilizerBench:一个用于人工智能辅助量子误差校正电路合成的基准测试

Andres Paz, Christian Tarta, Cordelia Yuqiao Li, Mayee Sun, Sarju Patel, Sylvie Lausier

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 StabilizerBench通过192种稳定子码提供了一个基准,涵盖12种家族、4-196个量子比特和距离2-21的代码,分为三个递增难度任务:状态准备电路生成、电路优化和容错电路合成,采用统一评分系统评估AI在量子误差校正中的能力与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20935 2026-04-24 cs.LG cs.AI 62%

Data-Driven Open-Loop Simulation for Digital-Twin Operator Decision Support in Wastewater Treatment

数据驱动的开环仿真用于污水处理厂数字孪生操作员决策支持

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University, Department of Energy(奥尔堡大学能源学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CCSS-RS模型,通过结合上下文编码、驱动因子加权、一致滚动和学生t分布输出,实现了污水处理厂在复杂数据环境下的高精度仿真,验证了其在工业废水处理中的实用价值。

Comments 18 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21529 2026-04-24 cs.MA cs.AI 57%

Architectures for Robust Self-Organizing Energy Systems under Information and Control Constraints

面向信息与控制约束的鲁棒自组织能源系统架构

Emilie Frost, Astrid Nieße

机构 * Department of Computing Science, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特定律大学计算机科学系) Distributed Artificial Intelligence, OFFIS - Institute for Information Technology(分布式人工智能,OFFIS信息技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出考虑信息访问限制和行动限制的观测器与控制器架构变体,评估不同架构下的控制器动作可能性,以提升基于智能体的能源系统在现实应用中的鲁棒性。

Comments This preprint has not undergone peer review (when applicable) or any post-submission improvements or corrections. The Version of Record of this contribution will be published in Agents and Artificial Intelligence, Lecture Notes in Computer Science, and available online at https://doi.org/10.1007/978-3-032-25029-2_19

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 57%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21430 2026-04-24 cs.AI 57%

Brief chatbot interactions produce lasting changes in human moral values

简短的聊天机器人互动会产生持久的人类道德价值观变化

Yue Teng, Qianer Zhong, Kim Mai Tich Nguyen Thordsen, Christian Montag, Benjamin Becker

机构 * Department of Psychology, The University of Hong Kong(香港大学心理学系) Techno-Entrepreneurship Core, The University of Hong Kong(香港大学技术企业家精神核心) Department of Psychology, University of Copenhagen(哥本哈根大学心理学系) Centre for Cognitive and Brain Sciences, Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究院认知与脑科学中心) Department of Psychology, Faculty of Social Sciences, University of Macau(澳门大学社会科学学院心理学系) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) SRT AI, Society & Social Dynamics, Faculty of Social Sciences, The University of Hong Kong(SRT AI,社会与社会动态,香港大学社会科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了指令性AI对话是否能改变道德判断,发现简短互动导致道德评价显著变化,且随时间推移效应增强,但控制条件无变化,表明潜在的未察觉道德价值观操控风险。

详情

展开后加载摘要…

URL PDF HTML 收藏