arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-03 至 2026-04-03 共收录 105 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2604.01437 2026-04-03 cs.SE cs.AI 84%

Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering

可重复、可解释和有效的代理AI在软件工程中的评估

Jingyue Li, André Storhaug

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文分析了18篇关于代理AI在软件工程中评估的论文,提出指南以提升评估的可重复性、可解释性和有效性,通过公开TAR轨迹和LLM交互数据促进不同方法的系统比较。

Comments 7 pages, 5 figures, accepted to the 2nd International Workshop on Responsible Software Engineering (ResponsibleSE 2026), co-located with FSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07013 2026-04-03 cs.LG q-bio.PE stat.ME 79%

Generalized Machine Learning for Fast Calibration of Agent-Based Epidemic Models

通用机器学习用于快速校准基于代理的流行病模型

Sima Najafzadehkhoei, George Vega Yon, Derek S. Meyer, Bernardo Modenesi

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出DeepIMC框架,利用BiLSTM神经网络快速校准基于代理的流行病模型,提升参数估计精度并大幅降低计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01235 2026-04-03 cs.AI 79%

Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology

结构化大语言模型路由在代理专家系统中的运行时负担分配:一种全因子跨后端方法论

Zhou Hanlin, Chan Huah Yong

机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(马来西亚理科大学计算机科学学院) Xiamen Software Vocational & Technical College(厦门软件职业技术学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了结构化LLM路由在代理专家系统中的负担分配问题,提出了一种全因子跨后端方法论,通过全面评估不同后端配置下的性能,揭示了后端特定交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01416 2026-04-03 econ.GN q-fin.EC 78%

Pay-Per-Crawl Pricing for AI: The LM-Tree Agent

按爬取付费定价机制:LM-树代理

Richard Archer, Soheil Ghili, Nima Haghpanah

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出LM-树代理,通过LLM发现内容差异,实现动态定价,提升收益40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00518 2026-04-03 cs.CY 78%

Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum

智能体在受挑战时会修复还是仅回应?挑战、修复与公共纠正在一个部署的智能体论坛中的探讨

Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究比较了部署的智能体论坛Moltbook与Reddit社区,发现Moltbook讨论线程较少,挑战回应率低,修复机制缺失,表明社区维持互动过程对规范教学和修订的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01508 2026-04-03 cs.SE cs.AI 76%

ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems

ToolMisuseBench: 一个用于代理系统中工具误用和恢复的离线确定性基准

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出ToolMisuseBench,用于评估代理系统中工具误用和恢复的性能,包含6800个任务和可复现的评估流程,展示了基于模式意识方法的故障恢复优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00076 2026-04-03 cs.LG cs.AI 73%

Learning to Play Blackjack: A Curriculum Learning Perspective

学习玩21点:从课程学习视角出发

Amirreza Alasti, Efe Erdal, Yücel Celik, Theresa Eimer

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) Leibniz AI Academy(莱布尼茨人工智能学院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型动态生成课程,提升强化学习在复杂环境中的效率和性能,应用于21点游戏,通过分阶段训练提升Q学习和DQN代理的表现。

Comments Accepted as an oral presentation at the International Conference on Distributed Artificial Intelligence (DAI 2025). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00986 2026-04-03 cs.CR cs.AI cs.CL cs.LG 67%

Do Phone-Use Agents Respect Your Privacy?

手机使用代理是否尊重您的隐私?

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen, Tongxu Luo, Jiaxi Bi, Zeyu Qin, Shaobo Wang, Xin Lai, Pengyuan Lyu, Junyi Li, Can Xu, Chengquan Zhang, Han Hu, Ming Yan, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学) Hunyuan Team, Tencent(腾讯混元团队)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01241 2026-04-03 cs.NE cs.AI cs.LG 62%

A Learning-Based Cooperative Coevolution Framework for Heterogeneous Large-Scale Global Optimization

基于学习的异质大规模全局优化合作共演框架

Wenjie Qiu, Zixin Wang, Hongyu Fang, Zeyuan Ma, Yue-Jiao Gong

机构 * South China University of Technology(华南理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LH-CC框架,通过将优化过程建模为马尔可夫决策过程,动态选择适配的优化器以解决异质大规模全局优化问题,实验表明其在解质量和计算效率上优于现有方法。

Comments 13 pages, 5 figures, 3 tables. Accepted for publication in GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00979 2026-04-03 cs.CL cs.AI 62%

Dual Optimal: Make Your LLM Peer-like with Dignity

双最优:使你的大语言模型具有尊严的同行

Xiangqi Wang, Yue Huang, Haomin Zhuang, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Dignified Peer框架,通过反阿谀和可信性对抗逃避服务模式,利用PersonaKnob数据集和容忍约束Lagrangian DPO算法,构建具有尊严和同行能力的语言模型代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15555 2026-04-03 cs.LG 57%

Doubly Robust Estimation of Causal Effects in Strategic Equilibrium Systems

在战略均衡系统中因果效应的双重稳健估计

Sibo Xiao

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SDR估计器,结合战略均衡建模与双重稳健估计,解决战略行为导致的内生处理分配问题,理论证明其一致性与渐近正态性,实验证明在不同战略强度下具有更高的偏倚减少效果。

Comments In systems with causal effects, a large majority of individuals are mistakenly classified as using a certain strategy by the strategic equilibrium solver, resulting in the introduction of this feature as an independent variable in causal inference without specificity. This method may have an inherent error

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01637 2026-04-03 cs.CR cs.AI 57%

Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection

SecLens:针对安全漏洞检测LLM的角色特定评估

Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

机构 * Mattersec Labs(Mattersec实验室) Kalmantic Labs(Kalmantic实验室)

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI

AI总结 SecLens引入多利益相关者评估框架,通过角色特定加权配置评估LLM在安全漏洞检测中的性能差异,揭示多目标问题的本质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-04-03 cs.AI 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14211 2026-04-03 math.NA cs.NA 50%

Inference of interacting kernel in the mean-field regime

在均场极限下相互作用核的推断

Peiyi Chen, Qin Li, Li Wang, Yunan Yang

专题命中 Agent评测 :agent(abstract)

AI总结 研究在均场极限下通过宏观测量重建相互作用核的问题,比较粒子系统与均场PDE的建模方法,证明两者在弱意义下接近且具有O(N^{-1/2})的收敛率。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01790 2026-04-03 eess.SY cs.SY 50%

Set-Theoretic Receding Horizon Control for Obstacle Avoidance and Overtaking in Autonomous Highway Driving

集合论递推时间框架用于自动驾驶高速公路上的障碍物规避和超车

Gianni Cario, Valentino Carriuolo, Alessandro Casavola, Gianfranco Gagliardi, Marco Lupia, Franco Angelo Torchiaro

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出基于集合论的快速MPC技术,用于自动驾驶车辆在高速公路超车时的障碍物规避运动规划,通过递推时间框架减少计算时间并提高实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏