arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-02 至 2026-04-02 共收录 141 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2604.00842 2026-04-02 cs.AI cs.LG cs.MA 81%

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

主动代理研究环境:模拟活跃用户以评估主动助手

Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Apple, USA(苹果公司(美国)) University of Washington(华盛顿大学) Independent Researcher, USA(独立研究员(美国))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pare框架,通过状态机模拟用户交互,构建并评估主动代理,同时引入Pare-Bench基准测试143种不同任务,测试上下文感知、目标推理和多应用协调能力。

Comments 34 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00477 2026-04-02 cs.AI cs.CL cs.HC cs.MA 81%

Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation

对数评分,幂律发现:在基于代理的评估中区分测量与覆盖

HyunJoon Jung, William Na

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文通过960次实验展示基于代理的评估在Turing式验证中与人类评分无差异,发现评分与独特问题发现之间存在对数与幂律的分离,揭示了发现空间的幂律分布特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19837 2026-04-02 cs.AI cs.LG 81%

Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent

Björn Hoppmann, Christoph Scholz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00284 2026-04-02 cs.AI cs.MA 79%

Improvisational Games as a Benchmark for Social Intelligence of AI Agents: The Case of Connections

即兴游戏作为AI代理社交智能的基准测试:以Connections为例

Gaurav Rajesh Parikh, Angikar Ghosal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。

Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00215 2026-04-02 eess.SY cs.SY 79%

Agentic AI for Clinical Urgency Mapping and Queue Optimization in High-Volume Outpatient Departments: A Simulation-Based Evaluation

面向高流量门诊部的临床紧急程度映射与队列优化的代理AI:基于模拟的评估

Ravish Gupta, Saket Kumar, Maulik Dang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出一种代理AI框架,通过模拟评估在印度公立医院门诊部中,利用多语言症状捕捉、严重性预测、医生分配优化等方法,提升危急患者处理效率,实现紧急程度动态调整和队列优化。

Comments 17 pages, 3 figures, 7 tables. Code available at https://github.com/ravyg/opd-agentic-ai-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03823 2026-04-02 cs.SE cs.AI cs.CL 78%

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

SWE-CI:通过持续集成评估代理在维护代码库中的能力

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Skylenage

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01221 2026-04-02 cs.AI cs.CV 77%

HippoCamp: Benchmarking Contextual Agents on Personal Computers

HippoCamp:在个人电脑上对上下文代理进行基准测试

Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu, Hoang-Nhat Nguyen, Yichi Zhang, Zujin Guo, Mengying Yu, Zinan Zhang, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S-Lab)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 HippoCamp是一个新的基准,用于评估代理在多模态文件管理中的能力,通过用户为中心的环境建模个体用户档案并搜索大规模个人文件进行上下文感知推理,揭示了当前代理在真实环境中的局限性。

Comments Project Page: https://hippocamp-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01128 2026-04-02 cs.CL cs.AI cs.LG 75%

Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

论文重构评估:评估AI论文中的表现和幻觉

Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko Yamasaki, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。

Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00293 2026-04-02 cs.LG stat.ML 74%

SYNTHONY: A Stress-Aware, Intent-Conditioned Agent for Deep Tabular Generative Models Selection

SYNTHONY:一种考虑压力的、基于意图的深度表格生成模型选择代理

Hochan Son, Xiaofeng Lin, Jason Ni, Guang Cheng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本文提出SYNTHONY,一种基于意图的表格生成模型选择框架,通过压力分析选择最佳合成器,提升模型在不同数据分布下的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00022 2026-04-02 cs.CL cs.AI 73%

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

对话商业结果中LLM作为评判者的标准效度准则

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 73%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08522 2026-04-02 cs.CL 70%

AlphaResearch: Accelerating New Algorithm Discovery with Language Models

AlphaResearch:利用语言模型加速新算法发现

Zhaojian Yu, Kaiyue Feng, Yilun Zhao, Shilin He, Xiao-Ping Zhang, Arman Cohan

机构 * Tsinghua University(清华大学) New York University(纽约大学) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00362 2026-04-02 cs.AI cs.LG 62%

In harmony with gpt-oss

与gpt-oss和谐共处

Borislav Mavrin

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过逆向工程gpt-oss-20b的工具调用机制,构建了原生和谐代理框架,实现了对OpenAI发布分数的独立复现,提升了工具调用精度和评分表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00352 2026-04-02 cs.LG 57%

Deep Learning-Accelerated Surrogate Optimization for High-Dimensional Well Control in Stress-Sensitive Reservoirs

深度学习加速的代理优化用于高维井控在应力敏感性储层中

Mahammad Valiyev, Jodel Cornelio, Behnam Jafarpour

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种基于深度学习的代理优化框架,用于高维井控优化,通过问题导向的采样策略和神经网络代理,提升高维模拟器问题的计算效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27592 2026-04-02 eess.SY cs.LG cs.SY 57%

Fundamental Limits of Man-in-the-Middle Attack Detection in Model-Free Reinforcement Learning

模型无关强化学习中中间人攻击检测的基本限制

Rishi Rani, Massimo Franceschetti

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了基于学习的中间人攻击检测问题,改进了BDD框架,通过允许奖励函数依赖当前和后续状态来捕捉攻击引起的奖励变化,并证明了检测效率的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06026 2026-04-02 cs.GT cs.DS cs.LG 57%

Incentivizing Exploration with Selective Data Disclosure

通过选择性数据披露激励探索

Nicole Immorlica, Jieming Mao, Aleksandrs Slivkins, Zhiwei Steven Wu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种激励高效探索的推荐系统,通过选择性披露过去代理的数据,实现序列社会学习,采用灵活的频数行为模型,优化探索的遗憾率。

Comments The ACM-EC 2020 conference publication corresponds to the Feb'20 version. Section 7 ("robustness") and Section 8 (the numerical study) were added in, resp., Dec'20 and Nov'24. New discussions (Section 3.2.1 and Appendix B) were added in April'26, as well as a partial reframing of the motivating story to emphasize transparency and deemphasize commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00265 2026-04-02 cs.CV cs.AI 57%

Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation

交互基准测试,超越策略:协作实例物体导航的可重复基准

Edoardo Zorzi, Francesco Taioli, Yiming Wang, Marco Cristani, Alessandro Farinelli, Alberto Castellini, Loris Bazzani

机构 * Sapienza University of Rome(罗马大学) University of Verona(维罗纳大学) Polytechnic of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Reykjavik University(雷克雅未克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出QAsk-Nav基准,用于评估协作实例物体导航中的导航与协作问答能力,提供轻量级问答协议和高质量数据集,开发出更高效且性能更优的Light-CoNav模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00826 2026-04-02 eess.SY cs.SY 50%

Bridging RL and MPC for mixed-integer optimal control with application to Formula 1 race strategies

将强化学习与MPC结合用于混合整数最优控制:应用于F1赛车策略

Joschua Wüthrich, Romir Damle, Giona Fieni, Melanie N. Zeilinger, Christopher H. Onder, Andrea Carron

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种融合强化学习与模型预测控制的混合框架,用于混合整数最优控制,通过训练RL代理在完整混合动作空间中实现与马尔可夫决策过程成本的一致性,并在F1赛车策略问题中验证了该框架的递归可行性与性能。

Comments 8 pages, 5 figures; This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2603.05735 2026-04-02 hep-ex cs.AI hep-ph 83%

Agentic AI -- Physicist Collaboration in Experimental Particle Physics: A Proof-of-Concept Measurement with LEP Open Data

代理AI——粒子物理实验中的物理学家协作:利用LEP开放数据的证明概念测量

Anthony Badea, Yi Chen, Marcello Maggi, Yen-Jie Lee, Electron-Positron Alliance

机构 * University of Chicago, Enrico Fermi Institute(芝加哥大学恩里科·费米研究所) Vanderbilt University(范德堡大学) Laboratory for Nuclear Science, Massachusetts Institute of Technology(麻省理工学院核科学实验室)

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文展示了一种利用AI代理对电子-正电子碰撞中的 thrust 分布进行测量的方法,通过迭代贝叶斯展开和蒙特卡罗修正,实现了精确的谱分析,探索了AI在实验和理论计算中的协同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00350 2026-04-02 cs.RO cs.AI 57%

Go Big or Go Home: Simulating Mobbing Behavior with Braitenbergian Robots

要么大举进攻,要么全盘退出:基于布拉提恩格机器人模拟群体排斥行为

Elaheh Sanoubari

专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI

AI总结 本文通过Webots平台模拟布拉提恩格机器人在面对光源时的群体排斥行为,探讨了叫声范围和机器人数量对群体攻击成功率的影响。

Comments This work was completed in 2019 as a final project for a graduate course at the University of Waterloo, titled: ECE 750 - Artificial Life: Embodied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏