arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-03 至 2026-06-03 共收录 298 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 46 篇

2606.03103 2026-06-03 cs.AI 70%

DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

DeskCraft: 桌面代理在专业工作流与人在环协作中的基准测试

Wenkai Wang, Tao Xiong, Jingchen Ni, Yunpeng Bao, Xiyun Li, Tianqi Liu, Hongcan Guo, Zilong Huang, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Tencent(腾讯) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出DeskCraft基准,针对专业创意软件中的长周期工作流和主动人机协作,通过多级难度分类和交互协议评估18种代理,发现GPT-5.4在标准任务上达31.6%,交互任务上达27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00555 2026-06-03 cs.AI q-bio.BM 70%

Probe Before You Edit: Probing-Guided Molecular Optimization for LLM Agents in Structure-Based Drug Design

编辑前先探测:基于探测引导的分子优化用于基于结构的药物设计中的LLM代理

Zaifei Yang, Weiyu Chen, Yaqing Wang, James Kwok

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学应用研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出PROBE框架,通过探测口袋-配体复合物的编辑响应来引导LLM代理进行分子优化,解决结合亲和力与成药性之间的冲突,在CrossDocked2020上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22480 2026-06-03 cs.AI cs.CL cs.LG 67%

VeRO: A Harness for Agents to Optimize Agents

VeRO: 用于优化智能体的智能体框架

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Samuel Marc Denton

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出 VeRO 框架和 VeRO-Bench 基准,通过版本化快照、预算控制评估和结构化执行轨迹来优化智能体代码,并实验比较不同优化器对目标智能体的改进效果。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14279 2026-06-03 cs.LG cs.AI cs.CL cs.SI 67%

Whom to Query for What: Adaptive Group Elicitation via Multi-Turn LLM Interactions

为谁查询什么:通过多轮LLM交互的自适应群体征询

Ruomeng Ding, Tianwei Gao, Thomas P. Zollo, Eitan Bachmat, Richard Zemel, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Columbia University(哥伦比亚大学) Ben-Gurion University of the Negev(贝内-约尔大学内盖夫分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对有限预算下群体属性不确定性降低问题,提出结合LLM期望信息增益与异构图神经网络传播的自适应群体征询框架,实现问题与受访者联合选择,在三个真实数据集上显著提升群体响应预测。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02755 2026-06-03 cs.SE cs.AI 62%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02461 2026-06-03 cs.AI cs.CL 62%

AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

AGENTCL:面向语言代理持续学习的严格评估

Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang Yao, Huan Sun, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) Johns Hopkins University(约翰霍普金斯大学) Intuit AI Research(Intuit AI研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AGENTCL评估框架,通过可控任务流和迁移增益指标,严格评估语言代理的持续学习能力,并开发MemProbe探针方法诊断记忆设计的影响。

Comments 10 pages in the main text, 26 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01472 2026-06-03 cs.DC cs.AI cs.LG 62%

Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study

分层在线提示变异与双环反馈用于有护栏的证据文档生成:生产评估案例研究

Nataraj Agaram Sundar, Tejas Morabia

机构 * eBay Inc.(eBay公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出分层在线提示变异框架HOPM,通过双环反馈(人工审核与自动评判)优化提示策略,在真实市场纠纷证据生成中显著提升胜率和质量。

Comments 7 pages. Production-evaluation case study of guardrailed LLM evidence-document generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08935 2026-06-03 cs.AI cs.LG 62%

PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting

PnP-Corrector:一种用于耦合时空预测的通用校正框架

Hao Wu, Fan Xu, Yuxu Lu, Penghao Zhao, Fan Zhang, Hao Jia, Yuxuan Liang, Ruijian Gou, Qingsong Wen, Xian Wu, Xiaomeng Huang, Yuan Gao

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对耦合系统中误差相互放大导致长期预测崩溃的问题,提出一种即插即用的校正框架PnP-Corrector,通过冻结物理模拟引擎并训练校正代理来主动抵消系统偏差,显著提升长期预测的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21731 2026-06-03 cs.CL cs.AI 62%

Identifying Quantum Structure in AI Language: Evidence for Evolutionary Convergence of Human and Artificial Cognition

识别AI语言中的量子结构:人类与人工智能认知进化趋同的证据

Diederik Aerts, Jonito Aerts Arguëlles, Lester Beltran, Suzette Geriente, Roberto Leporini, Massimiliano Sassoli de Bianchi, Sandro Sozzo

机构 * Center Leo Apostel for Interdisciplinary Studies, Vrije Universiteit Brussel (VUB)(利奥·阿波斯泰尔跨学科研究中心,布鲁塞尔自由大学) Department of Economics, University of Bergamo(博洛尼亚大学经济系) Department of Humanities and Cultural Heritage (DIUM) and Centre CQSCS, University of Udine(乌迪内大学人文与文化遗产系及CQSCS中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过对大型语言模型进行认知测试,发现其概念组合中存在贝尔不等式显著违背和玻色-爱因斯坦统计,表明人类与人工智能在概念-语言领域均涌现非经典量子结构,支持认知进化趋同假说。

Journal ref Entropy 28, 622, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23216 2026-06-03 cs.AI cs.LG 62%

Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach

逼真足球模拟中的人性化守门:一种样本高效的强化学习方法

Alessandro Sestini, Joakim Bergdahl, Jean-Philippe Barrette-LaPierre, Florian Fuchs, Brady Chen, Fabio Zinno, Michael Jones, Linus Gisslén

机构 * University of Edinburgh(爱丁堡大学) KTH Royal Institute of Technology(皇家理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种样本高效的深度强化学习方法,通过利用预收集数据和增加网络可塑性,在EA SPORTS FC 25中训练出守门员智能体,其扑救率比内置AI高10%,训练速度比标准DRL快50%,且行为更接近人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 57%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03135 2026-06-03 cs.AI 57%

Uncertainty-Aware Clarification in LLM Agents with Information Gain

基于信息增益的LLM智能体不确定性感知澄清

Mengyi Deng, Zhiwei Li, Xin Li, Tingyu Zhu, Ying Zhao, Zhijiang Guo, Wei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对用户指令不明确导致LLM智能体工具操作错误的问题,提出一种以信息增益奖励为导向的澄清框架,通过贝叶斯信念更新量化澄清问题的效用,训练智能体生成高信息增益的澄清,在τ-Bench环境中将任务成功率提升3.7%,仅增加0.3个交互步骤。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03118 2026-06-03 cs.LG cs.CV q-bio.NC 57%

Learning to See via Epiretinal Implant Stimulation in silico with Model-Based Deep Reinforcement Learning

通过基于模型的深度强化学习在硅上学习经由视网膜上植入物刺激的视觉

Jacob Lavoie, Marwan Besrour, William Lemaire, Jean Rouat, Réjean Fontaine, Eric Plourde

机构 * Department of Electrical Engineering and Computer Engineering, Université de Sherbrooke(电气与计算机工程系, Sherbrooke 大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出使用各向同性和各向异性形状,通过深度强化学习在虚拟患者的视网膜上渲染可理解的图像,以提高人工恢复视觉的清晰度。

Comments 18 pages, 6 figures. Published version: Biomed. Phys. Eng. Express 10, 025006 (2024)

Journal ref Biomed. Phys. Eng. Express 10 (2024) 025006

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02822 2026-06-03 cs.CR cs.AI 57%

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing

哪种防御措施应对哪种威胁?归因OWASP-LLM-Top-10覆盖及其在释义下的脆弱性

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过归因分析,测量了不同防御家族(拒绝过滤、预算控制等)对OWASP-LLM-Top-10威胁的覆盖情况,并揭示了拒绝防御在释义攻击下的脆弱性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08747 2026-06-03 cs.AI 57%

Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents

完成,但不确定:具身智能体中世界完成与自我终止的解耦

Ying Chen, Lihuang Fang, Rui Jiang, Mingxu Wang, Zhifeng Gu, Lei Yi, Jie Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出VIGIL评估框架,通过分离世界状态完成和终端报告正确性,独立衡量智能体的终止承诺能力,并揭示不同模型在相似完成率下终端报告准确性的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03822 2026-06-03 cs.HC 50%

Warning About AI Fallibility Increases Help-Seeking in an Intelligent Tutoring System

关于人工智能易错性的警告在智能辅导系统中增加了求助行为

Tomohiro Nagashima, Mirella Hladký, Vera Rief

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过在数学智能辅导系统中添加关于AI可能出错的简单透明度干预,发现警告学生AI可能犯错显著增加了他们请求提示的次数,但未显著影响即时表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02809 2026-06-03 cs.CV 50%

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型

Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin

机构 * UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目) Department of Radiology, UCSF(UCSF放射科) Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一个自动化管道,从私有放射学报告和3D肿瘤影像生成多选VQA数据集,构建无污染基准,评估六种视觉-语言模型,发现视觉依赖因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18895 2026-06-03 physics.soc-ph 50%

Competition between private and expressed opinions in binary choice: the $α$-EPO $q$-voter model

二元选择中私人意见与表达意见的竞争:$\alpha$-EPO $q$-选民模型

Barbara Kamińska, Barbara Nowak, Arkadiusz Lipiecki, Katarzyna Sznajd-Weron

专题命中 Agent评测 :agent(abstract)

AI总结 针对私人意见与表达意见不一致的现象,提出$\alpha$-EPO $q$-选民模型,通过异步更新参数$\alpha$调控两种意见的更新概率,结合平均场理论和首次发展的配对近似方法,揭示了自我反从众性对集体结果的关键影响。

Journal ref Phys. Rev. E 113 (2026) 064301

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21446 2026-06-03 econ.EM econ.TH 50%

Discrete Choice with Endogenous Peer Selection

内生同伴选择的离散选择模型

Nail Kashaev, Natalia Lazzati

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个连续时间离散选择模型,其中代理人在决策时可能只关注部分同伴,同伴选择机制依赖于近期选择,并利用选择变化和潜在同伴集规模变化来识别偏好和同伴选择机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15155 2026-06-03 cs.DS cs.GT math.OC 50%

Algorithmically Fair Maximization of Multiple Submodular Objective Functions and Implications to Constrained Fair Division

多个子模目标函数的算法公平最大化及其对约束公平划分的影响

Georgios Amanatidis, Georgios Birmpas, Philip Lazos, Stefano Leonardi, Rebecca Reiffenhäuser

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究多个智能体在共同基集上最大化各自子模目标函数的问题,提出并分析了一种简单的轮询协议,证明了贪婪策略在单调和非单调目标下具有近似最优性及公平性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1212.4717 2026-06-03 math.PR cs.IT cs.SY eess.SY math.IT math.OC 50%

Quickest Detection with Discretely Controlled Observations

离散控制观测下的最快检测

Erhan Bayraktar, Ross Kravitz

专题命中 Agent评测 :agent(abstract)

AI总结 研究连续时间贝叶斯最快检测问题,其中观测时间有限,通过跳跃算子方法建立最优策略存在性并设计算法,证明当观测次数趋于无穷时收敛到Shiryaev经典连续观测问题。

Comments Final version. To appear in Sequential Analysis. Keywords: Bayesian changepoint detection; Continuous time; Finitely many sampling rights. 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1201.0552 2026-06-03 eess.SY cs.SY 50%

Reliability Analysis of Electric Power Systems Using an Object-oriented Hybrid Modeling Approach

基于面向对象混合建模方法的电力系统可靠性分析

Markus Schläpfer, Tom Kessler, Wolfgang Kröger

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种结合基于代理的建模与蒙特卡洛模拟的面向对象混合方法,用于评估电力系统概率可靠性并考虑时间相关效应。

Comments Based on the original paper presented at: 16th Power Systems Computation Conference, Glasgow, Scotland, July 14-18, 2008 (PSCC'08)

详情

展开后加载摘要…

URL PDF HTML 收藏
1211.5611 2026-06-03 math.OC cs.SY eess.SY 50%

Distributed Random Projection Algorithm for Convex Optimization

分布式随机投影算法用于凸优化

Soomin Lee, Angelia Nedich

专题命中 Agent评测 :agent(abstract)

AI总结 针对时变网络下的分布式约束凸优化问题,提出分布式随机投影算法,并证明所有智能体迭代几乎必然收敛到最优集,实验表明收敛速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
1102.2361 2026-06-03 eess.SY cs.MA cs.SY math.OC 50%

Convergence of type-symmetric and cut-balanced consensus seeking systems (extended version)

类型对称与切割平衡共识寻求系统的收敛性(扩展版)

Julien M. Hendrickx, John N. Tsitsiklis

专题命中 Agent评测 :agent(abstract)

AI总结 研究具有切割平衡时变交互的连续时间共识寻求系统的收敛性,给出极限值相等的充分条件并证明其必要性,推广至离散时间系统。

Comments update of the file following publication of journal version, including a minor correction in the proof of theorem 1(b). 12 pages, 12 tex files, no figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1205.3668 2026-06-03 cs.RO cs.SY eess.SY nlin.AO physics.comp-ph 50%

Synthesis and Adaptation of Effective Motor Synergies for the Solution of Reaching Tasks

有效运动协同的合成与自适应用于解决到达任务

Cristiano Alessandro, Juan Pablo Carbajal, Andrea d'Avella

专题命中 Agent评测 :agent(abstract)

AI总结 受肌肉协同假说启发,提出一种通过线性组合少量预定义协同(synergies)生成开环控制器的方法,使智能体能够自主合成并适应有效协同集以解决点对点到达任务,显著降低控制问题维度并保持良好性能。

Comments conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1112.0253 2026-06-03 math.OC cs.SY eess.SY 50%

Singularities and global stability of decentralized formations in the plane

平面中分散编队的奇点与全局稳定性

M. -A. Belabbas

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过关联信息流与编队动力学中的奇点,解释了为何含环编队无法全局稳定,并证明即使忽略初始条件零测集,一大类平面含环编队也无法实现全局稳定。

Comments 33 pages, 11 figures, submitted for publication. Replaces and updates the second part of arXiv:1101.2421

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

0908.3565 2026-06-03 math.OC cs.SY eess.SY math.DS 50%

Coverage Optimization using Generalized Voronoi Partition

基于广义Voronoi划分的覆盖优化

K. R. Guruprasad, Debasish Ghose

专题命中 其他Agent :autonomous agent(abstract)

AI总结 本文利用广义Voronoi划分实现异构传感器自主代理的最优部署,以最大化传感器覆盖,并证明广义质心Voronoi配置是局部最优配置。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1110.1151 2026-06-03 math.OC cs.SY eess.SY 50%

Mathematical aspects of decentralized control of formations in the plane

平面编队分散控制的数学方面

M. -A. Belabbas

专题命中 其他Agent :autonomous agent(abstract)

AI总结 本文介绍分散控制稳定性所需的数学背景,包括流形上全局稳定性的推广和非线性系统反馈控制的鲁棒性,并正式定义编队控制问题类别及总结已知结果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏