arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 234 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 32 篇

2605.28465 2026-05-28 cs.CL 70%

Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents

超越单一路径:评估与增强交互式LLM代理的发散性思维

Jihyeong Park, Ingeol Baek, Jeonghyun Park, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出交互式基准MUTATE和策略ReDNA,用于评估和增强LLM代理在路径和动作层面的发散性思维,解决现有框架中即时收敛压力导致的动作固定问题。

Comments 28 pages, 16 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26959 2026-05-28 cs.LO cs.CL 70%

MerLean-Prover: A Recursive Looping Harness for Lean 4 Theorem Proving

MerLean-Prover:用于 Lean 4 定理证明的递归循环框架

Jinzheng Li, Zeru Zhu, Yuanjie Ren

机构 * Northeastern University(东北大学) Stony Brook University(石溪大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22166 2026-05-28 cs.AI 70%

Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents

适配接口而非模型:面向确定性LLM智能体的运行时框架适配

Tianshi Xu, Huifeng Wen, Meng Li

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出Life-Harness运行时框架,通过从训练轨迹中演化出可复用的环境侧干预,在不修改模型权重或评估环境的情况下,显著提升冻结LLM智能体在确定性任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15015 2026-05-28 cs.LG 70%

Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control

强化学习算法在大规模流动控制中的即插即用基准测试

Jannis Becktepe, Aleksandra Franz, Nils Thuerey, Sebastian Peitz

机构 * TU Dortmund University(图卢兹大学) Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Technical University Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出首个完全基于PyTorch、可微分的强化学习流动控制基准套件FluidGym,通过标准化评估协议实现控制方法的系统比较。

Comments Accepted to ICML 2026. Code available at https://github.com/safe-autonomous-systems/fluidgym

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 67%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-05-28 cs.AI cs.DC cs.LG cs.SI q-fin.CP 62%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14585 2026-05-28 cs.AI cs.CL 62%

Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems

提示优化如同抛硬币:诊断其在复合AI系统中何时有效

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大量实验发现提示优化在复合AI系统中效果不稳定,仅当任务具有可挖掘的输出结构时才有帮助,并提供了两阶段诊断方法。

Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 57%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28287 2026-05-28 cs.LG cond-mat.mtrl-sci 57%

AtomComposer: Discovering Chemical Space from First Principles with Reinforcement Learning

AtomComposer: 基于强化学习从第一性原理发现化学空间

Bjarke Hastrup, Francois Cornet, Tejs Vegge, Arghya Bhowmik

机构 * Dept. of Energy Conversion and Storage, Technical University of Denmark(丹麦技术大学能源转换与存储系) Dept. of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Center for Accelerating P2X Materials Discovery (CAPeX), Kgs. Lyngby, Denmark(加速P2X材料发现的先锋中心(CAPeX),Lyngby,丹麦)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出AtomComposer,一种无需预训练数据、通过在线强化学习自主构建有效3D异构体的智能体,在未见化学式上发现的异构体数量比现有方法多一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-05-28 cs.PL cs.CL 57%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments Preprint. Code: https://github.com/InternLM/Skill-as-Pseudocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23472 2026-05-28 cs.AI 57%

Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization

Escher-Loop:通过闭环自我指涉优化的共同进化

Ziyang Liu, Xinyan Guo, Xuchen Wei, Han Hao, Liu Yang

机构 * Shenzhen X-Institute(深圳X研究所) Soochow University(苏州大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 提出Escher-Loop框架,通过任务代理和优化代理的闭环共同进化及动态基准机制,实现超越静态基线的持续性能提升。

Comments The first three authors contributed equally. Corresponding Authors: Han Hao, Liu Yang

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02259 2026-05-28 cs.LG cs.CV 57%

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

聚焦分割:在干扰物存在下引导潜在动作模型

Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对动作相关视觉干扰导致潜在动作模型失效的问题,提出MaskLAM方法,利用分割基础模型(如SAM)零样本获取智能体掩码,限制重建目标于智能体像素,迫使潜在动作编码内源动态,显著提升下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28757 2026-05-28 math.OC 50%

Learning Approximate Solutions to Multiparametric Generalized Nash Equilibrium Problems

学习多参数广义纳什均衡问题的近似解

A. Bemporad, T. Tatarenko

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种基于学习的方法,利用Nikaido-Isoda间隙函数作为训练损失,通过值函数代理避免双层优化,快速近似求解目标与约束均耦合的多参数广义纳什均衡问题。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28330 2026-05-28 cs.RO 50%

Chance-Constrained MPPI under State and Dynamic Object Prediction Uncertainty and the Evaluation of Collision Risk Calibration

状态与动态物体预测不确定性下的机会约束MPPI及碰撞风险校准评估

Benjamin Serfling, Konrad Doll, Kati Radkhah-Lens

机构 * Faculty of Engineering and Informatics, University of Applied Sciences Aschaffenburg(应用科学阿施芬堡大学工程与信息学院)

专题命中 Agent评测 :planning(abstract)

AI总结 针对机会约束MPPI控制中上游不确定性校准不足导致的过自信或过保守问题,提出DUCCT-MPPI架构,通过无迹变换和蒙特卡洛聚合联合集成定位与动态障碍预测不确定性,在仿真中实现鲁棒导航,成功率提升28%。

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27670 2026-05-28 quant-ph hep-th 50%

Benchmarking Quantum Annealing for a Greenhouse-Inspired Control QUBO

温室启发式控制QUBO的量子退火基准测试

Hamzeh Alavirad, Maryam Bahrami Zanjani

专题命中 Agent评测 :workflow(abstract)

AI总结 针对温室启发式二进制加热器调度QUBO问题,通过物理解码评估经典模拟退火、路径积分模拟量子退火和D-Wave量子退火工作流的性能,未发现量子优势但提供了可重复的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27589 2026-05-28 cs.CV 50%

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

What-If World: 具身场景中通用世界模型的因果基准

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

机构 * UCLA(加州大学洛杉矶分校) University of Tennessee(田纳西大学) Amazon(亚马逊)

专题命中 Agent评测 :planning(abstract)

AI总结 提出 What-If World 基准,通过成对提示测试视频生成模型在物理变化下的因果一致性,发现现有模型在因果干预上表现不佳。

Comments 38 pages, World Model Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15375 2026-05-28 quant-ph physics.comp-ph 50%

Learning to Maximize Quantum Neural Network Expressivity via Effective Rank

通过有效秩学习最大化量子神经网络表达力

Juan Yao

专题命中 Agent评测 :agent(abstract)

AI总结 提出有效秩κ作为量子神经网络表达力的量化指标,并通过强化学习框架自动设计高表达力电路架构。

Comments 6 pages, 5 figures

Journal ref Quantum Science and Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25308 2026-05-28 math.OC 50%

Computing welfare and fairness in allocating identical goods with entitlements and general utility functions

具有权益和一般效用函数的相同物品分配中的福利与公平性计算

Manouchehr Zaker

专题命中 Agent评测 :agent(abstract)

AI总结 针对具有不同权益的代理分配相同不可分割物品的问题,提出多项式时间算法计算最大加权Rawlsian和Leximin福利,并证明所得分配是任意物品公平的(WEQX),同时引入“总加权赤字”概念实现通过最小数量相同硬币补偿的公平分配。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13253 2026-05-28 cs.HC 50%

Fostering human learning is crucial for boosting human-AI synergy

促进人类学习对于提升人机协同至关重要

Julian Berger, Jason W. Burton, Ralph Hertwig, Thomas Kosch, Ralf H. J. M. Kurvers, Benito Kurzenberger, Christopher Lazik, Linda Onnasch, Tobias Rieger, Anna I. Thoma, Dirk U. Wulff, Stefan M. Herzog

专题命中 Agent评测 :agent(abstract)

AI总结 通过重新分析74项研究,发现当前人机协同实验因忽视人类学习设计(如结果反馈)而低估协同潜力,并证明反馈与AI解释结合能产生正向协同。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 5 篇

2605.28725 2026-05-28 cs.CY 78%

Execution and assessment of agentic influence operations in simulated social networks

模拟社交网络中代理式影响力操作的执行与评估

Alejandro Buitrago López, David Montoro Aguilera, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 其他Agent :agentic(title,abstract)

AI总结 本文通过在合成社交网络中模拟叙事发布、放大和反信息传递,评估AI驱动的影响力操作,发现放大最大化覆盖、反信息传递最能改变观点、叙事发布需要更大的攻击者足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 67%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28255 2026-05-28 cs.AI cs.CL cs.HC 62%

AI, Take the Wheel: What Drives Delegation and Trust in Human-Computer Cooperative Question Answering?

AI,掌舵吧:是什么驱动人机协作问答中的委托与信任?

Maharshi Gor, Yoo Yeon Sung, Yu Hou, Eve Fleisig, Irene Ying, Tianyi Zhou, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) University of California(加州大学) MBZUAI

专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 通过问答游戏实验,研究人类在何时以及为何选择委托AI或采纳其建议,发现人类存在对AI正确建议的低依赖(3.9%)和错误建议的过度依赖(1.7%),并受确认偏见影响,建议通过校准置信度、基于证据的解释和信任细化机制来改进人机协作。

Comments Findings of the Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18692 2026-05-28 cs.AI math.OC 57%

Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches

利用LLM引导的模型补丁实现大规模重新优化的大众化

Tinghan Ye, Arnaud Deza, Ved Mohan, El Mehdi Er Raqabi, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(赫尔曼·米利特·斯图尔特工业与系统工程学院,佐治亚理工学院) Department of Operations and Decision Systems, Université Laval(运营与决策系统系,拉瓦尔大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的代理重新优化框架,通过自然语言交互和优化工具箱,使非专家用户能够动态更新和重新优化部署的优化模型,并在两个大规模实际案例中验证了其有效性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24413 2026-05-28 cs.CY cs.HC cs.MA 50%

Habermolt: Delegating Deliberation to AI Representatives

Habermolt: 将审议委托给AI代表

Joseph Low, Oscar Duys, Claude Formanek, Michiel Bakker, Lewis Hammond

专题命中 其他Agent :AI agent(abstract)

AI总结 提出AI委托审议范式,通过Habermolt平台研究AI代表人类进行审议时的表征、聚合与修订三大维度,揭示可扩展且可信的AI代表的设计挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏