arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-09 至 2026-07-09 共收录 24 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2607.04758 2026-07-09 cs.AI 新提交 89%

AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization

AgenticPD:用于物理设计QoR优化的阶段感知智能体框架

Shuo Ren, Zijin Cheng, Yaohui Han, Libo Shen, Leilei Jin, Wanting Tian, Rongliang Fu, Chao Wang, Bei Yu, Tsung-Yi Ho

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI

AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26028 2026-07-09 cs.CR cs.AI cs.MA 新提交 88%

Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem

无信任代理能否被信任?ERC-8004 去中心化 AI 代理生态系统的实证研究

Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

机构 * Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) University of Bristol(布里斯托大学) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本研究首次实证分析 ERC-8004 协议在三条链上的身份、声誉和验证注册表,发现大多数注册为占位符,声誉不可比且易被操纵,大量评论者存在 Sybil 行为,表明该协议目前无法提供可信决策基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 84%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 83%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11935 2026-07-09 cs.AI cond-mat.mtrl-sci 版本更新 83%

AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org

AGAPI-Agents:用于在AtomGPT.org上加速材料设计的开放访问智能代理人工智能平台

Jaehyung Lee, Justin Ely, Kent Zhang, Akshaya Ajith, Charles Rhys Campbell, Kamal Choudhary

机构 * Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究智能代理人工智能系统中工具访问对预测准确性的影响,核心方法是构建AGAPI平台整合多种模型与工具,主要贡献是明确其在材料设计中能提高精度、展示多步骤工作流程且证实工具在特定情况下不可或缺。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 79%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交 79%

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07584 2026-07-09 cs.NI 新提交 78%

PHaul: A PPO-based forwarding agent for Sub6 enhanced Integrated Access and Backhaul networks

PHaul:一种用于Sub6增强型综合接入与回传网络的基于近端策略优化(PPO)的转发代理

Jorge Pueyo, Daniel Camps-Mur and, Miguel Catalan-Cid

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究Sub6增强型IAB网络的转发问题,提出PHaul,结合离线启发式算法与基于PPO的在线DRL代理,利用网络数字孪生采样更新映射,相比替代算法,能提升吞吐量效率和公平性,且对拓扑差异有鲁棒性。

Journal ref IEEE Transactions on Network and Service Management, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 75%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07435 2026-07-09 cs.LG cs.AI 新提交 73%

RLVP: Penalize the Path, Reward the Outcome

RLVP:惩罚路径,奖励结果

Bojie Li, Noah Shi

机构 * Pine AI(松果人工智能公司) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究在现实世界中智能体在线学习面临的挑战,提出“惩罚路径,奖励结果”方法,能在几乎零违规情况下实现高任务成功率,并给出有效惩罚的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21442 2026-07-09 math.NT math.CA 版本更新 67%

Irrationality of rapidly converging series: a problem of Erdős and Graham

快速收敛级数的无理性:埃尔多斯与格雷厄姆的问题

Kevin Barreto, Jiwon Kang, Sang-hyun Kim, Vjekoslav Kovač, Shengtong Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 该研究证明了满足双指数增长条件的级数求和结果为无理数,并探讨了其推广形式及最优性。

Comments Minor modifications to the exposition. To appear in the Bulletin of the London Mathematical Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06713 2026-07-09 cs.SE cs.AI 新提交 62%

Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

软件工程中智能体的可靠且与开发者一致的评估

Razvan Mihai Popescu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型驱动智能体评估技术的局限,提出基于实际软件开发实践的综合评估方法,通过污染感知、实际行为评估及轨迹感知基准指标,来弥合差距,实现可靠且与开发者一致的评估。

Comments International Conference on the Foundations of Software Engineering '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07040 2026-07-09 cs.AI 新提交 57%

Measuring Intelligence Beyond Human Scale

超越人类水平的智能测量

Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan

机构 * Princeton(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何测量超越人类能力的智能,提出基于相对测量的新范式,模型生成公开挑战,汇总结果得对抗性心理测量评级系统,还描述实用协议,在不同领域实例化框架,实现对超越人类前沿系统的测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06121 2026-07-09 q-fin.TR cs.AI 新提交 57%

Can Reinforcement Learning Efficiently Discover Price Manipulation?

强化学习能否有效地发现价格操纵行为?

Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

机构 * Scuola Normale Superiore(斯克沃尔纳正常大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究无模型强化学习智能体能否比传统基于模型方法更有效识别价格操纵机会,通过在单资产市场比较两种有限样本学习方法,发现中等波动率下强化学习表现良好,高波动率时都无法识别,低波动率时基于模型方法更优,凸显强化学习有效性及相关风险。

Comments 30 pages, 11 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新 57%

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 57%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14271 2026-07-09 cs.AI 版本更新 57%

Neutral Substrates: A Design Constraint for Shared Records Under Persistent Interpretive Disagreement

中性基底:持续解释分歧下共享记录的设计约束

Denise M. Case

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在因果等解释有分歧时共享记录的中立性问题,提出中性基底概念,其基础层受限以保证中立性,借助具体化等机制,给出共享记录基础层可检查条件及相关假设与边界条件,确保问责又不偏向一方解释。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08630 2026-07-09 cs.AI cs.RO 版本更新 57%

Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control

上下文马尔可夫决策过程中用于通用形态控制的共享模块化递归

Laurens Engwegen, Max Weltevrede, Caroline Horsch, Daan Brinks, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究旨在解决多机器人形态差异大时的控制难题,提出利用模块化交互恢复上下文特征,实现更好的多机器人控制及泛化。通过基于变压器且具共享模块化递归的架构在MuJoCo机器人上评估,显著提升了零样本泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07602 2026-07-09 astro-ph.CO gr-qc hep-th 新提交 50%

When the Environment Speaks: Quantum Signatures in Non-Attractor Inflation

当环境发声时:非吸引子暴胀中的量子特征

Mattia Cielo, Simone Scarlatella, Gianpiero Mangano, Ofelia Pisanti

专题命中 Agent评测 :agent(abstract)

AI总结 研究暴胀中绝热曲率微扰与熵标量环境相互作用的开放量子动力学,用精确输运方程方法追踪系统协方差矩阵演化,发现环境作用使原初标量功率谱有可观测印记,二阶时还影响引力波背景,为宇宙学观测提供独特光谱特征。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07373 2026-07-09 cs.NE 新提交 50%

Dynamic neural manifolds for flexible closed-loop control on neuromorphic hardware

用于神经形态硬件上灵活闭环控制的动态神经流形

Oskar von Seeler, Christian Tetzlaff, Andrew Lehr

专题命中 Agent评测 :agent(abstract)

AI总结 研究如何将动态神经流形框架扩展到神经形态工程用于实时闭环控制,通过在SpiNNaker 2芯片上实现,允许感官输入调制相关电流来驱动子空间旋转,经机器人模拟验证,为可解释神经形态架构提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07160 2026-07-09 cs.GT 新提交 50%

Stable Matchings with Minimum Utility Gap

具有最小效用差距的稳定匹配

Yao Sheng, Yu Yokoi

专题命中 Agent评测 :agent(abstract)

AI总结 研究具有最小效用差距的稳定匹配问题,通过旋转偏序集表示稳定匹配集,给出针对最大最小效用差和比率两种情况的多项式时间算法,阐明与现有框架关系并确定特殊情况。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06581 2026-07-09 cs.GT 版本更新 50%

Constant Weighted Maximin Share Approximations for Chores

任务的恒定加权最大最小份额近似值

Bo Li, Fangxiao Wang, Shiji Xing

专题命中 Agent评测 :agent(abstract)

AI总结 研究非对称权重主体间不可分割任务的公平分配,提出首个WMMS恒定因子近似算法,设计保证12近似分配的算法,给出改进下限并刻画两主体最优近似比率曲线,推进了WMMS近似问题研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01683 2026-07-09 cs.CV 版本更新 50%

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Bradley, Fabio Cuzzolin

机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) MAZUST University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏