arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2608.12359 2026-08-14 cs.CY 新提交 82%

Can We Trust AI Agents in the Supermarket? Sugar Content Inference from Product Images

我们能信任超市中的智能体吗?从产品图像推断糖含量

Jose Berengueres

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 该研究评估AI智能体从超市产品图像推断糖含量的能力,发现其准确率因场景和产品类型差异大,全球产品准确率高但本地产品与随机猜测无差异,指出AI营养工具应定位为辅助工具,需对齐本地生态的可审计基准。

Comments Accepted on April 15th 2026 to the 2026 48th Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25821 2026-08-14 cs.CL cs.AI cs.LG cs.MA 版本更新 82%

Doctorina MedBench: A Dialogue-Based Benchmark and Evaluation Framework for Agent-Based Medical AI

Doctorina MedBench:基于真实医患交互的医疗AI端到端评估框架

Anna Kozlova, Stanislau Salavei, Pavel Satalkin, Hanna Plotnitskaya, Sergey Parfenyuk, Andy Nkansah

机构 * A.I. Doctor Medical Assist LTD(A.I. Doctor Medical Assist有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Doctorina MedBench通过模拟真实医患对话评估医疗AI系统,包含诊断、观察、治疗和步骤计数四项指标,用于评估临床正确性和对话效率,同时支持多层级测试和质量监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09567 2026-08-11 cs.CR 新提交 82%

From Runnable to Verifiable: An Independent Reproducibility Study of LLM/Agent-Driven Vulnerability Validation Artifacts

从可运行到可验证:LLM/智能体驱动的漏洞验证制品的独立可复现性研究

Bo Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本研究通过预注册可复现性审计,发现LLM/智能体驱动的漏洞验证制品存在标识符不一致、可运行率低、预言机不可靠等问题,提出的审计方案可作为安全可复现性社区的复用模板。

Comments 16 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08070 2026-08-11 cs.RO 新提交 82%

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

SurgWMBench:面向世界建模的手术器械运动规划视觉基准

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 Agent评测 :planning(title,abstract);workflow(abstract)

AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 82%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06362 2026-08-07 cs.GT cs.AI cs.CL cs.LG cs.MA 新提交 82%

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法

Boning Li, Yu Chen, Longbo Huang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04341 2026-08-06 cs.MA 新提交 82%

Continuous Improvement and Parallel Autonomous Exploration: An LLM-Agent Framework for Searching Large Solution Spaces

持续改进与并行自主探索:用于搜索大型解空间的大语言模型智能体框架

Dulmini Hettiarachchi, Andre Rusli, Julio Christian Young, Sho Akiyama

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 该研究提出一种LLM智能体框架,含持续改进奖励循环与并行自主探索机制,在产品到目录匹配任务中,5个并行智能体的合格覆盖度较单智能体及基线显著提升。

Comments 5 pages, ACM KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02680 2026-08-05 cs.SE cs.AI cs.LG 新提交 82%

TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流

Salma El Yadouni, Guanyi Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02613 2026-08-05 cs.CL cs.AI cs.LG cs.MA 新提交 82%

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试

Jiadong Zhang, Xiaosong Ma

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。

Comments 48 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交 82%

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-04 cs.AR 新提交 82%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05621 2026-08-04 cs.IR 版本更新 82%

ANCHOR: Agentic Noise Creation Framework for Human Simulation and Denoising Recommendation

ANCHOR: 用于人类模拟和去噪推荐的智能体噪声创建框架

Xiangming Li, Hua Chu, Jiaming Liang, Jianan Li, Yangtao Zhou

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 提出ANCHOR框架,通过智能体模拟用户行为生成真实噪声标签,将推荐去噪转化为监督学习问题,实现高效噪声识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27259 2026-07-31 cs.LO cs.AR 新提交 82%

CircuitProver: Agentic Lean 4 Theorem Proving with Reusable Circuit Proof Library for Hardware Verification

CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证

Ziyi Yang, Wenji Fang, Chen Chen, Zhiyao Xie, Hongce Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22652 2026-07-30 cs.DB 版本更新 82%

A dataset of early blockchain-registered AI agents on Ethereum

以太坊上早期区块链注册的人工智能代理数据集

Yulin Liu

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract)

AI总结 本文构建了一个基于ERC-8004标准的区块链注册AI代理数据集,包含10000个代理的链上身份记录、铸造交易、转移事件、声誉摘要及反馈记录,支持对代理身份形成、声誉系统和去中心化AI生态的研究。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25098 2026-07-29 cs.CC 新提交 82%

An Artificial Market for Brazilian Real Estate Investment Funds: An Agent-Based Proposal

巴西房地产投资基金的人工市场:基于代理的提议

Gilberto Gil F. G. Passos, Eber Assis Schmitz, Sildenir Alves Ribeiro

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 研究利用基于代理的建模方法开发巴西房地产投资信托人工市场,整合其价值链,纳入宏观经济变量体现代理异质性,经校准和验证,该模型能再现真实市场典型事实,为分析监管政策和定价机制提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21505 2026-07-28 cs.HC 版本更新 82%

Observable Social Life Spaces: Exploring User Interpretations of agent-side life context in human-agent interaction

您想参观我的世界吗?通过可观察的社会生活空间培育人机交互中的感知平等

Zihong He, Shuqin Wang, Songchen Zhou, Qinghui Lin, Jialin Wang, Chen Liang, Hai-Ning Liang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 本文通过混合方法研究,证明可观察的社会生活空间能显著提升人机交互中的感知平等,推动人机关系从工具性转向平等性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11666 2026-07-24 cs.CL cs.AI cs.LG 版本更新 82%

Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

扮演:通过理论思维学习双代理守护者以实现信念引导

Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出ToM-SB挑战,通过强化学习训练双代理模型以提升信念引导和理论思维能力,结果显示结合两者奖励的模型在对抗任务中表现更优。

Comments First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15114 2026-07-24 cs.MA 版本更新 82%

From Who They Are to How They Act: Behavioral Traits in Generative Agent-Based Models of Social Media

从他们是谁到他们如何行动:生成式基于代理的社会媒体模型中的行为特征

Valerio La Gatta, Gian Marco Orlando, Marco Perillo, Ferdinando Tammaro, Vincenzo Moscato

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文提出通过行为特征显式表征代理行为,以生成更真实的社交媒体参与模式和内容传播动态。

Comments Accepted at The International AAAI Conference on Web and Social Media (ICWSM) 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14004 2026-07-16 cs.AI cs.CL cs.LG 新提交 82%

Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0

智能体优化器的效果会叠加吗?基于终端基准测试2.0的持续学习评估

Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究智能体优化器收益是否叠加的问题,通过基于终端基准测试2.0的两阶段持续学习评估,比较GEPA、Meta Harness和RELAI-VCL三种方法,发现仅RELAI-VCL能使优化收益叠加,因其在优化循环中内置回归控制。

Comments Technical Report by RELAI (relai.ai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13792 2026-07-16 cs.CV 新提交 82%

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

EgoProceVQA:一种具有自我技能探索代理的新型自我中心程序理解任务

Junlong Li, Junxi Li, Yuxiang Yang, Wenbin Zou, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 研究针对现有自我中心视频理解评估忽视程序理解的问题,引入EgoProceVQA任务,开发EgoProceGen数据生成平台并构建基准。通过评估发现模型不足,进而提出EgoProceAgent框架,设计相关工具库,使其在多任务上获最优性能,为该任务奠定统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11999 2026-07-16 cs.CY 版本更新 82%

Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack

承保智能体经济:人工智能保险堆栈蓝图

Cristian Trout, Sanmi Koyejo, Sasha Romanosky, Giorgio Ripamonti, Lynn Thompson, Desiree Spain, Alex Taylor, Kevin Casey, Stephen Casper, Matthew Botvinick, Sean McGregor, Miles Brundage, A. Feder Cooper, Patricia Paskov, Adrien Ecoffet, Ben Bucknall, Kevin Wei, Markus Anderljung, Lukasz Szpruch, Bri Treece, Tom Zick, Gabriel Weil, Ugur Ozer, Kevin Kalinich, Jesus Gonzalez, Vitaly Baranov, Moran Koren, Guy Laban, Gil Arazi, Henri Winand, Derek Blum, Toby Clowes, Adam Kleinman, Anita Srinivasan, Tom Fehring, Rune Kvist, Rajiv Dattani

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 研究人工智能智能体经济下保险面临的风险及可保性问题,提出构建含八个组件的人工智能保险堆栈,通过行业协调实现限额承保,还探讨了前沿人工智能灾难性风险承保及所需工具,以助保险公司管理相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06624 2026-07-15 cs.AI cs.LG cs.SE 版本更新 82%

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens:用于编码智能体评估的生产评估轨迹审查

Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

机构 * Explyt St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05318 2026-07-07 cs.MA cs.CR 新提交 82%

PiSAs: Benchmarking Contextual Integrity in Multi-User Agentic Systems

PiSAs:多用户智能体系统中情境完整性的基准测试

Shubham Gupta, Nazanin Mohammadi Sepahvand, Abhinav Kumar, Cem Subakan, Spandana Gella, Pierre-André Noël, Perouz Taslakian, Eugene Bagdasarian, Valentina Zantedeschi

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 82%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20659 2026-07-07 cs.AI cs.LG cs.SE 新提交 82%

Skill Coverage: A Test Adequacy Metric for Agent Skills

技能覆盖率:一种用于智能体技能的测试充分性度量

Boyin Tan, Xiaowei Huang, Youcheng Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22737 2026-07-03 cs.AI cs.CL cs.SE 新提交 82%

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval:有状态智能体评估中LLM评判的确定性替代方案

Jeffrey Flynt

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。

Comments Streamlined entry point into framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 82%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31371 2026-07-01 cs.LG cs.AI cs.CL 新提交 82%

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28690 2026-06-30 cs.CR 82%

Formal Security Analysis of Agent Protocol Composition

智能体协议组合的形式化安全分析

Shenghan Zheng, Qifan Zhang, Zheng Zhang, Haonan Li, Christophe Hauser

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 提出AgentThread框架,通过分层安全范围、TLA+形式化检查和两阶段验证器,对智能体协议进行安全分析,发现35个规范级问题及30个组合缺陷,揭示协议间责任缺失。

Comments Preprint. 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 82%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏