arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-29 至 2026-07-29 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2607.25489 2026-07-29 cs.CV 新提交 89%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25155 2026-07-29 eess.SY cs.SY 新提交 89%

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

VeraGrid-Agent:用于电网边缘分布式最优潮流的工具增强大语言模型

Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

专题命中 Agent评测 :agent(title,title_cn)

AI总结 研究针对电网边缘分布式最优潮流问题,提出工具增强大语言模型VeraGrid-Agent,通过自主编写模拟器输入、执行求解器并读取输出作答。引入VeraGrid-MCQ-150测试评估,相比无工具推理,该模型显著提升准确率,且剩余错误源于推理而非求解器执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 86%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 86%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25891 2026-07-29 cs.AI cs.DB 新提交 85%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);function calling(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25828 2026-07-29 cs.NI 新提交 85%

C-RE-ACT: Causal RE-ACTing Agent for O-RAN Forensic Triage

C-RE-ACT:用于O-RAN取证分类的因果反应代理

Pau Baguer, J. Xavier Salvat Lozano, Gines Garcia-Aviles, Xavier Costa-Pérez

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究O-RAN架构下性能降级攻击难区分问题,提出C-RE-ACT框架,用结构不可知模型构建加权有向无环图,经图同构网络编码,在测试平台评估,能准确分离根本原因,提升LLM准确率及代理异常分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25914 2026-07-29 cs.AI cs.CR cs.NI 新提交 83%

Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks

迈向自主网络中标准化的跨供应商代理工具信任管理

Ravi Kant Sharma, Ashutosh Uttam, Ajay Kumar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究自主网络中跨供应商代理工具信任管理问题,提出AgentToolMO模型,含信任状态机等内容。模拟评估显示该模型能减少传播范围、保证级联收敛,为可信多供应商自主网络管理提供标准化途径。

Comments 22 pages, 7 figures, 9 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 83%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25098 2026-07-29 cs.CC 新提交 82%

An Artificial Market for Brazilian Real Estate Investment Funds: An Agent-Based Proposal

巴西房地产投资基金的人工市场:基于代理的提议

Gilberto Gil F. G. Passos, Eber Assis Schmitz, Sildenir Alves Ribeiro

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 研究利用基于代理的建模方法开发巴西房地产投资信托人工市场,整合其价值链,纳入宏观经济变量体现代理异质性,经校准和验证,该模型能再现真实市场典型事实,为分析监管政策和定价机制提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交 81%

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 80%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 79%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24822 2026-07-29 cs.IR 新提交 78%

A Position Paper on Recommender Systems in the Era of Autonomous Agents

关于自主智能体时代推荐系统的立场文件

Aixin Sun

专题命中 Agent评测 :autonomous agent(title,abstract)

AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。

Comments Accepted to the ACM RecSys 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22610 2026-07-29 cs.HC 78%

Everything Counts: The Managed Omnirelevance of Speech in Human-Voice Agent Interaction

一切都有价值:人类与语音代理互动中语音的受控全相关性

Damien Rudaz, Mathias Broth, Jakub Mlynar

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究探讨了人类与语音代理互动中语音的全相关性问题,分析了人类如何管理代理的轮流发言行为,以及技术进步对这一现象的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 75%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13241 2026-07-29 cs.LG cs.AI 73%

Recursive Deep Inverse Reinforcement Learning

Paul Ghanem, Owen Howell, Michael Potter, Pau Closas, Alireza Ramezani, Deniz Erdogmus, Tales Imbiriba

机构 * Boston Dynamics AI Institute(波士顿动力AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25765 2026-07-29 cs.CL cs.DB 新提交 70%

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

WorkSurface-Bench:在多表面知识路由上对企业代理进行基准测试

Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村科学城) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 针对企业代理整合异构知识源时表面路由能力评估不足的问题,提出WorkSurface-Bench基准测试,含多种任务且答案可审计,评估多个模型主干,揭示表面选择与任务完成关系及干预效果,并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 67%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24999 2026-07-29 cs.CL cs.AI 新提交 62%

CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

CogArena:大语言模型认知能力结构的多方法评估

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。

Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 57%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 57%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08058 2026-07-29 cs.CV cs.AI cs.RO cs.SY eess.SY 版本更新 57%

Picasso: Holistic Scene Reconstruction with Physics-Constrained Sampling

Picasso: 基于物理约束采样的整体场景重建

Xihang Yu, Rajat Talak, Lorenzo Shaikewitz, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出Picasso,一种通过快速拒绝采样推理多物体交互并考虑几何、非穿透和物理约束的整体场景重建方法,在物理合理性和重建精度上显著优于现有技术。

Comments 15 pages, accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25568 2026-07-29 cs.GT 新提交 50%

Network Reciprocity Shapes Evolutionary Cybersecurity Dynamics

网络互惠塑造进化网络安全动态

Adeela Bashir, Zia Ush Shamszaman, Zhao Song, The Anh Han

专题命中 Agent评测 :agent(abstract)

AI总结 研究人工智能辅助网络安全系统中群体结构对攻防动态的影响。提出混合角色进化博弈框架,结合随机进化分析与模拟。发现交互结构是关键决定因素,局部网络交互组织防御主体可提升网络长期弹性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25131 2026-07-29 cs.HC q-bio.NC 新提交 50%

Beyond the Post Hoc User Study: Modeling Visual Decision-Making with Active Inference

超越事后用户研究:用主动推理对视觉决策进行建模

Harrison J. Goldwyn, Graham Johnson, Christopher Ibarra, Lace Padilla, Kenny Gruchalla

专题命中 Agent评测 :agent(abstract)

AI总结 研究旨在填补可视化解释机制空白,用主动推理将认知理论转化为模拟。以柱状图平均估计任务为例实现两类主体,分析其易出现的偏差及产生的认知痕迹,为可视化解释机制假设提供框架,支持更优的计算机模拟评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24826 2026-07-29 cs.IR cs.MA 新提交 50%

Aethel: A Reproducible Graph-Retrieval Framework for Multi-Hop Financial Diligence

Aethel:用于多跳金融尽职调查的可重现图检索框架

Krish Sapru

专题命中 Agent评测 :agent(abstract)

AI总结 针对二级私募股权交易中财务披露信息综合难题,Aethel框架结合二分个性化PageRank图检索等技术,将语料库建模为实体-段落图。在多跳金融尽职调查任务中,该框架在特定数据集上有较好表现,优势依赖语料库规模和实体索引质量,且发布相关工件保证可重现性。

Comments 11 pages, 3 figures, 2 tables. Includes evaluations on MuSiQue, 2WikiMultiHopQA, and a 4,123-chunk financial-disclosure corpus. Code and evaluation artifacts are available for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25475 2026-07-29 physics.soc-ph nlin.AO q-bio.PE 新提交 50%

Coevolution of epidemic dynamics and network topology driven by disease fatality and waning immunity

由疾病致死率和免疫力下降驱动的流行病动力学与网络拓扑结构的共同演化

ThankGod I. S. Ikpe, Takayuki Hiraoka, Naoya Fujiwara

专题命中 Agent评测 :agent(abstract)

AI总结 研究流行病动力学与网络拓扑的相互作用,开发基于主体模型,发现模型会经历流行病转变,网络可能失去无标度特性,通过异质平均场近似验证结果,凸显网络演化在流行病模型中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25458 2026-07-29 cs.SI cs.CY nlin.AO 新提交 50%

Resilience: Understand Breakdown, Foster Recovery, and Choose the Right Perspective

恢复力:理解崩溃、促进恢复并选择正确视角

Frank Schweitzer

专题命中 Agent评测 :agent(abstract)

AI总结 研究恢复力,区分两种系统动态,指出崩溃常自我造成且正反馈有正负作用。认为易变系统中恢复力是主体交互的涌现属性,需数据驱动方法,模型显示恢复力是稳健性与适应性的妥协,二阶解决方案更有前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04748 2026-07-29 econ.TH 版本更新 50%

Honesty, Stigma, and Cooperation in an Overlapping-Generations Game

重叠世代博弈中的诚实、污名与合作

David Li, Georgy Lukyanov

专题命中 Agent评测 :agent(abstract)

AI总结 研究重叠世代博弈中诚实、污名与合作关系,通过纳入选择到均衡信念,分析不同情况下均衡状态,发现特定参数区域多种均衡共存,内部分支不稳定,还探讨了最大最小规则及记录清除对合作的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏