arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-26 至 2026-06-26 共收录 29 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 29 篇

2603.09448 2026-06-26 cs.CV cs.AI 版本更新 89%

A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation

一种遵循指南的AI智能体用于零样本靶区自动勾画

Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Jae Myung Noh, Kyungmi Yang, Dongryul Oh, Jin Sung Kim

机构 * Oncosoft Inc.(Oncosoft公司) Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine(放射肿瘤科,三星医疗中心,成均馆大学医学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出OncoAgent框架,将文本临床指南转化为三维靶区轮廓,无需训练即可实现零样本勾画,在食管癌病例中达到与监督方法相当的Dice系数,且医生更偏好其指南依从性和临床可接受性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26524 2026-06-26 cs.CR 新提交 88%

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

VIGIL:AI代理技能中行为规范的运行时执行

Ying Li, Yanju Chen, Hongbo Wen, Bosi Zhang, Hanzhi Liu, Peiran Wang, Yu Feng, Yuan Tian

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract)

AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26327 2026-06-26 cs.LG cs.AI 新提交 84%

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

EVOM:用于强化学习的演员-评论家架构的智能体元进化

Boyun Zhang, Chao Wang, Kai Wu

机构 * Xidian University(西安电子科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26552 2026-06-26 cs.CV cs.AI 新提交 83%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 79%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14397 2026-06-26 cs.LG 新提交 77%

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

Running the Gauntlet: 重新评估智能体在陌生环境中的能力

Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi

机构 * University of Oxford(牛津大学) SoftServe Massachusetts Institute of Technology(麻省理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) UK AI Security Institute(英国人工智能安全研究所) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 提出GauntletBench基准,通过20个视觉密集型任务评估智能体在时间感知、图形理解和3D推理等未被充分探索的能力,发现最先进智能体成功率仅19.1%,远低于人类80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26294 2026-06-26 cs.LG cs.AI cs.MA cs.NE 新提交 76%

The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

红皇后哥德尔机:共同进化的智能体及其评估者

Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);分类 cs.AI、cs.LG;multi-agent(comments)

AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。

Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17554 2026-06-26 cs.AI cs.LG 版本更新 73%

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准

Tanmay Asthana, Aman Saksena, Divyansh Sahu

机构 * Deccan AI Research(德克南人工智能研究所)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。

Comments Updating the paper with more data. Will resubmit

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06078 2026-06-26 cs.CY cs.AI cs.CL 73%

Simulating Students with Large Language Models: A Review of Architecture, Mechanisms, and Role Modelling in Education with Generative AI

用大型语言模型模拟学生:生成式AI在教育中的架构、机制与角色建模综述

Luis Marquez-Carpintero, Alberto Lopez-Sellers, Miguel Cazorla

机构 * Institute for Computer Research University of Alicante(计算机研究所阿利坎特大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了利用大型语言模型模拟学生行为在教育中的应用,探讨了其在学习者建模、教学评估和教师培训中的潜力与挑战。

Journal ref Computer Science Review 62 (2026) 101008

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23293 2026-06-26 physics.soc-ph 版本更新 67%

Partial exploiters sustain cooperation: the hump-shaped strategy stably coexists with unconditional cooperators

部分利用者维持合作:驼峰策略稳定共存于无条件合作者

Kai Otsubo, Yuta Kido, Ryutaro Mori

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 研究揭示驼峰策略在中间规模群体中适应性强,能与无条件合作者共同维持大规模合作,通过稳定均衡排除自由搭车者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 62%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26406 2026-06-26 cs.LG cs.AI math-ph math.MP 新提交 62%

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统

A. S. Ushakov, Yu. N. Berdinsk

机构 * Saint Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 57%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 57%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 57%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26158 2026-06-26 cs.AI 新提交 57%

Life After Benchmark Saturation: A Case Study of CORE-Bench

基准测试饱和之后:CORE-Bench 案例研究

Nitya Nadgir, Sayash Kapoor, Kangheng Liu, Peter Kirgis, Matilda Orona, Stephan Rabanser, Tilman Bayer, Abhishek Shetty, Yue Ling, Derrick Chan-Sew, Rumi Nakagawa, Saiteja Utpala, Zachary S. Siegel, Arvind Narayanan

机构 * Independent(独立机构) Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对基准测试准确率饱和问题,提出从构造效度、泛化性、效率、可靠性、模型与脚手架相对重要性及人机协作提升六个维度评估智能体,以CORE-Bench Hard为案例展示饱和后仍可获得有意义见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 57%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07980 2026-06-26 cs.LG 57%

Realistic Urban Traffic Generator using Decentralized Federated Learning for the SUMO simulator

基于SUMO模拟器的去中心化联邦学习的城市交通生成器

Alberto Bazán-Guillén, Carlos Beis-Penedo, Diego Cajaraville-Aboy, Pablo Barbecho-Bautista, Rebeca P. Díaz-Redondo, Luis J. de la Cruz Llopis, Ana Fernández-Vilas, Mónica Aguilar Igartua, Manuel Fernández-Veiga

机构 * Networking Engineering Department, Universitat Politècnica de Catalunya (UPC)(西班牙巴塞罗那理工大学网络工程系) atlanTTic Research Center (I&C Lab), University of Vigo(西班牙奥维多大学atlanTTic研究中心) Department of Electrical, Electronic and Telecommunications Engineering, University of Cuenca(厄瓜多尔库恩卡大学电气、电子与电信工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出DesRUTGe框架,结合深度强化学习与SUMO模拟器生成真实交通模式,通过去中心化联邦学习提升准确性和隐私保护。

Comments 21 pages, 7 figures

Journal ref IEEE Open Journal of the Communications Society, Volume 6 (2025) 6627 - 6649

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 50%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 Agent评测 :planning(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26651 2026-06-26 cs.GT 新提交 50%

Learning Anonymous Pricing for Online Resource Allocation

在线资源分配的匿名定价学习

Yifeng Teng, Yifan Wang

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线资源分配中匿名定价的可学习性,提出利用样本和查询学习近优匿名定价算法,解决动态定价的公平性和先验顺序依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26583 2026-06-26 cs.CE 新提交 50%

Preference Optimization Drives Monoculture in LLM Prediction Markets

偏好优化导致LLM预测市场中的单一文化

James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

专题命中 Agent评测 :agent(abstract)

AI总结 研究发现,使用直接偏好优化(DPO)微调的LLM代理在预测市场中产生高度相关的错误,导致集体预测能力远低于独立代理数量,且该现象由偏好优化驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26136 2026-06-26 cs.SI math.ST stat.ME stat.TH 新提交 50%

Bayesian Predictive Synthesis for Dynamic Networks: Forecasting and Identifying Structural Mechanisms

动态网络的贝叶斯预测合成:预测与识别结构机制

Marios Papamichalis, Regina Ruane, Theofanis Papamichalis

专题命中 Agent评测 :agent(abstract)

AI总结 提出动态贝叶斯预测合成方法,通过时变权重组合多个结构机制(如社区、几何、枢纽)的预测,实现校准的边预测并识别主导机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26853 2026-06-26 math.NA cs.NA math.AP math.OC 新提交 50%

Numerical analysis of first-order mean field games under displacement monotonicity

位移单调性下的一阶平均场博弈数值分析

Alpár R. Mészáros, Yohance A. P. Osborne

专题命中 Agent评测 :agent(abstract)

AI总结 提出粒子法近似非可分位移单调Hamiltonian的一阶MFG系统,证明分布和值函数梯度的收敛性及误差界,首次处理奇异初始分布和任意时间域。

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26251 2026-06-26 hep-ph 新提交 50%

Supercool with PPO: Exploring Supercooled Phase Transitions via Reinforcement Learning

Supercool with PPO: 通过强化学习探索过冷相变

Wan-Zhe Feng, Zong-Huan Ye, Zi-Hui Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于近端策略优化(PPO)的强化学习策略,加速搜索最小暗$U(1)_x$扇区中过冷相变的引力波信号,相比传统蒙特卡洛扫描更高效。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09152 2026-06-26 econ.TH 版本更新 50%

Egalitarian-equivalent and strategy-proof mechanisms in homogeneous multi-object allocation problems

同质多物品分配问题中的平等等价与策略证明机制

Hinata Kurashita, Ryosuke Sakai

专题命中 Agent评测 :agent(abstract)

AI总结 研究带货币的同质不可分物品分配问题,刻画满足平等等价、策略证明、个体理性和无补贴的机制类,发现平等等价与效率存在冲突;用非明显可操纵性替代策略证明后,可设计同时满足平等等价和效率的机制,并识别出福利最优机制。

Comments This version generalizes the model and corrects errors in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00853 2026-06-26 math.OC cs.SY eess.SY q-fin.MF 版本更新 50%

Ranking Quantilized Mean-Field Games with an Application to Early-Stage Venture Investments

排序量化平均场博弈及其在早期风险投资中的应用

Rinel Foguen Tchuendom, Dena Firoozi, Michèle Breton

专题命中 Agent评测 :agent(abstract)

AI总结 研究一类基于总体α-分位数的排序量化平均场博弈,提出目标型和阈值型两种模型,并应用于早期风险投资中筛选顶尖初创企业。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05353 2026-06-26 cs.GT 版本更新 50%

Weighted Envy-Freeness Revisited: Indivisible Resource and House Allocations

加权无嫉妒性再探讨:不可分资源与房屋分配

Yuxi Liu, Mingyu Xiao

专题命中 Agent评测 :agent(abstract)

AI总结 提出SumAvg-无嫉妒性概念,显著提高公平分配的存在性,并系统研究新旧加权公平概念在不可分资源分配和房屋分配中的计算复杂性。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-60679-7}

详情

展开后加载摘要…

URL PDF HTML 收藏