arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-27 至 2026-07-27 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 23 篇

2607.22368 2026-07-27 cs.AI 新提交 86%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21824 2026-07-27 cs.CR 新提交 85%

Protocol-Level Attacks on Agentic Commerce Platforms: A Cross-Platform Taxonomy, AIP-Bench, and Unified Defense

对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御

Yedidel Louck

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22321 2026-07-27 cs.CR cs.AI cs.SE 版本更新 84%

ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents

对时间、空间和语义规避的自主代理进行基准测试

Jianan Ma, Xiaohu Du, Ruixiao Lin, Yaoxiang Bian, Jialuo Chen, Yunhao Feng, Xiaofang Yang, Shiwen Cui, Changhua Meng, Xinhao Deng, Jingyi Wang, Zhen Wang

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。

Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22024 2026-07-27 cs.CR cs.AI 新提交 83%

Agent Security Needs Redefinition through a Holistic Framework

通过整体框架重新定义智能体安全需求

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究指出智能体安全是上下文问题,当前基于内容的框架有误。通过源授权、任务对齐、行动对齐和数据隔离四个属性实施上下文安全,改变了防御连贯性、评估有效性及可识别的攻击模式。

Comments ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新 81%

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-07-27 cs.MA 新提交 78%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnicov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20062 2026-07-27 cs.CL 版本更新 70%

Solar Open 2 Technical Report

太阳能开放2技术报告

Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文介绍为长期代理任务构建的太阳能开放2语言模型。通过混合注意力堆栈等技术扩大规模,利用更强起点和高价值数据实现高效训练,经多教师策略蒸馏构建代理技能,在多项基准测试中表现出色,展示了其在语言模型领域的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 62%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 61%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG;agentic(comments)

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 57%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 57%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 57%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 57%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04637 2026-07-27 cs.AI 版本更新 57%

Same World, Differently Given: History-Dependent Perceptual Reorganization in Artificial Agents

同一世界,不同给定:人工智能代理中的历史依赖性感知重组

Hongju Pae

机构 * Active Inference Institute(主动推理研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种最小架构,通过反馈的慢视角潜在变量g实现感知重组,使相同观察在不同历史下编码不同,验证了适应性自调节在代理历史依赖性视角组织中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22132 2026-07-27 cs.SI 新提交 50%

On the Fragility of Majority Illusions

论多数错觉的脆弱性

Maaike Venema-Los, Zoé Christoff, Serte Donderwinkel, Davide Grossi

专题命中 Agent评测 :agent(abstract)

AI总结 研究社交网络中多数错觉的脆弱性,通过考虑主体观点随时间变化的网络及规模增大的随机图序列两种情况,发现多数错觉在多数更新下会消失,且出现可能性趋于零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21960 2026-07-27 cs.RO 新提交 50%

Adaptive Undulatory Locomotion of Snake-like Robots in Dynamic Viscous Environments via Deep Reinforcement Learning

通过深度强化学习实现蛇形机器人在动态粘性环境中的自适应波动运动

Tsuyoshi Kimoto, Akio Yamano, Kohei Honda, Takashi Iwasa

专题命中 Agent评测 :agent(abstract)

AI总结 研究蛇形机器人在动态粘性环境中的自适应运动,利用深度强化学习,通过非对称演员 - 评论家框架及特权信息提炼,使机器人获得非正弦自适应步态,提高推进速度和运输效率,突破传统控制极限。

Comments 23 pages, 6 figures. Submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21630 2026-07-27 cs.NE 新提交 50%

Evolving Self-Organising Agents Without Fitness: Three Falsifiable Experiments from Constraint-Driven Selection to Developmental Encoding

无适应度的自组织智能体演化:从约束驱动选择到发育编码的三个可证伪实验

Anushka Sharma

专题命中 Agent评测 :agent(abstract)

AI总结 研究在无设计者指定适应度函数时生物发育进化动力学能否产生,通过Genesis平台进行三个实验周期,测试可证伪假设,得出约束驱动选择、智能体介导生态位构建及CPPN间接编码相关结果,还产生了诊断工具和协议。

Comments GECCO Companion '26 Workshop Paper (EvoSelf/ESO Workshop), July 13-17, 2026, San Jose, Costa Rica. 3 pages. ACM ISBN 979-8-4007-2488-6/2026/07

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21890 2026-07-27 math.OC 新提交 50%

Stackelberg Games with a Robust Leader

具有稳健领导者的斯塔克尔伯格博弈

Juan Li, Jianfeng Zhang, Zimu Zhu

专题命中 Agent评测 :agent(abstract)

AI总结 研究具有一个领导者和多个追随者的斯塔克尔伯格博弈,稳健领导者考虑最坏情况,通过弱形式将问题转化为零和博弈,利用HJB方程刻画,还指出委托代理问题是其特殊情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19131 2026-07-27 cs.SI 版本更新 50%

Conspiracy Theory Rabbit Holes Emerge via Interacting Contagions

阴谋论兔子洞通过相互作用的传播出现

Fabian Tschofenig, Paul Vicinanza, Henrich Greve, Hayagreeva Rao, Douglas Guilbeault

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨人们陷入阴谋论兔子洞的原因,通过分析推文用序列风险模型等揭示阴谋论间相互作用及定居者效应,比较多种模型,发现传染病生态模型能重现相关动态,还表明防止阴谋论首次公开认可有重要作用。

Comments 49 pages, 13 figures, 5 tables, including supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10203 2026-07-27 quant-ph 50%

Topology-Aware Block Coordinate Descent for Qubit Frequency Allocation of Superconducting Quantum Processors

基于拓扑的块坐标下降法用于超导量子处理器的量子比特频率分配

Zheng Zhao, Weifeng Zhuang, Yanwu Gu, Peng Qian, Xiao Xiao, Dong E. Liu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一种基于拓扑的块坐标下降方法,用于超导量子处理器的量子比特频率分配,通过将顺序选择转化为序列依赖旅行商问题,实现高效的块排序,提升优化性能。

Comments 25 pages,6 figures

Journal ref Quantum Sci. Technol. 11 035023 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04842 2026-07-27 cs.NI 版本更新 50%

Intelligent resource allocation in wireless networks via deep reinforcement learning

通过深度强化学习实现无线网络中的智能资源分配

Marie Diane Iradukunda, Chabi F. Elégbédé, Yaé Ulrich Gaba

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用深度强化学习实现无线网络中智能资源分配,通过DQN智能体实现自适应功率控制,实验显示其在吞吐量和公平性方面优于传统方法。

Comments 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21446 2026-07-27 econ.TH 50%

Contrarian Incentives and Costly Social Learning

反众动机在社会学习中的作用

Vasilii Ivanik, Georgy Lukyanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在反众动机影响下,社会学习中代理人如何通过获取私人信号来做出最优决策,并分析了反众强度对信息价值和决策影响的动态变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14288 2026-07-27 cs.GT 版本更新 50%

Popular Matchings under Preference Variation and an Algorithm for Popular Common Bases with Integral Comparison Margins

偏好变化下的流行匹配以及具有整数比较边际的流行公共基算法

Gergely Csáji

专题命中 Agent评测 :agent(abstract)

AI总结 研究匹配市场中偏好变化下的流行匹配与优势匹配,给出单边市场相关多项式时间算法及双边市场流行匹配NP难、优势匹配在部分情况下易处理的结论,核心方法是扩展原始对偶水平算法。

详情

展开后加载摘要…

URL PDF HTML 收藏