arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-23 至 2026-07-23 共收录 131 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19380 2026-07-23 cs.LG 新提交 57%

CruiseBench: A Real-Flight-Aligned N-CMAPSS Benchmark for Engine RUL Prediction

CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试

Pu Cheng, Qiang Miao

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 57%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19967 2026-07-23 physics.soc-ph cs.AI cs.CY 新提交 57%

When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets

当托运人成为算法:候选者曝光、信息设计与大语言模型介导的货运市场集中度

Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari

机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学与技术研究中心) Department of Aeronautics and Astronautics, School of Engineering, The University of Tokyo(东京大学工学部航空宇宙学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究托运人委托大语言模型代理选择承运人对货运市场的影响及平台设计应对策略,通过基于代理的模拟发现代理趋同、集中度随候选列表数量变化等风险,披露承运人剩余日运力可有效应对,凸显平台信息设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17890 2026-07-23 cs.AI 版本更新 57%

Stress Testing Concept Erasure with Large Language Model Agents

用大语言模型智能体对概念擦除进行压力测试

Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris

机构 * School of Engineering, University of Edinburgh(爱丁堡大学工程学院) The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对概念擦除评估面临的验证挑战,提出STACE框架,利用大语言模型智能体迭代生成并验证压力测试假设,通过一套指标评估性能效率,经实验证明该框架在多方面表现优异且可拓展到其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20196 2026-07-23 cs.GT 新提交 50%

Improved Lower Bounds and Output Augmentation for Facility Location Mechanisms

设施选址机制的改进下界与输出增强

Rafael Gomes, Sophie Klumper, Guido Schäfer, Jens Schlöter

专题命中 Agent评测 :agent(abstract)

AI总结 研究平等主义目标下战略设施选址问题,证明防策略机制近似比渐近下界,给出双代理随机近似机制;考虑输出增强框架,设计不同设置下的确定性或随机近似机制,展现输出增强可替代随机性及成组防策略特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04731 2026-07-23 cs.GT 版本更新 50%

Improved Approximation Guarantees for Groupwise Maximin Share Fairness

改进的群组最大最小份额公平性近似保证

Georgios Amanatidis, Anna Korfiati, Evangelos Markakis, Christodoulos Santorinaios

专题命中 Agent评测 :agent(abstract)

AI总结 针对可加性估值函数的不可分割商品公平分配问题,提出一种多项式时间算法,将群组最大最小份额(GMMS)的近似比改进为ϕ-1(ϕ≈1.618),并通过子实例分析证明该界渐近紧致。

Comments Accepted to the 19th International Symposium on Algorithmic Game Theory (SAGT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30017 2026-07-23 math.PR 版本更新 50%

Conditional Probability Spaces and the Structure of Agreement

条件概率空间与一致性的结构

Erya Yang, Adam Brandenburger

专题命中 Agent评测 :agent(abstract)

AI总结 利用条件概率空间(Rényi, 1955)的框架,在一般条件下推导出Aumann(1976)的一致性定理,无需共同先验、信息划分、测度正性和知识算子等传统假设。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25824 2026-07-23 q-fin.MF 版本更新 50%

Mean-field game of mean-variance portfolio optimization with peer-based risk aversion

基于同伴相对风险厌恶的均值-方差投资组合管理的平均场博弈

Weilun Cheng, Zongxia Liang, Sheng Wang, Xiang Yu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究具有同伴相对风险厌恶的均值-方差投资组合管理的平均场博弈问题,通过平滑正则化和不动点论证证明了时间不一致平均场均衡的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14516 2026-07-23 cs.LO 版本更新 50%

Beyond the Spell: A Dynamic Logic Analysis of Misdirection

超越咒语:误导的动态逻辑分析

Benjamin Icard, Raul Fervari

专题命中 Agent评测 :agent(abstract)

AI总结 研究视觉误导,引入动态认知逻辑,既能表示对主体信念的言语误导,也能表示对主体观察的视觉误导,通过对“法式落物”建模说明逻辑动态性,还给出可靠完备公理系统并讨论相关特性。

Comments To appear in Journal of Applied Logics - IfCoLog Journal of Logics and their Applications, Volume 13, Number 4 (August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2607.19767 2026-07-23 cs.AI 新提交 79%

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏