arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-23 至 2026-07-23 共收录 24 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 24 篇

2607.19941 2026-07-23 cs.HC cs.AI 新提交 89%

A Framework of User Experience Principles for Human-AI Agent Interaction in the Workplace

工作场所中人类与人工智能代理交互的用户体验原则框架

Kathrin Paimann, Elizangela Valarini, Sebastian Juhl

机构 * SAP SE(SAP公司) Hochschule Fresenius(弗赖辛大学) University of Missouri(密苏里大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究工作场所人类与人工智能代理交互的用户体验原则,采用多方法识别并验证八项核心原则框架及标准,为设计师和工程师提供指导方针,为相关实证研究奠定结构化基础。

Comments 6 pages, 1 figure, 1 table, to be published in the proceedings of Mensch und Computer 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 87%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02124 2026-07-23 cs.NI cs.ET 版本更新 85%

FlexNGIA 2.0: Redesigning the Internet with Agentic AI -- Protocols, Services, and Traffic Engineering Designed, Deployed, and Managed by AI

FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程

Mohamed Faten Zhani, Younes Korbi, Yamen Mkadem

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20019 2026-07-23 cs.AI 新提交 83%

EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair

EvoDRC:一种用于自动修复DRC违规的自进化智能体框架

Bing-Yue Wu, Chia-Tung Ho, Haoyu Yang, Brucek Khailany, Vidya A. Chhabria

机构 * Arizona State University(亚利桑那州立大学) NVIDIA Corporation(英伟达公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对先进节点物理设计中DRC闭合瓶颈问题,EvoDRC提出自进化智能体框架,利用参考设计知识和目标设计经验初始化并进化修复技能,将布局分解后分配智能体,通过工具反馈和知识数据库提升修复效果,实验显示总体减少73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 83%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09345 2026-07-23 cs.OS cs.AI 版本更新 83%

AgentCgroup: Understanding and Controlling OS Resources of AI Agents

AgentCgroup: 理解和控制AI代理的操作系统资源

Yusheng Zheng, Jiakun Fan, Quanzhi Fu, Yiwei Yang, Wei Zhang, Andi Quinn

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Virginia Tech(弗吉尼亚理工大学) UConn(康涅狄格大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 AgentCgroup通过意图驱动的eBPF资源控制器,解决多租户云环境中AI代理资源管理的粒度、响应性和适应性不匹配问题,提升隔离性和减少资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19548 2026-07-23 cs.LG 新提交 79%

Agent-Centric Animal Pose Forecasting

以智能体为中心的动物姿态预测

Eyrun Eyjolfsdottir, Kristin Branson

机构 * HHMI Janelia Research Campus(霍华德·休斯医学研究所珍利亚研究园区)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究旨在从跟踪姿态训练以智能体为中心的动物行为自回归模型,引入相关框架及通用库,模型能捕捉果蝇群体社会行为分布,库可支持系统比较并适应新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10535 2026-07-23 cs.HC 版本更新 78%

Exploring the Interplay Between Voice, Personality, and Gender in Human-Agent Interactions

探索语音、个性与性别在人机交互中的相互作用

Kai Alexander Hackney, Lucas Guarenti Zangari, Jhonathan Sora-Cardenas, Emmanuel Munoz, Sterling R. Kalogeras, Betsy DiSalvo, Pedro Guillermo Feijoo-Garcia

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究探讨用户能否通过语音识别人工代理的外向性,并分析感知个性与用户-代理同步性之间的关系,发现女性语音在区分外向性上更有效,而男性语音则不一致。

Journal ref https://www.frontiersin.org/articles/10.3389/fcomp.2026.1855830

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 73%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19436 2026-07-23 cs.CR cs.AI 新提交 70%

Building Trust in Autonomous Commerce: A Verifiable Global Event Timeline and AI-Ready Fraud Intelligence Layer

在自主商业中建立信任:可验证的全球事件时间线和支持人工智能的欺诈情报层

Rajat Srivastava

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究为智能商业提出可验证全球事件时间线,由规范事件模式等四组件构成,还引入欺诈标记和数据集谱系模型。原型实现实证结果显示,其在处理事件速度、验证时间、证明大小及验证性能上有优势。

Comments 18 pages, 4 tables, 1 figure. Preprint also available on Zenodo: https://doi.org/10.5281/zenodo.19060285

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19400 2026-07-23 cs.LG q-bio.GN 新提交 70%

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型

Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge D. Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan S. Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu, Xiaojie Qiu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。

Comments 98 pages, 4 main figures, and 15 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 66%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 62%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 57%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19380 2026-07-23 cs.LG 新提交 57%

CruiseBench: A Real-Flight-Aligned N-CMAPSS Benchmark for Engine RUL Prediction

CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试

Pu Cheng, Qiang Miao

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 57%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19967 2026-07-23 physics.soc-ph cs.AI cs.CY 新提交 57%

When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets

当托运人成为算法:候选者曝光、信息设计与大语言模型介导的货运市场集中度

Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari

机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学与技术研究中心) Department of Aeronautics and Astronautics, School of Engineering, The University of Tokyo(东京大学工学部航空宇宙学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究托运人委托大语言模型代理选择承运人对货运市场的影响及平台设计应对策略,通过基于代理的模拟发现代理趋同、集中度随候选列表数量变化等风险,披露承运人剩余日运力可有效应对,凸显平台信息设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17890 2026-07-23 cs.AI 版本更新 57%

Stress Testing Concept Erasure with Large Language Model Agents

用大语言模型智能体对概念擦除进行压力测试

Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris

机构 * School of Engineering, University of Edinburgh(爱丁堡大学工程学院) The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对概念擦除评估面临的验证挑战,提出STACE框架,利用大语言模型智能体迭代生成并验证压力测试假设,通过一套指标评估性能效率,经实验证明该框架在多方面表现优异且可拓展到其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20196 2026-07-23 cs.GT 新提交 50%

Improved Lower Bounds and Output Augmentation for Facility Location Mechanisms

设施选址机制的改进下界与输出增强

Rafael Gomes, Sophie Klumper, Guido Schäfer, Jens Schlöter

专题命中 Agent评测 :agent(abstract)

AI总结 研究平等主义目标下战略设施选址问题,证明防策略机制近似比渐近下界,给出双代理随机近似机制;考虑输出增强框架,设计不同设置下的确定性或随机近似机制,展现输出增强可替代随机性及成组防策略特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04731 2026-07-23 cs.GT 版本更新 50%

Improved Approximation Guarantees for Groupwise Maximin Share Fairness

改进的群组最大最小份额公平性近似保证

Georgios Amanatidis, Anna Korfiati, Evangelos Markakis, Christodoulos Santorinaios

专题命中 Agent评测 :agent(abstract)

AI总结 针对可加性估值函数的不可分割商品公平分配问题,提出一种多项式时间算法,将群组最大最小份额(GMMS)的近似比改进为ϕ-1(ϕ≈1.618),并通过子实例分析证明该界渐近紧致。

Comments Accepted to the 19th International Symposium on Algorithmic Game Theory (SAGT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30017 2026-07-23 math.PR 版本更新 50%

Conditional Probability Spaces and the Structure of Agreement

条件概率空间与一致性的结构

Erya Yang, Adam Brandenburger

专题命中 Agent评测 :agent(abstract)

AI总结 利用条件概率空间(Rényi, 1955)的框架,在一般条件下推导出Aumann(1976)的一致性定理,无需共同先验、信息划分、测度正性和知识算子等传统假设。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25824 2026-07-23 q-fin.MF 版本更新 50%

Mean-field game of mean-variance portfolio optimization with peer-based risk aversion

基于同伴相对风险厌恶的均值-方差投资组合管理的平均场博弈

Weilun Cheng, Zongxia Liang, Sheng Wang, Xiang Yu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究具有同伴相对风险厌恶的均值-方差投资组合管理的平均场博弈问题,通过平滑正则化和不动点论证证明了时间不一致平均场均衡的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14516 2026-07-23 cs.LO 版本更新 50%

Beyond the Spell: A Dynamic Logic Analysis of Misdirection

超越咒语:误导的动态逻辑分析

Benjamin Icard, Raul Fervari

专题命中 Agent评测 :agent(abstract)

AI总结 研究视觉误导,引入动态认知逻辑,既能表示对主体信念的言语误导,也能表示对主体观察的视觉误导,通过对“法式落物”建模说明逻辑动态性,还给出可靠完备公理系统并讨论相关特性。

Comments To appear in Journal of Applied Logics - IfCoLog Journal of Logics and their Applications, Volume 13, Number 4 (August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏