arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-26 至 2026-05-26 共收录 315 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 62 篇

2605.24516 2026-05-26 cs.MA cs.AI 70%

Adaptive Punishment for Cooperation in Mixed-Motive Games

混合动机博弈中促进合作的自适应惩罚

Min Tang, Fanqi Kong, Linyuan Lü, Xue Feng

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(一般人工智能国家重点实验室,BIGAI)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出自适应惩罚合作方法(APC),通过动态惩罚概率和背叛严重程度确定惩罚强度,在迭代公共物品博弈中有效促进合作并降低惩罚成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24423 2026-05-26 cs.AI 70%

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

临时团队协作中上下文强化学习的极限基准测试

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

机构 * C$^{2}$DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所C²DL实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology of China(中国科学技术大学) Qwen Team, Alibaba Group(阿里集团Qwen团队)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出ICRL4AHT基准,基于Overcooked-V2评估上下文强化学习在临时团队协作中的表现,发现算法在未见队友和布局下常不如随机基线,凸显多智能体环境下的适应挑战。

Comments 41 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05004 2026-05-26 cs.CL 70%

Can Large Language Models Resolve Semantic Discrepancy in Self-Destructive Subcultures? Evidence from Jirai Kei

大语言模型能否解决自我毁灭亚文化中的语义差异?来自Jirai Kei的证据

Peng Wang, Xilin Tao, Siyi Yao, Jiageng Wu, Yuntao Zou, Zhuotao Tian, Libo Qin, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology(澳门科技大学SKLPlanets) College of Software, Northeastern University(东北大学软件学院) School of Energy and Power Engineering, Huazhong University of Science and Technology(华中科技大学能源与动力工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对亚文化中自我毁灭行为检测面临的知识滞后和语义错位问题,提出多智能体框架SAS,通过自动检索和亚文化对齐显著提升LLM检测性能,并优于现有先进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25867 2026-05-26 eess.SY cs.SY 67%

CINOC: Cardinality-Invariant Neural Operator Policies for Scalable PDE Control

CINOC: 用于可扩展PDE控制的不变性基数神经算子策略

Pietro Zanotta, Dibakar Roy Sarkar, Honghui Zheng, Somdatta Goswami, Ján Drgoňa

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 提出基数不变神经算子控制(CINOC),通过将PDE控制重构为算子学习问题,实现策略在传感器、执行器或智能体配置变化时的零样本迁移和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 67%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24479 2026-05-26 math.OC cs.SY eess.SY 67%

Single-Chord Augmentation of Weighted Cycles for Algebraic Connectivity and Network Coherence

加权环的单弦增强用于代数连通性和网络一致性

Jiarong Deng, Liu Chang, Quanshun Yang

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文研究向加权环添加单条弦以同时改善共识收敛速率和稳态不一致性,通过电阻分割分析推导代数连通性增益和基尔霍夫指数减少的闭式解,并设计帕累托筛选规则实现高效近似最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24245 2026-05-26 cs.CR 67%

Deep-Research Agents Can Be Poisoned via User-Generated Content

深度研究智能体可通过用户生成内容被投毒

Tingwei Zhang, Harold Triedman, Vitaly Shmatikov

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文发现深度研究智能体在检索过程中反复获取同一用户生成内容页面,攻击者可通过在页面上附加短文本实施投毒攻击,并评估了三种系统的脆弱性及防御措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24132 2026-05-26 eess.SY cs.SY 67%

Local Input-to-State Stability for Consensus in the Presence of Intermittent Communication and Input Saturation

间歇通信和输入饱和下共识的局部输入到状态稳定性

Thales C. Silva, M. Ani Hsieh

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 针对输入饱和与间歇通信阻碍共识收敛的问题,通过将共识转化为等效稳定性问题,提出基于有界集和凸优化的方法,给出多智能体系统在间歇交互和饱和输入下局部输入到状态稳定性的充分条件,并评估扰动容忍与抑制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23984 2026-05-26 cs.LG cs.AI cs.CV 62%

Parameter Efficient Multi-Class Intelligent Scheduling for Multimodal Online Distributed Industrial Anomaly Detection

面向多模态在线分布式工业异常检测的参数高效多类智能调度

Heqiang Wang, Weihong Yang, Zheyuan Yang, Jia Zhou, Xiaoxiong Zhong, Fangming Liu, Weizhe Zhang

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen International Graduate School(深圳国际研究生院)

专题命中 多智能体 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 针对工业异常检测中分布式、持续生成数据的特点,提出多模态在线分布式工业异常检测框架,通过多类智能调度问题和序列边际增益贪婪算法协调模型更新,并采用资源高效类级低秩适应策略降低系统开销,在MVTec 3D-AD和Eyecandies数据集上取得优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02843 2026-05-26 cs.CL 57%

Act or Clarify? Modeling Sensitivity to Uncertainty and Cost in Communication

行动还是澄清?建模沟通中对不确定性和成本的敏感性

Polina Tsvilodub, Karl Mulligan, Todd Snider, Robert D. Hawkins, Michael Franke

机构 * Department of Linguistics, University of Tübingen(图宾根大学语言系) Department of Linguistics, Stanford University(斯坦福大学语言系)

专题命中 多智能体 :agent(abstract);分类 cs.CL

AI总结 提出基于预期遗憾的计算模型,研究人类在不确定性下是否选择提问澄清,取决于不确定性和错误行动成本之间的理性权衡。

Comments 6 pages, 3 figures, accepted to CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00934 2026-05-26 cs.CY cs.AI 57%

The Meme Is the Message: Generative Memesis and AI Visuals in the 2024 USA Presidential Elections

模因即信息:生成式模因与2024年美国总统选举中的AI视觉内容

Ho-Chun Herbert Chang, Benjamin Shaman, Yung-chun Chen, Mingyue Zha, Sean Noh, Chiyu Wei, Tracy Weener, Maya Magee

机构 * Program in Quantitative Social Science, Dartmouth College(量化社会科学项目,达特茅斯学院) Department of Mathematics, Dartmouth College(数学系,达特茅斯学院)

专题命中 多智能体 :workflow(abstract);分类 cs.AI

AI总结 本研究通过分析Instagram图像数据集,结合计算机视觉、大语言模型和面部情感分析,发现模因格式比AI生成内容更能预测用户参与度,但AI生成的模因与人类策展结合时产生协同效应,并定义了生成式模因作为AI介导的模因传播新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23703 2026-05-26 cs.HC cs.AI cs.CY 57%

Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

Talking Slide Avatars: 面向教学的开源多模态通信方法

Xinxing Wu

机构 * School of Mathematics and Computer Science, Kentucky State University(肯塔基州立大学数学与计算机科学学院)

专题命中 多智能体 :workflow(abstract);分类 cs.AI

AI总结 提出一种集成OpenVoice和Ditto-TalkingHead的开源工作流,用于创建可说话的幻灯片头像,以增强在线教学中的教师存在感和叙事连续性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10012 2026-05-26 cs.LG 57%

PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning

PID引导的多模态去中心化联邦学习部分对齐

Yanhang Shi, Xiaoyu Wang, Houwei Cao, Jian Li, Yong Liu

机构 * Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Applied Mathematics and Statistics and the Department of Computer Science, Stony Brook University(石溪大学应用数学与统计系和计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) Department of Computer Science, New York Institute of Technology(纽约理工学院计算机科学系)

专题命中 多智能体 :agent(abstract);分类 cs.LG

AI总结 针对多模态去中心化联邦学习中异构代理间更新不兼容的问题,提出基于部分信息分解的PARSE框架,通过特征分裂和部分对齐实现高效通信与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22256 2026-05-26 cs.MA 50%

Emergence of agriculture in an artificial society of reinforcement learning agents

强化学习智能体人工社会中农业的出现

Gautier Hamon, Martí Sánchez-Fibla, Clément Moulin-Frier, Ricard Solé

专题命中 多智能体 :planning(abstract)

AI总结 通过强化学习智能体人工社会,研究农业从个体决策与社会交互中自发涌现的机制,发现延迟奖励估值、社会脆弱性、社会学习及锁定效应是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 42 篇

2605.22794 2026-05-26 cs.AI cs.LG 91%

MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems

MOSS:自主智能体系统中通过源代码级重写的自我进化

Qianshu Cai, Yonggang Zhang, Xianzhang Jia, Huajiang Zheng, Wei Xue, Jun Song, Xinmei Tian, Yike Guo

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center(香港生成式AI研究与开发中心) The Hong Kong University of Science and Technology(香港理工大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 工作流自动化 :agent(title,abstract);autonomous agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 提出MOSS系统,通过源代码级重写实现自主智能体系统的自我进化,利用生产故障证据自动批处理和多阶段确定性流水线,在OpenClaw上单周期内将平均评分从0.25提升至0.61。

Comments 12 pages, 3 figures, 2 tables. Preprint. Code: https://github.com/hkgai-official/Moss

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24949 2026-05-26 cs.CR cs.AI 90%

APT-Agent: Automated Penetration Testing using Large Language Models

APT-Agent:利用大语言模型的自动化渗透测试

William Guanting Li, Alsharif Abuadbba, Kristen Moore, Dan Dongseong Kim

机构 * University of Queensland(昆士兰大学)

专题命中 工作流自动化 :agent(title,title_cn);分类 cs.AI

AI总结 提出APT-Agent框架,通过混合修正模块和命令特定记忆架构解决大语言模型在渗透测试中的幻觉和长期记忆问题,在Metasploitable 2上实现84.29%的端到端利用成功率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23948 2026-05-26 cs.MA 86%

comokit4py : a python package to ease COMOKIT agent based model simulation integration into a high performance computing workflow

comokit4py:一个简化COMOKIT基于智能体的模型模拟集成到高性能计算工作流程的Python包

Arthur Brugière, Kévin Chapuis

专题命中 工作流自动化 :agent(title,abstract);workflow(title)

AI总结 提出一个Python包comokit4py,用于简化COMOKIT基于智能体模型(ABM)的模拟集成到高性能计算(HPC)工作流中,支持实验生成、探索和报告构建。

Comments 6 pages, 2 figures, IEEE submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24580 2026-05-26 cs.CY 82%

From Replacement to Orchestration: A Socio-Technical Architecture for Agentic AI in Corporate R&D

从替代到编排:企业研发中代理型人工智能的社会技术架构

Haithem Boussaid, Marc Heemskerk, Jimmy Siméon, Adam Breen, Merouane Debbah

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract)

AI总结 针对企业研发中的生产力悖论(如Eroom定律),提出HARMONY社会技术架构,通过认知负荷再分配和有界自主性设计,引入科学企业家角色和编排杠杆指标,以提升人类-代理混合系统的研发产出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24201 2026-05-26 cs.CV physics.med-ph 82%

Radiuma: A Unified Zero-Code Executable Graphical Workflow Generator for Reproducible and Shareable Medical Image Analysis and Machine Learning

Radiuma: 一个统一的无代码可执行图形工作流生成器,用于可重复和可共享的医学图像分析与机器学习

Mohammad Salmanpour, Mehrdad Oveisi, Isaac Shiri, Arman Rahmim

机构 * Department of Basic and Translational Research, BC Cancer Research Institute(基础与转化研究部,BC癌症研究中心) Department of Radiology, University of British Columbia(放射科,不列颠哥伦比亚大学) Technological Virtual Collaboration (TECVICO Corp.)(技术虚拟协作(TECVICO公司)) Department of Computer Science, University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(心脏病学部,Inselspital,伯恩大学医院,伯恩大学) Department of Digital Medicine, University of Bern(数字医学系,伯恩大学) Departments of Physics & Biomedical Engineering, University of British Columbia(物理学与生物医学工程系,不列颠哥伦比亚大学)

专题命中 工作流自动化 :workflow(title,abstract);planning(abstract)

AI总结 提出Radiuma模块化平台,通过可视化工作流系统集成图像处理、放射组学特征提取和机器学习模块,实现无需编程即可构建可重复的多步分析流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23853 2026-05-26 cs.AI 81%

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace: 面向LLM智能体技能蒸馏的成本感知追踪

Boqin Yuan, Yue Su, Renchu Song, Sen Yang, Jing Qin

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.AI;agentic(comments)

AI总结 针对技能蒸馏管道缺乏每步成本信号的问题,提出ClawTrace记录成本归因轨迹并生成TraceCard,通过CostCraft生成保留、剪枝和修复三类技能补丁,发现剪枝补丁作为质量护栏而保留补丁导致回归,主张按规则类型评估可复用技能。

Comments Accepted at Agent Skills '26 Workshop, ACM Conference on AI and Agentic Systems (CAIS 2026), San José, CA, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25701 2026-05-26 cs.DC cs.CL cs.IR cs.NI 79%

Neural Router: Semantic Content Matching for Agentic AI

神经路由器:面向智能体AI的语义内容匹配

Lauri Lovén, Abhishek Kumar, Alexander Engelhardt, Alaa Saleh, Roberto Morabito, Xiaoli Liu, Naser Hossein Motlagh, Sasu Tarkoma

机构 * Future Computing Group, University of Oulu(奥卢大学未来计算组) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系) Department of Communication Systems, EURECOM(EURECOM通信系统部门)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出将大语言模型作为内容发布/订阅代理的语义匹配引擎,通过分析上下文窗口交叉点和判别能力交叉点,实现成本-准确性权衡,并给出三个可组合算法和自主LLM层级选择框架。

Comments 35 pages, 12 figures. Combined main paper and electronic supplement, folded into one document for arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24784 2026-05-26 cs.AI 79%

GRAIL: AI translation for scientists application workflow on satellite data

GRAIL:面向卫星数据科学家应用工作流的AI翻译

Zhuocheng Shang, Ahmed Eldawy

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 工作流自动化 :workflow(title);agentic(abstract);分类 cs.AI

AI总结 提出GRAIL系统,通过LangGraph管道将Python地理空间工作流翻译为可扩展的Spark程序,无需科学家学习新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24756 2026-05-26 cs.AI 79%

Proper Scoring Rules for Agentic Uncertainty Quantification

智能体不确定性量化的适当评分规则

Suresh Raghu, Satwik Pandey, Shashwat Pandey

机构 * Independent Researcher(独立研究者)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 针对语言模型智能体轨迹中的不确定性信号,提出严格适当的轨迹评分规则TPS,用于评估逐步骤成功概率过程,并处理删失数据。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24002 2026-05-26 physics.chem-ph cond-mat.mtrl-sci cs.AI physics.comp-ph 79%

Harnessing AtomisticSkills for Agentic Atomistic Research

利用原子技能实现代理原子研究

Bowen Deng, Bohan Li, Matthew Cox, Hoje Chun, Juno Nam, Artur Lyssenko, Sathya Edamadaka, Jurgis Ruza, Xiaochen Du, Nofit Segal, Jesus Diaz Sanchez, Mingrou Xie, Ty Perez, Yu Yao, Miguel Steiner, Sauradeep Majumdar, Charles B. Musgrave, Anirban Chandra, Abhirup Patra, Detlef Hohl, Connor W. Coley, Ju Li, Rafael Gómez-Bombarelli

机构 * Department of Materials Science Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Chemical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Chemistry, Kookmin University, Seoul 02707, Republic of Korea Harvard University, Department of Chemistry Department of Chemistry, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Department of Nuclear Science Shell Information Technology International Inc., Texas 77082, United States Shell International Exploration \& Production Inc., Texas 77079, United States

专题命中 工作流自动化 :agentic(title);agent(abstract);分类 cs.AI

AI总结 提出AtomisticSkills框架,通过分层分解科学工作流为技能和工具,使通用AI编码代理能够进行原子级研究,并在多个科学任务中验证其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25665 2026-05-26 cs.SE cs.AI 79%

Meta-Engineering Harnesses for AI-Native Software Production: A Contract-Driven Adversarial Verification Architecture with Early Deployment Report

面向AI原生软件生产的元工程框架:一种基于合约的对抗性验证架构及早期部署报告

Satadru Sengupta, Tamunokorite Briggs, Ivan Myshakivskyi

机构 * HireNimbus

专题命中 工作流自动化 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出一种元工程框架,通过合约驱动、角色专业化AI代理和对抗性验证,实现AI原生软件的持续生产、验证与改进,并在小型服务公司的CTO即服务场景中部署17项功能,验证了其可靠性。

Comments 17 pages, 2 figures, early deployment report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25350 2026-05-26 cs.DC 78%

An Empirical Evaluation of Quantum-Inspired QUBO Methods for Heterogeneous HPC Workflow Mapping and Scheduling

量子启发式QUBO方法用于异构HPC工作流映射与调度的实证评估

Aasish Kumar Sharma, Christian Boehme, Julian Kunkel

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 通过系统实验评估三种量子启发式QUBO变体(单次模拟退火、多次尝试退火和分层QAOA启发调度)在异构HPC工作流调度中的可行性、makespan和资源利用率,并与MILP、CP-SAT、GA和HEFT等经典基线比较,发现QUBO方法在任务数超过15时可行性下降,经典方法在现有求解器能力下仍更可靠。

Comments 11 pages, 5 figures, to appear in Proc. 41st Int. Conf. ISC High Performance 2026 (ISC26), Hamburg, Germany, June 22-26, 2026, IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23985 2026-05-26 cs.DB cs.IR 78%

Federated Semantic Knowledge Graphs for Laboratory Workflows: A Structured Expert Elicitation Methodology Demonstrated Through Bioanalytical Workflow Twins

面向实验室工作流的联邦语义知识图谱:通过生物分析工作流孪生展示的结构化专家启发方法

Luis F. Schachner, Vinith Thamizhazhagan, Sara Tanenbaum, John C. Tran, Pamela P. F. Chan, Mandy Kwong, Andy Chang, Maureen Beresini, Margaret Porter Scott

专题命中 工作流自动化 :workflow(title);agent(abstract)

AI总结 提出一种可重复的结构化专家启发方法和联邦语义知识图谱架构,用于捕获和查询实验室工作流中的隐性知识,并通过Genentech的部署案例展示了跨子图查询能力,特别是识别自动化掩盖的静默故障。

Comments 48 pages, 4 figures, 3 appendices. Submitted to ISWC 2026 In-Use Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00777 2026-05-26 cs.CV 75%

DUCX: Decomposing Unfairness in Tool-Using Chest X-ray Agents

DUCX:分解使用工具的胸部X光代理中的不公平性

Zikang Xu, Ruinan Jin, Xiaoxiao Li

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Anhui, China(人工智能研究所,合肥国家科学中心,安徽,中国) The University of British Columbia, Vancouver, BC V6Z 1Z4, Canada(不列颠哥伦比亚大学,温哥华,BC V6Z 1Z4,加拿大) Vector Institute, Toronto, ON M5G 1M1, Canada(向量研究所,多伦多,ON M5G 1M1,加拿大)

专题命中 工作流自动化 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 提出DUCK框架,通过阶段式公平性分解方法,系统审计使用工具的胸部X光代理中的工具暴露偏差、工具转换偏差和模型推理偏差,揭示端到端评估无法预测的群体差异。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24183 2026-05-26 cs.DB cs.AI cs.LG 73%

AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

AvalancheBench: 通过潜在世界恢复评估企业数据智能体

Darek Kleczek, Fuheng Zhao, Alexander W. Lee, Julien Tissier, Pawel Liskowski, Ugur Cetintemel, Anupam Datta

机构 * Brown University and Snowflake(布朗大学和Snowflake)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出AvalancheBench基准,通过潜在世界恢复评估企业数据智能体的分析理解能力,揭示早期错误如何传播并导致系统性错误推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20023 2026-05-26 cs.AI cs.MA 70%

When Skills Don't Help: A Negative Result on Procedural Knowledge for Tool-Grounded Agents in Offensive Cybersecurity

当技能无济于事:关于程序性知识在进攻性网络安全中工具型智能体的负面结果

Samuel Jacob Chacko, James Hugglestone, Chashi Mahiul Islam, Xiuwen Liu

机构 * Florida State University(佛罗里达州立大学)

专题命中 工作流自动化 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过重新分析一项控制实验,发现当环境反馈带宽高时,技能(Skills)对智能体性能的边际效益消失甚至产生负面影响,并提出了可证伪的假设。

Comments Accepted as a poster at ACM CAIS 2026 AgentSkills Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏