arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-27 至 2026-05-27 共收录 204 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 30 篇

2605.26346 2026-05-27 cs.CL 79%

The Daily Dose: Workflow-Integrated Large Language Model Automation for Clinical Summarization and Trial Identification in Radiation Oncology

每日剂量:工作流集成的大型语言模型自动化在放射肿瘤学中的临床总结和试验识别

Jason Holmes, Federico Mastroleo, Mariana Borras-Osorio, Srinivas Seetamsetty, Satomi Shiraishi, Mirek Fatyga, Judy C. Boughey, Cornelius A. Thiels, William G. Breen, Daniel J. Ma, Daniel K. Ebner, David M. Routman, Brady S. Laughlin, Carlos E. Vargas, Samir H. Patel, Sujay A. Vora, Nadia N. Laack, Andrew Y. K. Foong, Wei Liu, Mark R. Waddle

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, AZ, United States(辐射肿瘤科,梅奥诊所,凤凰城,亚利桑那州,美国) Department of Radiation Oncology, Mayo Clinic, Rochester, MN, United States(辐射肿瘤科,梅奥诊所,罗切斯特,明尼苏达州,美国) Division of Radiation Oncology, IEO, European Institute of Oncology, IRCCS, Milan, Italy(放射肿瘤学部,IEO,欧洲肿瘤研究所,IRCCS,米兰,意大利)

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.CL

AI总结 本文介绍了一个名为“每日剂量”的LLM驱动的自动化临床总结和临床试验识别系统,该系统集成到常规放射肿瘤学实践中,并通过混合方法评估其可用性、满意度和感知有用性,结果显示高使用率和满意度。

Comments 28 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27202 2026-05-27 cs.CY cond-mat.stat-mech physics.soc-ph 78%

Queue & AI: When Faster Tasks Slow Down the Workflow

队列与人工智能:当更快任务拖慢工作流

Silvia Bartolucci, Pierpaolo Vivo

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 本文通过排队论模型,揭示AI辅助在任务积累的工作流中可能因下游返工导致系统级性能下降,并提出“方差楔”概念,论证平均任务速度不能代表整体效率。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27123 2026-05-27 cs.IR 78%

Rethinking Agentic RAG: Toward LLM-Driven Logical Retrieval Beyond Embeddings

重新思考智能体RAG:迈向超越嵌入的LLM驱动逻辑检索

Yuqi Zeng, Qixiang Deng, Yulei Wan, Ruiquan Jiang, Xiaoqing Zheng, Xuanjing Huang

专题命中 工作流自动化 :agentic(title,abstract)

AI总结 提出一种智能体RAG框架,让LLM通过逻辑表达式控制检索,使用轻量级倒排索引后端,在降低成本和幻觉的同时匹配强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26597 2026-05-27 cs.CR cs.MA 78%

Control Physiology: An Agent-Based Model of FAIR-CAM Dynamics

控制生理学:基于智能体的FAIR-CAM动力学模型

Jack Jones, Laura Voicu

专题命中 工作流自动化 :agent(title,abstract)

AI总结 针对安全控制效果静态假设的局限性,提出首个基于智能体的模型来操作化FAIR-CAM核心动力学,通过医院勒索软件场景模拟揭示静态分析无法捕捉的三种涌现动力学。

Comments 25 pages, 7 figures, 3 tables. Open-source code at https://github.com/security-decision-science/security-decision-labs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08318 2026-05-27 quant-ph 75%

A Model Context Protocol Server for Quantum Execution in Hybrid Quantum-HPC Environments

用于混合量子-HPC环境中量子执行的模型上下文协议服务器

Masaki Shiraishi, Ikko Hamamura, Tatsuya Ishigaki, Tadashi Kadowaki

专题命中 工作流自动化 :agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 提出基于MCP服务器的AI驱动框架,使LLM代理能通过自然语言自动执行量子计算工作流,包括采样和期望值计算等原语。

Comments Accepted to QC4C3 workshop at QCNC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26174 2026-05-27 cs.SE cs.AI cs.CL cs.MA 67%

A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

一个通用悬崖与一个设计指纹:LLM编排下的跨段缺陷检测

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究机构) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学部门)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究揭示在LLM编排下,所有模型检测跨段矛盾缺陷的能力大幅下降(检测率降低三分之二以上),并发现不同对齐范式下的模型行为差异,其中一家开发商的模型随对齐增强呈现报告标准偏移。

Comments 24 pages, 2 figures. Data and code: doi:10.5281/zenodo.20372696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27178 2026-05-27 cs.CV cs.AI cs.LG cs.RO 62%

FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation

FoundObj: 自监督基础模型作为无标签3D物体分割的奖励

Zihui Zhang, Zhixuan Sun, Yafei Yang, Jinxi Li, Jiahao Chen, Bo Yang

机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(深圳研究院,香港理工大学) vLAR Group, The Hong Kong Polytechnic University(vLAR小组,香港理工大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出FoundObj框架,利用自监督2D/3D基础模型的语义和几何先验作为奖励,通过强化学习引导超点合并,实现无标注复杂场景3D物体分割。

Comments ICML 2026. Zihui and Zhixuan are co-first authors. Code and data are available at: https://github.com/vLAR-group/FoundObj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20251 2026-05-27 cs.SE cs.AI 62%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26442 2026-05-27 cs.CL cs.AI 62%

Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines

大型语言模型的对齐调优:以数据为中心的对齐数据管道视角

Hwanjun Song

机构 * KAIST(韩国科学技术院)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。

Comments Accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11467 2026-05-27 cs.AI cs.HC cs.LG 62%

From Attribution to Action: A Human-Centered Application of Activation Steering

从归因到行动:激活导向的人本应用

Tobias Labarta, Maximilian Dreyer, Katharina Weitz, Wojciech Samek, Sebastian Lapuschkin

机构 * Fraunhofer Heinrich-Hertz-Institut(弗劳恩霍夫 Heinrich-Hertz 研究所) Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出结合SAE归因与激活导向的交互式工作流,通过专家访谈验证其能促进从检查到干预的转变,并揭示组件抑制等调试策略及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27174 2026-05-27 cs.SD cs.AI cs.CY 57%

An investigation of AI integration in sound designer workflows and experiences

AI在声音设计师工作流程与体验中的整合研究

Nelly Garcia, Joshua Reiss

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 通过混合方法研究(76人调查+20人访谈),发现当前AI工具在快速消费媒体中表现良好,但缺乏高端声音设计所需的叙事复杂性,从业者偏好辅助性、任务特定的应用,而非端到端生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27073 2026-05-27 cs.LG 57%

Learning to Orchestrate Agents under Uncertainty

学习在不确定性下编排智能体

Mary Chriselda Antony Oliver, Lan Jiang, Aaron Bundi Anampiu, Elaf Almahmoud, Francesco Quinzan, Umang Bhatt

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学) Centre for Human-Inspired Artificial Intelligence, University of Cambridge(启发式人工智能中心,剑桥大学) African Institute for Mathematical Sciences, South Africa(南非数学科学研究所) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.LG

AI总结 提出BOT-Orch框架,将编排问题转化为带正则化的多臂赌博机问题,在不确定性下实现异构智能体的自适应编排,理论保证遗憾界为O(√T)并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27022 2026-05-27 cs.AI 57%

ORCA: An End-to-End Interactive Copilot for Optimized Root Cause Analysis

ORCA:一种用于优化根因分析的端到端交互式副驾驶

Phi Nguyen Xuan, Nicholas Tagliapietra, Lavdim Halilaj, Kristian Kersting, Juergen Luettin

机构 * Robert Bosch GmbH, Germany Bosch Global Software Technologies Company Limited, Vietnam Computer Science Department, TU Darmstadt, Germany Hessian Center for Artificial Intelligence (hessian.AI), Darmstadt German Center for Artificial Intelligence (DFKI)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 提出ORCA,一种端到端因果分析副驾驶,通过编排智能体理解用户目标并引导其完成从全自动到高度用户引导的因果分析工作流,涵盖因果发现、效应估计、可解释性和根因分析,并生成结构化报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26137 2026-05-27 cs.GR cs.AI cs.CV 57%

AssetGen: Deployable 3D Asset Generation at Interactive Speed

AssetGen: 可部署的交互速度3D资产生成

Dilin Wang, Xiaoyu Xiang, Kihyuk Sohn, Tom Monnier, Yu-Ying Yeh, Thu Nguyen-Phuoc, Jiawen Zhang, Yuchen Fan, Antoine Toisoul, Hyunyoung Jung, Prithviraj Dhar, Michael Bunnell, Nikolaos Sarafianos, Chuhang Zou, Roman Shapovalov, Andrea Vedaldi, Rakesh Ranjan

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI

AI总结 提出AssetGen系统,通过粗到细的VecSet框架、多视图纹理生成及端到端加速,在30秒内生成带烘焙法线、颜色纹理和可控多边形预算的高质量网格,支持实时渲染和移动端部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26118 2026-05-27 cs.DC cs.AI 57%

Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

Xe-Forge:面向Intel GPU的多阶段LLM驱动的内核优化

Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky, Gabriela Ben-Melech Stan, Shira Guskin, Weilin Xu, Adam Siemieniuk, Alexander Heinecke

机构 * Intel Corporation(英特尔公司)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 提出Xe-Forge,一个多阶段LLM流水线,通过Chain-of-Verification-and-Refinement(CoVeR)代理和硬件验证,自动将Triton内核优化为Intel GPU,实现几何平均1.17倍加速,Flash Attention加速2-13.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03545 2026-05-27 cs.AI 57%

Persona Generators: Generating Diverse Synthetic Personas for Arbitrary Contexts

人格生成器:为任意上下文生成多样化的合成人格

Davide Paglieri, Logan Cross, William A. Cunningham, Joel Z. Leibo, Alexander Sasha Vezhnevets

机构 * Google DeepMind(谷歌DeepMind)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 提出Persona Generators,通过迭代进化优化生成覆盖广泛意见和偏好的多样化合成人格,在六个多样性指标上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13611 2026-05-27 cs.SE q-bio.QM 57%

BIOMERO 2.0: end-to-end FAIR infrastructure for bioimaging data import, analysis, and provenance

BIOMERO 2.0:用于生物成像数据导入、分析和溯源的端到端FAIR基础设施

Torec T. Luik, Joost de Folter, Rodrigo Rosas-Bertolini, Eric A. J. Reits, Ron A. Hoebe, Przemek M. Krawczyk

专题命中 工作流自动化 :workflow(abstract);分类 cs.SE

AI总结 本文提出BIOMERO 2.0框架,通过集成数据导入、预处理、分析和工作流监控的OMERO.web插件及容器化组件,将OMERO转化为符合FAIR原则且具有溯源能力的生物成像平台。

Comments 16 pages, 2 figures, 25 pages supplemental information; for software, see https://github.com/Cellular-Imaging-Amsterdam-UMC/NL-BIOMERO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 50%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27106 2026-05-27 cs.DC cs.GT cs.MA cs.NI 50%

Autonomic Federated-Market Orchestration for the Edge-Cloud Continuum

边缘-云连续体的自主联邦市场编排

Lauri Lovén, Roberto Morabito, Abhishek Kumar, Susanna Pirttikangas, Jukka Riekki, Sasu Tarkoma

专题命中 工作流自动化 :planning(abstract)

AI总结 提出Neural Pub/Sub联邦代理自主基板,通过基于市场的价格信号实现去中心化编排,在边缘-云连续体中实现与集中式预言机相当的福利效率,并验证了其抗故障性和主权执行零开销。

Comments 35 pages, 5 figures (combined main paper + electronic supplement, folded into one document for arXiv)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26953 2026-05-27 quant-ph 50%

Pairwise Liouvillian learning from randomized measurements: practical aspects and guidelines for operating the protocol in large-scale experiments

基于随机测量的成对Liouvillian学习:大规模实验中协议操作的实际方面和指南

William T. Lam, Manoj K. Joshi, Daniel Stilck França, Benoît Vermersch

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文回顾并数值研究了基于随机Pauli态和测量的Liouvillian学习协议,提出了一种高效成对获取Liouvillian系数的方法,其经典内存需求与系统大小无关,并给出了最小化总重构误差的参数选择指南。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26897 2026-05-27 cond-mat.mtrl-sci physics.atom-ph 50%

Active learning of collinear magnetic Moment Tensor Potentials using the spin-MLIP package from soft-constrained spin-polarized DFT calculations: a case study of Fe-Pd

利用自旋MLIP包从软约束自旋极化DFT计算主动学习共线磁矩张量势:以Fe-Pd为例

Arseniy Burov, Alexey S. Kotykhov, Dmitry A. Aksyonov, Ivan S. Novikov, Vladimir V. Ladygin

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出一种在分子动力学模拟中主动学习磁矩张量势(mMTP)的工作流程,通过自旋MLIP、VASP和LAMMPS实现,并在Fe-Pd晶体上验证了磁化和态密度与DFT及实验的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26792 2026-05-27 math.CO math.DS 50%

Absorbing States of Binary Trust Gossip Are Counted by Plane Partitions

二元信任八卦模型的吸收态由平面分拆计数

Nicholas Boichuk

专题命中 工作流自动化 :agent(abstract)

AI总结 研究二元信任八卦模型中吸收态的结构,发现吸收态对应于代理被划分为孤立派系,每个派系包含核心成员和外围成员,并建立与平面分拆的一一对应。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 13 篇

2601.18381 2026-05-27 cs.AI cs.SE 95%

AI Agent for Reverse-Engineering Legacy Finite-Difference Code and Translating to Devito

AI Agent 用于逆向工程遗留有限差分代码并转换为 Devito

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(title,title_cn);AI agent(title,title_cn);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本研究提出一个集成 AI Agent 框架,结合检索增强生成(RAG)和开源大语言模型,通过多阶段迭代工作流将遗留有限差分代码转换为 Devito 环境,并引入强化学习反馈机制实现动态自适应代码翻译。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26298 2026-05-27 cs.CR cs.OS 86%

Sandlock: Confining AI Agent Code with Unprivileged Linux Primitives

Sandlock: 使用非特权Linux原语限制AI代理代码

Cong Wang, Yusheng Zheng

专题命中 软件智能体 :AI agent(title,abstract);agent(title)

AI总结 提出Sandlock,一种轻量级Linux进程沙箱,通过静态策略编译和窄监督器分离实现无root、无cgroups、无镜像的进程隔离,支持动态网络决策和可逆文件系统效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26329 2026-05-27 cs.AI 85%

JobBench: Aligning Agent Work With Human Will

JobBench:使智能体工作符合人类意愿

Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Notre Dame(圣母大学) University of California, Berkeley(加州大学伯克利分校) Michigan State University(密歇根州立大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Bake AI King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) Western Washington University(西雅图华盛顿大学) University of Chicago(芝加哥大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 85%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26102 2026-05-27 cs.SE cs.CL 84%

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.CL、cs.SE

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20690 2026-05-27 cs.AI 84%

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

声明式数据服务:用于组合数据系统的结构化智能体发现

Shanshan Ye, Duo Lu

机构 * Northeastern University(东北大学) Brown University(布朗大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI;AI agent(comments)

AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。

Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03194 2026-05-27 cs.CL cs.SE 81%

BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?

BeyondSWE:当前代码代理能否超越单仓库错误修复?

Guoxin Chen, Fanzhe Meng, Jiale Zhao, Minghao Li, Daixuan Cheng, Huatong Song, Jie Chen, Yuzhi Lin, Hui Chen, Xin Zhao, Ruihua Song, Chang Liu, Cheng Chen, Kai Jia, Ji-Rong Wen

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 提出BeyondSWE基准测试,评估代码代理在跨仓库、领域特定、依赖迁移和文档生成等复杂软件工程任务上的表现,发现现有代理在利用外部信息进行精确代码修改方面仍存在显著不足。

Comments Benchmark: https://huggingface.co/datasets/AweAI-Team/BeyondSWE. Repo: https://github.com/AweAI-Team/BeyondSWE. Scaffold: https://github.com/AweAI-Team/AweAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26508 2026-05-27 q-fin.RM cs.AI 80%

Foundations of a Time-Consistent Counterfactual Actuarial Runtime for Autonomous AI Agents

自主AI智能体时间一致性反事实精算运行时的基础

Hao-Hsuan Chen

机构 * Department of Risk Management and Insurance(风险管理与保险系)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出一种精算运行时层,通过为每个动作分配时间一致的反事实风险费用,并建立边界内无套利和预算保证,为自主AI智能体提供基础数学框架。

Comments 10 pages. Foundational paper of a multi-paper program on actuarial runtime for autonomous AI agents; previously posted on SSRN (id 6761960). Empirical companion: arXiv:2605.25632. Proof companions included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏