arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-01 至 2026-07-01 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2606.30560 2026-07-01 cs.LG cs.AI cs.PF 版本更新 84%

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

TraceLab: 表征用于LLM服务的编码代理工作负载

Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci

机构 * University of Washington(华盛顿大学) Wuhan University of Technology(武汉理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 通过收集4300个编码代理会话(含35万LLM步骤和43万工具调用)的真实轨迹,分析发现长自主循环、长上下文短输出、多样化重尾工具调用及高但不完美前缀缓存命中率等特征,为优化服务提供具体方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 82%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 82%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13692 2026-07-01 cs.OS cs.MA 版本更新 82%

ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System

ThunderAgent: 一个简单、快速且程序感知的智能推理系统

Hao Kang, Ziyang Li, Weili Xu, Xinyu Yang, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora

专题命中 软件智能体 :agentic(title,abstract);workflow(abstract)

AI总结 提出ThunderAgent系统,通过LLM程序抽象统一管理KV缓存和工具资源,实现程序感知调度,在编码、路由和科学发现任务中吞吐量提升1.5-3.9倍,磁盘内存节省高达4.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32007 2026-07-01 cs.AI 新提交 79%

AxDafny: Agentic Verified Code Generation in Dafny

AxDafny: Dafny中的智能验证代码生成

Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18440 2026-07-01 cs.SE 79%

Autonomous Agents in Software Development: A Vision Paper

软件开发中的自主代理:愿景论文

Zeeshan Rasheed, Muhammad Waseem, Kai-Kristian Kemell, Wang Xiaofeng, Anh Nguyen Duc, Kari Systä, Pekka Abrahamsson

专题命中 软件智能体 :autonomous agent(title);planning(abstract);分类 cs.SE

AI总结 本文探讨GPT代理在软件工程中的潜力,提出通过多代理协作提升软件开发效率,展示其在代码生成、文档编写等方面的能力,并规划未来研究方向。

Comments 5 pages, 1 figure

Journal ref International Conference on Agile Software Development, pp. 15-23, Springer, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31206 2026-07-01 cs.SE 新提交 70%

FeatX: Editing Software by Editing Features for Repository-Level Code Evolution

FeatX: 通过编辑特征来编辑软件以实现仓库级代码演化

Xutian Li, Yifeng Zhu, Xianlin Zhao, Yanzhen Zou, Lu Zhang, Bing Xie

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 提出特征导向工具FeatX,通过提取层次化史诗-特征结构并调用三阶段演化代理,将特征编辑转化为代码补丁,显著降低认知负荷并提升修改定位F1达42.6%。

Comments 4 pages, Accepted to the Tools and Datasets Track of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14066 2026-07-01 cs.SE 新提交 70%

FastContext: Training Efficient Repository Explorer for Coding Agents

FastContext: 为编码智能体训练高效的仓库探索器

Shaoqiu Zhang, Maoquan Wang, Yuling Shi, Yuhang Wang, Xiaodong Gu, Yongqiang Yao, Tori Gong, Sheng Chen, Rao Fu, Anisha Agarwal, Spandan Grag, Gabriel Ryan, Colin Merkel, Yufan Huang, Shengyu Fu

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31630 2026-07-01 cs.LG 新提交 57%

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31182 2026-07-01 cs.AI 新提交 57%

AI-Assisted Discovery of Convex Relaxations via Dual Agents

通过双智能体实现凸松弛的AI辅助发现

Sungyoon Kim, Mert Pilanci

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出一种双智能体自动研究范式,通过编码智能体提议约束、理论智能体验证并搜索反例,结合区间算术验证,改进了两个优化常数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22593 2026-07-01 cs.SE cs.CR 新提交 57%

On Good Authority: Release-Authority Measurement for Registry-Mediated Package Ecosystems

论良好权威:注册中心中介的包生态系统的发布权威度量

Igor Santos-Grueiro

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出一种前驱感知的发布权威记录,通过比较发布路径证据(发布者、仓库、工作流、来源、签名、中介)识别策略触发的发布路径不连续性,经npm等五个生态系统的审计样本验证,触发策略可有效筛选需审查的发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30884 2026-07-01 cs.HC 新提交 50%

Debugging as Evidence-Driven Reasoning: Visualization Opportunities in Data-Intensive Programming

调试作为证据驱动的推理:数据密集型编程中的可视化机会

Yongbo Chen, Yan Zhu, Rebecca Faust

专题命中 软件智能体 :workflow(abstract)

AI总结 通过半结构化访谈揭示数据密集型调试中的三个跨领域挑战,并转化为可视化设计需求,为未来研究奠定基础。

Comments 5 pages, 1 figure, submitted to IEEE VIS conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04700 2026-07-01 cs.CV 版本更新 50%

A New Angle on Bones: Robust Pose Estimation in X-Ray and Ultrasound

骨骼的新视角:X射线和超声中的鲁棒姿态估计

Ron Keuth, Christoph Großbröhmer, Franziska Halm, Miriam Johann, Anne-Nele Schröder, Ludger Tüshaus, Mattias P. Heinrich, Lasse Hansen

机构 * Medical Informatics, University of Lübeck(吕贝克大学医学信息学系) Institut of Radiology and Nuclear Medicine, University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院放射学与核医学研究所) Paediatric Surgery, University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院小儿外科) EchoScout GmbH

专题命中 软件智能体 :planning(abstract)

AI总结 提出基于学习的关键点候选和鲁棒线模型(RANSAC、霍夫变换)的自动骨骼姿态估计方法,在儿科骨折和髋关节发育不良评估中达到临床可接受的误差并优于地标方法。

Comments Accepted at MIUA 2026 (oral presentation); Code and annotations for fracture angle assessment in radiographs: https://github.com/multimodallearning/RobustBonePoseEstimation

详情

展开后加载摘要…

URL PDF HTML 收藏