arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-17 至 2026-08-17 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 19 篇

2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 91%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);AI agent(abstract);tool use(abstract)

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13884 2026-08-17 cs.SE cs.AI cs.ET cs.HC cs.LG 新提交 89%

Engineering Signals of Human-AI Collaboration in the Agentic Coding Era: A Longitudinal Analysis of 33,228 Pull Requests from vLLM and SGLang with Implications for Biomedical AI Agents and Bioinformatics Pipeline Developmen

智能体编码时代人机协作的工程信号:对vLLM和SGLang中33228个拉取请求的纵向分析及其对生物医学智能体和生物信息学流程开发的启示

Jiada Li, Xuesong Ye, Olamide Olowoniyi

专题命中 软件智能体 :agentic(title,abstract);AI agent(title);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究对vLLM和SGLang的33228个拉取请求进行纵向分析,发现AI辅助开发提升了开源软件的吞吐量、贡献者参与度及人机协作信号,且增长主要由人类驱动,为生物医学智能体开发提供启示。

Comments 24 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13536 2026-08-17 cs.OS 版本更新 86%

Don't Let AI Agents YOLO Your Files: Information and Control in Agent-Native Filesystems

别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性

Shawn Wanxiang Zhong, Junxuan Liao, Jing Liu, Mai Zheng, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

专题命中 软件智能体 :agent(title,abstract);AI agent(title)

AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 82%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15572 2026-08-17 cs.LG cs.MA 版本更新 79%

Neural Network-Based Parameter Estimation of a Labour Market Agent-Based Model

基于神经网络的劳动力市场基于主体的模型参数估计

M Lopes Alves, Joel Dyer, Doyne Farmer, Michael Wooldridge, Anisoara Calinescu

机构 * Department of Computer Science(计算机科学系) Institute of New Economic Thinking(新经济思想研究所) University of Oxford(牛津大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 本文提出利用神经网络改进劳动力市场ABM参数估计方法,通过对比汇总统计量的有效性,验证了NN在参数恢复和效率提升方面的优势。

Comments Paper has been submitted without the consent of all 5 authors and without having its final version. Uploaded on arxiv at 17 Feb 2026 The version with proper review was only available on 19 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14093 2026-08-17 cs.HC 新提交 78%

AppLooper: An Agentic Application Engineering Loop for Accountable Release with Virtual-User Feedback

AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈

Zihong He, Chen Liang, Hai-Ning Liang

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13856 2026-08-17 eess.IV cs.CV stat.AP 新提交 67%

From crown candidates to neighborhood screening: integrating optical GeoAI and spatial modeling for urban-canopy assessment in Davis, California

从树冠候选到邻域筛选:整合光学地理人工智能与空间建模用于加利福尼亚州戴维斯市的城市树冠评估

Mohammadreza Narimani, Shreyan Mitra, Parastoo Farajpoor

专题命中 软件智能体 :planning(abstract);workflow(abstract)

AI总结 本研究整合光学GeoAI与空间建模,利用2022年影像在戴维斯市生成树冠筛选层,绘制了该市9.37%的树冠,验证了其与热环境的关联,为城市规划提供支持。

Comments 17 pages, 10 figures + 5 supplementary figures, 7 tables. Preprint submitted to Taylor & Francis. Code: this https URL (https://github.com/MohammadrezaNarimaniUCDavis/Davis_Urban_Canopy_GeoAI) Data: this https URL (https://doi.org/10.5281/zenodo.21925527)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14048 2026-08-17 astro-ph.IM 新提交 67%

Aether.jl: A High-Performance 3D MHD and Multifluid Dust Code Written in a Dynamic Language with an Interactive Human-AI Development Framework

Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码

Ka Wai Ho

专题命中 软件智能体 :agent(abstract);workflow(abstract)

AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。

Comments 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13867 2026-08-17 cs.SE cs.AI 新提交 62%

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

构建可靠的编码智能体:评估与运行模型周边系统

Stephanie Jarmak

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究针对AI编码智能体的可靠性问题,整合多源证据构建系统级评估与运行框架,区分模型与基础设施效应,提出可靠性记录目录及相关方法以提升智能体系统可靠性。

Comments Technical review and engineering monograph, 314 pages, 30 figures. Includes an evidence audit, a companion research artifact with 206 reliability records, and runnable protocols for evaluating and operating AI coding agents. August 2026. Source, companion, and reusable protocols: this https URL (https://github.com/sjarmak/engineering-reliable-coding-agents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-08-17 cs.SE cs.AI cs.ET 新提交 62%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13568 2026-08-17 cs.CL cs.AI 新提交 62%

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

语言服务器能为编码智能体节省 token 吗?一种测量方法与初步研究

Pengcheng Xu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过五组消融实验等方法,对比 LSP 与 grep 检索的 token 效率,发现 LSP 通常不节省 token,仅对最弱模型有 token 节省效果,需根据任务、模型等选择检索工具。

Comments 13 pages, 6 figures. Code and data: this https URL (https://github.com/Poytr1/lsp-vs-grep-token-study)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29516 2026-08-17 cs.SE cs.AI 版本更新 62%

From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

从代码审查到代码批判:大规模AI生成代码差异的意图、漂移与焦点

Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对AI生成代码超出传统审查能力且现有工具忽视核心问题的缺陷,提出ARCTIC系统,经实验验证其在意图预测、漂移检测等方面表现优异,可降低代码不一致性并获高认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25692 2026-08-17 cs.SE cs.LG 版本更新 62%

A Configuration-First Framework for Reproducible, Low-Code Localization

一种面向可重复、低代码定位的配置优先框架

Tim Strnad (Jožef Stefan Institute, Slovenia), Blaž Bertalanič (Jožef Stefan Institute, Slovenia), Carolina Fortuna (Jožef Stefan Institute, Slovenia)

机构 * Jožef Stefan Institute(乔塞夫·斯蒂芬研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出了一种低代码、配置优先的框架,通过版本化配置和自动化流程提升定位任务的可重复性和效率。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: this https URL (https://arc-agi-3-twin.vercel.app/) Code: this https URL (AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at this https URL (https://github.com/Zaffer/research-computational-law)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14396 2026-08-17 math.OC cs.AI 新提交 57%

AI-Assisted Discovery and Construction of a Counterexample to the Convergence of Three-Block ADMM with the Identity Matrix as its Third Constraint Block

AI辅助发现与构造以单位矩阵作为第三个约束块的三块ADMM收敛性反例

Kenan Xu, Xiangfeng Wang

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究借助AI工具构造出以单位矩阵为第三约束块的三块ADMM的收敛反例,还分析了乘子松弛对收敛性的影响,对比了不同AI工具在数学研究中的表现。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10119 2026-08-17 cs.SE 版本更新 57%

IntrinTrans: LLM-based Intrinsic Code Translator for RISC-V Vector

IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器

Liutong Han, Zhiyuan Tan, Hongbin Zhang, Pengcheng Wang, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13610 2026-08-17 eess.IV cs.MM 新提交 50%

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

LoopVSR:用于自动修复视觉语音识别推理流水线的循环工程框架

Fei Qin, Bowen Zhang, Chao Fan, Pengcheng Luo, Genke Yang

专题命中 软件智能体 :agent(abstract)

AI总结 LoopVSR是一种循环工程框架,可让代码智能体结合端到端执行证据自动修复VSR推理流水线,在CMLR VSR系统上的表现远优于静态防护,可实现100%平均修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏