arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-14 至 2026-07-14 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 23 篇

2607.10522 2026-07-14 cs.CV cs.AI 新提交 84%

Towards Autonomous and Auditable Medical Imaging Model Development

迈向自主且可审计的医学成像模型开发

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Microsoft Research(微软研究院) Lehigh University(里海大学)

专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11698 2026-07-14 cs.CR cs.AI 新提交 83%

Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

智能体攻击智能体:用于生产智能体红队测试的自动研究

Xutao Mao, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究生产型语言模型智能体的自动化红队测试,提出AHA可证伪发现循环,通过该循环构建漏洞概念图。在Claude Code和Codex上测试,发现跨模型和智能体的可重复使用漏洞核心,生成的VCG为安全团队提供可审计工件,提升测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10569 2026-07-14 cs.SE cs.AI cs.LG 新提交 83%

When Does Restricting a Coding Agent to execute_code Help? A Regime $\times$ Agent-Design Ablation

限制编码代理执行代码何时有用?一种机制×代理设计消融研究

Hong Yang, Qi Yu, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE;agentic(comments)

AI总结 研究现代编码代理不同工具表面有效性,通过在特定任务上对两种代理进行三臂消融实验,发现最便宜工具表面由任务机制和代理设计共同决定,主要成本信号是缓存调整成本而非通过率。

Comments 9 pages (excluding references), 4 figures, 4 tables. Accepted to the Agentic Software Engineering (SE 3.0) Workshop at KDD 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11309 2026-07-14 physics.comp-ph 新提交 82%

Toward AI-Agent-Driven Particle Transport Simulations: Implementation of AI-Assisted Workflows for PHITS

迈向人工智能代理驱动的粒子输运模拟:PHITS的人工智能辅助工作流程实现

Tatsuhiko Sato, Shintaro Hashimoto, Tatsuhiko Ogawa, Takuya Furuta, Yuho Hirata, Seiki Ohnishi, Yasuhito Sakaki, Nobuhiro Shigyo

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 研究针对蒙特卡罗粒子输运代码使用复杂的问题,提出将人工智能助手和代理应用于PHITS的策略,准备了两组人工智能就绪资源,经五个示范任务验证,表明提供适当资源和规则时人工智能代理可处理复杂工作流程,支持捆绑资源使用通用人工智能工具。

Comments 30 pages, 3 figures, and 2 tables, including 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11864 2026-07-14 cs.IR 版本更新 82%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09902 2026-07-14 cs.SE cs.AI 新提交 81%

Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code

这些暴力的愉悦会有暴力的结局吗?衡量代理代码合并后的命运

Chunqiu Steven Xia, Courtney Miller

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) George Washington University(乔治华盛顿大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 研究代理代码合并后的命运,通过对182个仓库实证分析,发现其虽与人工维护率相似,但需更高纠正性维护率,还引入更多问题,且维护负担与仓库特征有关,强调评估设计代理工具要兼顾安全性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09691 2026-07-14 cs.LG cs.AI 新提交 81%

What Context Does a Coding Agent Actually Need to Act?

编码智能体实际行动需要什么上下文?

Brian Sam-Bodden

机构 * Integrallis Software(Integrallis软件公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究编码智能体编辑代码时实际所需上下文,通过固定定位、改变代码表示并评分,发现代码本身自然语言摘要作用小,周围上下文无关紧要,压缩上下文效果好,还发现API推理的噪声底限,且发布相关工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 79%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11046 2026-07-14 cs.SE 新提交 79%

Retrieval-Oriented Code Representations in Agentic Bug Localization

面向检索的智能体漏洞定位中的代码表示

Genevieve Caumartin, Tse-Hsun, Chen, Diego Elias Costa

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09674 2026-07-14 cs.CY 新提交 78%

From Tools to Teacher-Built Teammates: No-Code Pedagogical Plugin Authoring with LearnAdapt Agentic Studio and PedOS 1.1 Lumina

从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作

Nizam Kadir

专题命中 软件智能体 :agentic(title,abstract)

AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。

Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10621 2026-07-14 cs.SE 新提交 77%

WebDesignIter: Co-Evolving Design Knowledge for Repository-Level Front-End Code Generation

WebDesignIter:用于仓库级前端代码生成的协同进化设计知识

Zheng Pei, Mingwei Liu, Zhenxi Chen, Zihao Wang, Yanlin Wang

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);分类 cs.SE

AI总结 研究针对前端开发仓库级代码生成问题,提出WebDesignIter框架,通过持久知识图谱融合设计知识与仓库结构,分两阶段工作,实验证明其相比基线和通用编码代理有优势,凸显设计知识对仓库级代码生成的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10455 2026-07-14 cs.AI cs.CL 新提交 73%

ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

Kefan Song, Yanjun Qi

机构 * Anthropic(Anthropic公司)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。

Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交 70%

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04089 2026-07-14 physics.comp-ph cond-mat.str-el cs.AI cs.HC 版本更新 70%

From Paper to Program: Knowledge Externalization and Bottleneck Diagnosis in AI-Assisted Quantum Many-Body Programming

从论文到程序:AI辅助量子多体代码生成中的知识外化

Yi Zhou

机构 * Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院物理研究所,北京100190,中国)

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 针对AI直接翻译论文为代码时因隐含约定导致失败的问题,提出知识外化方法,通过多阶段人机协作流程将隐式假设显式化,在DMRG和Pfaffian-MPS任务上验证了有效性。

Comments 20 pages, 4 figures. Substantially revised presentation, related-work context, reproducibility documentation, validation-gate wording, limitations, and generative-AI disclosure; numerical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09361 2026-07-14 cs.DB 版本更新 67%

Bespoke-Card: Why Tune When You Can Generate? Synthesizing Workload-Specific Cardinality Estimators

Bespoke-Card:为何调优而非生成?合成工作负载特定的基数估计器

Johannes Wehrstein, Anton Winter, Timo Eckmann, Carsten Binnig

专题命中 软件智能体 :agent(abstract);planning(abstract)

AI总结 提出Bespoke-Card系统,通过智能体驱动合成工作负载特定的基数估计器,利用结构化q-error反馈和课程学习等策略,在JOB上降低33%总运行时间和41%中位数q-error。

Comments Accepted for AIDB@VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04419 2026-07-14 cs.CL cs.AI cs.LG 版本更新 67%

Context-Dependent Affordance Computation in Vision-Language Models

视觉-语言模型中基于情境的可及性计算

Murad Farzulla

机构 * Dissensus AI King’s College London(伦敦国王学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。

Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11565 2026-07-14 cs.LG cs.AI physics.flu-dyn 新提交 62%

Heuristic Learning for Active Flow Control Using Coding Agents

使用编码智能体的主动流动控制启发式学习

Paul Garnier, Jonathan Viquerat, Elie Hachem

机构 * Mines Paris - PSL University Centre for Material Forming (CEMEF) CNRS(巴黎矿业 - 巴黎文理研究大学材料成型中心(CEMEF)法国国家科学研究中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究主动流动控制中控制器设计难题,提出用编码智能体直接搜索显式可执行反馈律的启发式学习范式及受限协议,经多基准评估,其启发式控制器性能优、可解释,是传统强化学习的可靠互补替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11111 2026-07-14 cs.SE 新提交 57%

Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

修复前先了解:用于软件问题解决的基于问答的仓库知识获取

Haotian Lin, Silin Chen, Xiaodong Gu, Yuling Shi, Chengxi Pan, Jiaqi Ge, Mengfan Li, Jianghong Huang, Mengchieh Chuang, Beijun Shen, Haibing Guan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对基于大语言模型的编码代理解决软件问题易因仓库理解不足出错的问题,提出ACQUIRE框架,通过问答驱动在修复前获取仓库知识,经两阶段解耦知识获取与补丁生成,实验证明该框架能提升问题解决准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10712 2026-07-14 cs.CR cs.AI cs.DL 新提交 57%

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

分布式科学否认:人工智能系统的间接数据投毒如何使科学欺诈产业化

Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究探讨人工智能时代科学欺诈新形式,即间接数据投毒。对手 corrupt 开放数据集上传,使自主研究代理处理后传播欺诈。通过多话题、多系统实验发现投毒成功率高而检测率低。提出科学家角色和数据溯源审计措施,后者可有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11601 2026-07-14 cs.CR 新提交 50%

Cardano's Voltaire Governance: Complete Specification and Research Program

卡尔达诺的伏尔泰治理:完整规范与研究计划

Nimrod Talmon, Oghenekaro Elem

专题命中 软件智能体 :agent(abstract)

AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10948 2026-07-14 eess.SY cs.SY 新提交 50%

Reinforcement Learning versus Optimization for Optimal Transmission Switching: A Comparative Study

最优输电切换的强化学习与优化方法比较研究

Yuanrui Sang, Israel Abiala, Rachel Gerdes

专题命中 软件智能体 :agent(abstract)

AI总结 研究最优输电切换问题,比较强化学习框架与基于混合整数线性规划的优化方法,通过在IEEE RTS-96 24节点系统上的案例研究发现,强化学习智能体在低预算下能产生接近最优解,生成可行解速度比优化求解器快两到三个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10842 2026-07-14 cs.RO cs.SY eess.SY 新提交 50%

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions

D-SafeMPC:基于离散时间控制障碍函数的扩散驱动安全模型预测控制

Erdi Sayar, Ersin Daş, Joel W. Burdick, Alois Knoll, Erdal Kayacan

机构 * Paderborn University(帕德博恩大学) Illinois Institute of Technology(伊利诺伊理工学院) California Institute of Technology(加州理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 软件智能体 :planning(abstract)

AI总结 研究针对扩散模型用于机器人规划时无法保证安全和动态约束的问题,提出D-SafeMPC方法,通过控制障碍函数等引导扩散过程,结合迭代投影方案,经实验验证该方法能提升安全性、任务成功率和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10017 2026-07-14 cs.MS cs.GR 新提交 50%

AcadGIS: A Single-Import Python Package for Reproducible, Publication-Ready Academic Maps

AcadGIS:一个用于生成可重现、适合发表的学术地图的单导入Python包

Ripon Chandra Malo, Shatabdi Roy, Tong Qiu

专题命中 软件智能体 :workflow(abstract)

AI总结 研究针对学术地图制作流程零散的问题,提出AcadGIS这个免费开源Python包,它能在一个命名空间下从高级命令创建面向发表的研究地图,通过三个用例展示其可将常见地图表示为紧凑脚本,解决了可访问性和可重复性问题。

Comments 19 pages, 8 figures, 2 tables, and 6 code listings. AcadGIS v0.2.0: https://github.com/riponcm/AcadGIS/releases/tag/v0.2.0

详情

展开后加载摘要…

URL PDF HTML 收藏