arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 428 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 56 篇

2606.22025 2026-06-23 physics.soc-ph cond-mat.dis-nn 新提交 50%

Distance from home matters: Investigation of a basic movement strategy

离家距离的重要性:基本移动策略的研究

Mohsen Ghasemi Nezhadhaghighi, Yahya Khalili, Behafarid Hemmatpour, Abolfazl Ramezanpour

专题命中 工作流自动化 :agent(abstract)

AI总结 提出一种基于行程起点与终点距离比的移动模型,单智能体即可再现人类移动的幂律距离分布等关键统计特征。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23214 2026-06-23 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Universal Interatomic Potentials as Configuration-Space Generators for One-Shot and Iterative Fine-Tuning of Ab Initio-Accurate Material-Specific Models

通用原子间势作为从头算精度材料特定模型的一次性和迭代微调的构型空间生成器

Jonas Hänseroth, Aaron Flötotto, Christian Dreßler

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出将通用机器学习原子间势作为构型空间生成器,通过DFT重标定子采样构型,以少量从头算数据微调或训练材料特定模型,实现高效高精度原子模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23128 2026-06-23 cond-mat.mtrl-sci 新提交 50%

Reduced-Order Modelling of Defect Transport using Surrogate Kinetics: Application to U$_x$Pu$_ {1-x}$N

使用替代动力学进行缺陷输运的降阶建模:应用于U$_x$Pu$_{1-x}$N

Peter Hatton

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对化学无序材料中缺陷输运难以建模的问题,提出基于环境依赖替代动力学的降阶方法,通过Hop-Decorate工作流生成大量迁移能数据并蒸馏为紧凑替代函数,实现晶格动力学蒙特卡洛模拟中迁移率的快速评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26551 2026-06-23 cond-mat.mtrl-sci 版本更新 50%

AIM2DAT: A Python-based Automated Ab Initio Material Modeling and Data Analysis Toolkit

aim2dat:用于自动从头计算材料建模和数据分析的Python基础设施

Holger-Dietrich Saßnick, Joshua Edzards, Timo Reents, Caterina Cocchi

专题命中 工作流自动化 :workflow(abstract)

AI总结 aim2dat提供用户友好的界面,用于生成和处理大数据,基于密度泛函理论设计高通量工作流,并分析输出。其关键功能包括在线数据库接口、高通量筛选程序和机器学习模型的无缝集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12970 2026-06-23 eess.IV cs.CV 50%

Probabilistic Feature Imputation and Uncertainty-Aware Multimodal Federated Aggregation

概率特征填补与不确定性感知的多模态联邦聚合

Nafis Fuad Shahid, Maroof Ahmed, Md Akib Haider, Saidur Rahman Sagor, Aashnan Rahman, Md Azam Hossain

机构 * Department of Computer Science and Engineering, Islamic University and Technology (IUT), Gazipur, Bangladesh(伊斯兰大学与技术(IUT)信息工程系,加兹ipur,孟加拉国)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出概率特征填补网络(P-FIN),通过在本地和全局层面利用不确定性估计改进多模态联邦学习中的特征填补,实验表明在胸部X光分类任务中优于确定性基线方法。

Comments Accepted for publication at the Medical Imaging with Deep Learning (MIDL) 2026 conference

Journal ref Proceedings of The 9th International Conference on Medical Imaging with Deep Learning, PMLR 315 (2026) 3593-3607

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08493 2026-06-23 quant-ph 版本更新 50%

Reinforcement Learning Control of Quantum Error Correction

量子纠错的强化学习控制

Volodymyr Sivak, Alexis Morvan, Michael Broughton, Rodrigo G. Cortiñas, Johannes Bausch, Andrew W. Senior, Matthew Neeley, Alec Eickbusch, Noah Shutty, Laleh Aghababaie Beni, James S. Spencer, Francisco J. H Heras, Thomas Edlich, Dmitry Abanin, Amira Abbas, Rajeev Acharya, Georg Aigeldinger, Ross Alcaraz, Sayra Alcaraz, Trond I. Andersen, Markus Ansmann, Frank Arute, Kunal Arya, Walt Askew, Nikita Astrakhantsev, Juan Atalaya, Brian Ballard, Joseph C. Bardin, Hector Bates, Andreas Bengtsson, Majid Bigdeli Karimi, Alexander Bilmes, Simon Bilodeau, Felix Borjans, Alexandre Bourassa, Jenna Bovaird, Dylan Bowers, Leon Brill, Peter Brooks, David A. Browne, Brett Buchea, Bob B. Buckley, Tim Burger, Brian Burkett, Nicholas Bushnell, Jamal Busnaina, Anthony Cabrera, Juan Campero, Hung-Shen Chang, Silas Chen, Ben Chiaro, Liang-Ying Chih, Agnetta Y. Cleland, Bryan Cochrane, Matt Cockrell, Josh Cogan, Roberto Collins, Paul Conner, Harold Cook, William Courtney, Alexander L. Crook, Ben Curtin, Martin Damyanov, Sayan Das, Dripto M. Debroy, Sean Demura, Paul Donohoe, Ilya Drozdov, Andrew Dunsworth, Valerie Ehimhen, Aviv Moshe Elbag, Lior Ella, Mahmoud Elzouka, David Enriquez, Catherine Erickson, Vinicius S. Ferreira, Marcos Flores, Leslie Flores Burgos, Ebrahim Forati, Jeremiah Ford, Austin G. Fowler, Brooks Foxen, Masaya Fukami, Alan Wing Lun Fung, Lenny Fuste, Suhas Ganjam, Gonzalo Garcia, Christopher Garrick, Robert Gasca, Helge Gehring, Robert Geiger, Élie Genois, William Giang, Dar Gilboa, James E. Goeders, Edward C. Gonzales, Raja Gosula, Stijn J. de Graaf, Alejandro Grajales Dau, Dietrich Graumann, Joel Grebel, Alex Greene, Jonathan A. Gross, Jose Guerrero, Loïck Le Guevel, Tan Ha, Steve Habegger, Tanner Hadick, Ali Hadjikhani, Michael C. Hamilton, Matthew P. Harrigan, Sean D. Harrington, Jeanne Hartshorn, Stephen Heslin, Paula Heu, Oscar Higgott, Reno Hiltermann, Hsin-Yuan Huang, Mike Hucka, Christopher Hudspeth, Ashley Huff, William J. Huggins, Evan Jeffrey, Shaun Jevons, Zhang Jiang, Xiaoxuan Jin, Chaitali Joshi, Pavol Juhas, Andreas Kabel, Dvir Kafri, Hui Kang, Kiseo Kang, Amir H. Karamlou, Ryan Kaufman, Kostyantyn Kechedzhi, Tanuj Khattar, Mostafa Khezri, Seon Kim, Can M. Knaut, Bryce Kobrin, Fedor Kostritsa, John Mark Kreikebaum, Ryuho Kudo, Ben Kueffler, Arun Kumar, Vladislav D. Kurilovich, Vitali Kutsko, Nathan Lacroix, David Landhuis, Tiano Lange-Dei, Brandon W. Langley, Pavel Laptev, Kim-Ming Lau, Justin Ledford, Joy Lee, Kenny Lee, Brian J. Lester, Wendy Leung, Lily Li, Wing Yan Li, Ming Li, Alexander T. Lill, William P. Livingston, Matthew T. Lloyd, Aditya Locharla, Laura De Lorenzo, Daniel Lundahl, Aaron Lunt, Sid Madhuk, Aniket Maiti, Ashley Maloney, Salvatore Mandrà, Leigh S. Martin, Orion Martin, Eric Mascot, Paul Masih Das, Dmitri Maslov, Melvin Mathews, Cameron Maxfield, Jarrod R. McClean, Matt McEwen, Seneca Meeks, Kevin C. Miao, Zlatko K. Minev, Reza Molavi, Sebastian Molina, Shirin Montazeri, Charles Neill, Michael Newman, Anthony Nguyen, Murray Nguyen, Chia-Hung Ni, Murphy Yuezhen Niu, Logan Oas, Raymond Orosco, Kristoffer Ottosson, Alice Pagano, Agustin Di Paolo, Sherman Peek, David Peterson, Alex Pizzuto, Elias Portoles, Rebecca Potter, Orion Pritchard, Michael Qian, Chris Quintana, Arpit Ranadive, Matthew J. Reagor, Rachel Resnick, David M. Rhodes, Daniel Riley, Gabrielle Roberts, Roberto Rodriguez, Emma Ropes, Lucia B. De Rose, Eliott Rosenberg, Emma Rosenfeld, Dario Rosenstock, Elizabeth Rossi, Pedram Roushan, David A. Rower, Robert Salazar, Kannan Sankaragomathi, Murat Can Sarihan, Kevin J. Satzinger, Max Schaefer, Sebastian Schroeder, Henry F. Schurkus, Aria Shahingohar, Michael J. Shearn, Aaron Shorter, Vladimir Shvarts, Spencer Small, W. Clarke Smith, David A. Sobel, Barrett Spells, Sofia Springer, George Sterling, Jordan Suchard, Aaron Szasz, Alexander Sztein, Madeline Taylor, Jothi Priyanka Thiruraman, Douglas Thor, Dogan Timucin, Eifu Tomita, Alfredo Torres, M. Mert Torunbalci, Hao Tran, Abeer Vaishnav, Justin Vargas, Sergey Vdovichev, Guifre Vidal, Catherine Vollgraff Heidweiller, Meghan Voorhees, Steven Waltman, Jonathan Waltz, Shannon X. Wang, Brayden Ware, James D. Watson, Yonghua Wei, Travis Weidel, Theodore White, Kristi Wong, Bryan W. K. Woo, Christopher J. Wood, Maddy Woodson, Cheng Xing, Z. Jamie Yao, Ping Yeh, Bicheng Ying, Juhwan Yoo, Noureldin Yosri, Elliot Young, Grayson Young, Adam Zalcman, Ran Zhang, Yaxing Zhang, Ningfeng Zhu, Nicholas Zobrist, Zhenjie Zou, Ryan Babbush, Dave Bacon, Sergio Boixo, Yu Chen, Zijun Chen, Michel Devoret, Monica Hansen, Jeremy Hilton, Cody Jones, Julian Kelly, Alexander N. Korotkov, Erik Lucero, Anthony Megrant, Hartmut Neven, William D. Oliver, Ganesh Ramachandran, Vadim Smelyanskiy, Paul V. Klimov

专题命中 工作流自动化 :agent(abstract)

AI总结 通过强化学习统一量子纠错与校准,在Willow超导处理器上实现表面码逻辑稳定性提升3.5倍,并创下表面码和颜色码的逻辑错误率记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17816 2026-06-23 physics.optics 版本更新 50%

High-Repetition-Rate Projection Multiphoton Lithography for Large-Area Sub-Micron 3D Printing

高重复率投影多光子光刻用于大面积亚微米3D打印

Savvas Papamakarios, Maria Manousidaki, Michalis Stavrou, David Gray, Maria Farsari

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出基于时空光束整形的全息3D打印平台,通过飞秒激光源和DMD投影实现每秒超百万体素、分辨率低于400nm的亚微米3D制造,并验证了大面积木堆晶格和微柱阵列的可靠加工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00791 2026-06-23 physics.geo-ph 版本更新 50%

A computer vision-based approach to clean seismic catalogues

基于计算机视觉的清洁地震目录方法

Michele De Solda, Camilla Rossi, Sonja Gaviano, Giacomo Rapagnani, Emanuele Bozzi, Bogdan Enescu, Laura Gulia, Francesco Grigoli

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出一种结合波形定位与深度学习图像分类的计算机视觉流程,通过相干矩阵的二值图像分类区分真实地震事件与噪声,提升地震目录的清洁度和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06088 2026-06-23 cs.RO cs.CG 50%

Non-planar 3D Printing of Double Shells

非平面三维打印双壳结构

Ioanna Mitropoulou, Amir Vaxman, Olga Diamanti, Benjamin Dillenburger

机构 * Digital Building Technologies, ETH Zurich(数字建筑技术,苏黎世联邦理工学院) Institute of Perception, Action and Behaviour, The University of Edinburgh(感知、行为与动作研究所,爱丁堡大学) Institute for Geometry of the Department of Mathematics, TU Graz(数学系几何研究所,格拉茨技术大学)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出利用多轴融合沉积建模(FDM)机器人3D打印技术,沿横向方向打印双壳结构。通过转换横向条带网络表示,实现双壳结构的分体打印与组装,展示了方法在不同尺度和几何复杂度表面的适应性与鲁棒性。

Journal ref In: Robotic Fabrication in Architecture, Art and Design (RobArch 2024), Springer, 2025, pp. 174-191

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 29 篇

2606.15874 2026-06-23 cs.AI cs.SE 新提交 93%

LLM-as-Code: Agentic Programming for Agent Harness

LLM即代码:面向Agent框架的编程范式

Junjia Qi, Zichuan Fu, Jingtong Gao, Wenlin Zhang, Hanyu Yan, Xian Wu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 软件智能体 :agentic(title,summary_cn);agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22110 2026-06-23 cs.SE cs.AI cs.HC 新提交 88%

TraceView: Interactive Visualization of Agentic Program Repair Trajectories

TraceView: 智能体程序修复轨迹的交互式可视化

Amirali Sajadi, Tu Nguyen, Kimmie Huynh, Esteban Parra, Preetha Chatterjee

机构 * Belmont University(贝尔蒙特大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22711 2026-06-23 cs.SE cs.AI 新提交 87%

Beyond Simpson's Paradox: A Cascade of Confounders in AI Agent Pull-Request Co-Authorship

超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素

Haoran Yu, Xiaochong Jiang, Lifei Liu, Su Wang, Pin Qian, Yihang Chen

机构 * Independent Researcher(独立研究者) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.SE;agentic(comments)

AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。

Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22721 2026-06-23 cs.SE 新提交 87%

Habituation at the Gate: Rising Approval and Declining Scrutiny in Human Review of AI Agent Code

门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降

Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE;agentic(comments)

AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。

Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22417 2026-06-23 cs.AI 新提交 85%

Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent

代码不是内存:编码代理中的结构化代码库索引

Ishaan Bhola, Adithyan Krishnan, Sravanth Kurmala, Mukunda NS

机构 * TransformerOptimus

专题命中 软件智能体 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.AI

AI总结 通过消融实验和跨框架对比,研究在固定编码代理框架中增加结构化代码库索引对成本与解决率的影响,发现索引能显著提升定位和解决率且不增加成本。

Comments Code and data: https://github.com/TransformerOptimus/supercoder-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22647 2026-06-23 cs.CR cs.LG cs.SE 新提交 84%

RAVEN: Agentic RAG for Automated Vulnerability Repair

RAVEN:用于自动化漏洞修复的智能体检索增强生成框架

Varun Gadey, Zijie Liu, Alexandra Dmitrienko

机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG、cs.SE

AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。

Comments 17 Pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22484 2026-06-23 cs.HC 新提交 82%

Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains

受治理的AI辅助工程:受监管领域中代理代码生成的渐进式人工监督

Richard Kang

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract)

AI总结 针对受监管行业中代理AI编码系统的治理挑战,提出GAIE框架,通过三级渐进式人工监督模型(人机协同、人机监控、自动监控)平衡编码速度与合规性,在保留91%编码速度的同时确保监管证据覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21804 2026-06-23 cs.SE cs.AI cs.CL 新提交 82%

Is Agent Code Less Maintainable Than Human Code?

智能体代码比人类代码更不易维护吗?

Shaswat Patel, Betty Li Hou, Arun Purohit, Kai Xu, Jane Pan, He He, Valerie Chen

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 82%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 81%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 81%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 79%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15549 2026-06-23 cs.CR cs.AI 新提交 79%

One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents

CmdNeedle: 衡量AI智能体命令黑名单的不完备性

Chuyang Chen, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 79%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 73%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新 70%

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21811 2026-06-23 cs.SE cs.AI cs.LG 新提交 67%

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

引导而非求解:为大型代码智能体训练小型评论模型

Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21297 2026-06-23 cs.LG cs.AI 新提交 62%

NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

NASDAQ:归一化观测空间动力学增强Q学习

Xinwei Liu, Junyuan Liang, Zicong Hong, Jianting Zhang, Wuhui Chen

机构 * Sun Yat-sen University(中山大学) EPFL(瑞士联邦理工学院洛桑分校) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对观测预测强化学习中低维观测维度不平衡导致性能下降的问题,提出归一化方法平衡损失和梯度,并构建NASDAQ框架,结合价值学习与两个辅助任务,在多个领域取得领先性能且训练时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20882 2026-06-23 cs.SE cs.AI 新提交 62%

The Substrate Collapse: AI Code Generation Invalidates Authorship-Based Knowledge Metrics

基底崩塌:AI代码生成使基于作者身份的知识度量失效

Brett Wheeler

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文论证AI代码生成从根本上切断了代码作者身份与理解之间的推理链,导致基于作者身份的知识度量(如卡车因子)不再有效,并提出以理解证据为基础的新度量方向。

Comments 10 pages, no figures. Position paper; states a falsifiable prediction and deliberately leaves construction of the comprehension-grounded instrument open

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 62%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25764 2026-06-23 cs.SE cs.AI 版本更新 62%

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏