arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-08 至 2026-07-08 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 32 篇

2506.19565 2026-07-08 eess.SY cs.SY math.OC 版本更新 67%

On finite-horizon approximation of an infinite-horizon feedback Nash equilibrium in discrete-time LQ games

关于有限时间 horizon 近似反馈纳什均衡在 LQ 游戏中的问题

Shengyuan Huang, Xiaoguang Yang, Yifen Mu, Wenjun Mei

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出了一种有限时间 horizon 策略用于近似无限时间 horizon LQ 动态博弈中的反馈纳什均衡,并通过理论分析和数值例子验证了其有效性。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05863 2026-07-08 cs.LG cs.GT 新提交 57%

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

多买家市场中的战略谈判:基于可验证奖励的强化学习用于大语言模型谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Xin Chen, David Simchi-Levi

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) Mitch Daniels School of Business, Purdue University(米奇·丹尼尔斯商学院,普渡大学) The Division of Physics, Mathematics and Astronomy, California Institute of Technology(物理、数学与天文学部,加州理工学院) Department of Computing and Mathematical Sciences, California Institute of Technology(计算与数学科学系,加州理工学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. 米尔顿·斯图尔特工业与系统工程学院,佐治亚理工学院) Department of Civil and Environmental Engineering, Operations Research Center, Massachusetts Institute of Technology(土木与环境工程系、运筹学中心,麻省理工学院)

专题命中 多智能体 :agent(abstract);分类 cs.LG

AI总结 研究多买家市场中卖家与买家的谈判,提出基于可验证奖励的强化学习方法,使卖家能平衡市场探索与剩余提取,实现多阶段战略演变,提升谈判技能,提取更高剩余,且策略可推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06381 2026-07-08 nlin.CD 新提交 50%

When a common price signal is present, network topology leaves no fingerprint on a storage fleet's collective dynamics

当存在共同价格信号时,网络拓扑不会在储能集群的集体动力学上留下指纹

Stelios Savva

专题命中 多智能体 :agent(abstract)

AI总结 研究当代理对平均的共享噪声预测响应时,网络拓扑在储能集群集体动力学中的情况,发现即使仅靠邻居观测,拓扑在有效维度响应中也难检测,rho N增长时共识模式方差主导,共享随机强迫可掩盖拓扑依赖模式。

Comments 5 pages, 2 figures, code available at https://github.com/rrumabo/semele

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 17 篇

2604.02537 2026-07-08 cs.CL cond-mat.mtrl-sci 版本更新 83%

PolyJarvis: An LLM-Orchestrated Agent for Automated All-Atom Molecular Dynamics of Amorphous Homopolymers

PolyJarvis:用于自主聚合物分子动力学模拟的LLM代理

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.CL

AI总结 PolyJarvis结合大语言模型与RadonPy平台,通过MCP服务器实现从自然语言输入自主执行聚合物分子动力学模拟,预测密度、体积模量和玻璃化温度等性质,验证结果在不同聚合物中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05975 2026-07-08 cs.NI cs.AI cs.MA cs.SY eess.SY 新提交 79%

MCP-Enabled Agentic AI for Autonomous IPoDWDM Network Lifecycle Automation

用于自主IPoDWDM网络生命周期自动化的启用MCP的智能AI

Chunmin Xia, Jakub Harbaczewski, Nikhil Dsilva, Julie Raulin, Dominic Schneider, Achim Autenrieth

机构 * Adtran Networks SE(阿特兰网络公司)

专题命中 工作流自动化 :agentic(title,abstract);分类 cs.AI

AI总结 研究自主控制供应商无关的IPoDWDM网络,采用启用MCP的智能AI架构,利用GNPy和遥测技术实现自动化与闭环控制并经测试验证。

Comments Accepted for demo presentation at the European Conference on Optical Communication (ECOC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05435 2026-07-08 cs.DL cs.ET 新提交 78%

Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing

Bibby AI:一个用于学术研究、写作和出版的编辑器原生智能平台

Nilesh Jain

专题命中 工作流自动化 :agentic(title);workflow(abstract)

AI总结 Bibby AI是编辑器原生平台,整合学术研究、写作和出版工具链。通过云LaTeX编辑器实现,集成格式转换、文献检索和任务代理功能,能执行多种操作,节省时间,已投入生产服务众多研究人员。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05958 2026-07-08 cs.NI cs.AI cs.SY eess.SP eess.SY 新提交 74%

Agentic AI for IPoDWDM Network Lifecycle Automation: An MCP-Enabled Architecture

用于IPoDWDM网络生命周期自动化的智能AI:一种启用MCP的架构

Chunmin Xia, Jakub Harbaczewski, Nikhil Dsilva, Julie Raulin, Dominic Schneider, Achim Autenrieth

机构 * Adtran Networks SE(阿特兰网络公司)

专题命中 工作流自动化 :agentic(title);分类 cs.AI

AI总结 该研究针对多供应商、多层IPoDWDM网络,提出分布式多MCP架构,借助SDN实现自动化及自主控制,运用GNPy模型等进行闭环跨层控制,并通过实验验证,实现端到端服务生命周期自动化。

Comments Accepted for oral presentation at the European Conference on Optical Communication (ECOC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 70%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 工作流自动化 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06461 2026-07-08 eess.AS cs.CL cs.SD 新提交 57%

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

WordVoice:基于大语言模型的文本转语音中显式且解耦的多维词级控制

Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

机构 * South China University of Technology(南方科技大学) Huya Inc.(Huya公司) Tongji University(同济大学) The Hongkong polytechnic university(香港理工大学) Foshan University(佛山大学)

专题命中 工作流自动化 :planning(abstract);分类 cs.CL

AI总结 研究针对基于LLM的TTS系统词级控制粗糙的问题,提出统一框架。构建含五维注释的数据集,引入WordVoice将隐式生成变为显式可控范式,经实验验证其在多声学维度上实现卓越解耦控制且保持零样本合成稳定性。

Comments 10 pages, 4 figures, 6 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06026 2026-07-08 cs.LG cs.NA math.NA 新提交 57%

SplineNet: An Isogeometric Deep Learning Method for Complex Shells

样条网络:一种用于复杂壳体的等几何深度学习方法

Shizhou Luo, Xiaodong Wei

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出样条网络这一等几何深度学习方法,用于复杂壳体结构设计分析。基于封闭样条表示构建,能无数据或数据驱动应用。无数据时可结合CAE需求,数据驱动时可作主干网提供可解释性,经数值示例验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04371 2026-07-08 cs.AI 新提交 57%

Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合专家模型的语言模型

Akhiad Bercovich, Talor Abramovich, Daniel Afrimi, Shay Aharon, Nir Ailon, Vladimir Anisimov, Omer Ullman Argov, Maor Ashkenazi, Tomer Asida, Nave Assaf, Tomer Bar Natan, Alexander Bukharin, Grzegorz Chlebus, Marcin Chochowski, Eric Chung, Mohammad Dabbah, Carlo del Mundo, Ewa Dobrowolska, Ido Galil, Yaniv Galron, Amnon Geifman, Yonatan Geifman, Izik Golan, Alex Gronskiy, Tomasz Grzegorzek, Netanel Haber, Lior Kadoch, Grzegorz Karch, Tomer Keren, Abhinav Khattar, Amir Klein, Tugrul Konuk, Roi Koren, Daniel Korzekwa, Shaun Kotek, Konstantinos Krommydas, Itay Levy, Ofri Masad, Yoav Miron, Pavlo Molchanov, Shahar Mor, Zach Moshe, Saurav Muralidharan, Najeeb Nabwani, Besmira Nushi, Mostofa Patwary, Omri Puny, Johannes Rausch, Tomer Ronen, Sepehr Sameni, Itamar Schen, Elad Segal, Daniel Serebrenik, Ido Shahaf, Soumye Singhal, Daniil Sorokin, Sharath Turuvekere Sreenivas, Marta Stepniewska-Dziubinska, Ali Taghibakhshi, Nima Tajbakhsh, Oren Tropp, Dor Tzur, Anna Warno, Yi-Fu Wu, Michal Zawalski, Jiaqi Zeng, Yian Zhang, Ran Zilberstein, Amit Zuker, Ran El-Yaniv

机构 * Nemotron-Labs(奈莫tron实验室)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI

AI总结 研究为交互式部署优化设计压缩模型Nemotron-Labs-3-Puzzle-75B-A9B,用多阶段管道结合多种方法构建,在多约束下提升服务器吞吐量,压缩后仍保持较强下游能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 57%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05938 2026-07-08 cs.GR cs.RO 新提交 50%

Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion

先验优先,条件其次:可扩展且可控的手部运动补全

Mingyi Shi, Xuelin Chen, Taku Komura

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究院)

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对手部运动补全难题,提出先验优先、条件其次框架,先从无结构数据学习通用先验,再引入语义控制,通过分层适配器实现可控性,经评估其在多方面优于基线,还展示了实时推理等特性,适用于动画制作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06210 2026-07-08 physics.med-ph math.DS q-bio.OT 新提交 50%

Validation of a Computational Respiratory System Model for Mechanical Ventilation

用于机械通气的计算呼吸系统模型的验证

Carlotta Hennigs, Charlott Danielson, Franziska Bilda, Dimitrios Karachalios, Niklas Hackelberg, Helene Selpien, Georg Männel, Dirk Schädler, Folker Spitzenberger, Philipp Rostalski

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究针对机械通气中自动化控制策略临床转化慢的问题,应用符合标准的框架对计算呼吸模型进行可信度评估,通过多方面验证评估其可信度,为自动化撤机策略等提供适用模型及验证蓝图。

Comments 40 pages, 5 figures. Submitted to PLOS Computational Biology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05853 2026-07-08 cond-mat.mtrl-sci physics.chem-ph physics.comp-ph 新提交 50%

Efficient Bethe-Salpeter Equation Calculations Based on Numerical Atomic Orbitals and Norm-Conserving Pseudopotentials: Dual-${\boldsymbol k}$-Mesh Strategy

基于数值原子轨道和守恒规范赝势的高效贝叶斯-萨尔皮特方程计算:双\(\boldsymbol{k}\)-网格策略

Ziqing Guan, Yu Cao, Min-Ye Zhang, Peize Lin, Ruiyi Zhou, Xinguo Ren

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究在ABACUS+LibRPA框架下,基于数值原子轨道和守恒规范赝势实现高效贝叶斯-萨尔皮特方程计算。利用局部单位分解技术形成双\(\boldsymbol{k}\)-网格工作流程,系统研究相关收敛性,经基准计算验证方法准确性及策略可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04633 2026-07-08 physics.chem-ph physics.comp-ph 新提交 50%

Differentiable OPLS Force Field Parameterization for Ionic Electrolytes and High-Throughput Application to Lithium-ion Batteries

用于离子电解质的可微OPLS力场参数化及在锂离子电池中的高通量应用

Haichao Huang, Zilin Chen, Qi Liu, Tianqi Zhao, Yunpei Liu, Guotao Qiu, Jianhui Chen, Zhen Li, Wenshuo Liang, Minsung Cho, Manxue Zhang, Feiyu Kang, Xiaolong Zou, Yidan Cao, Xushan Zhao, Ziqi Cheng, Ye Mei

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对锂离子电池离子电解质设计难题,开发可微OPLS-AA力场参数化工作流程,用拓扑引导减少参数冗余,以实验密度为拟合目标、离子电导率为验证指标,进行高通量模拟,为离子电解质设计提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24394 2026-07-08 eess.SY cs.SY 版本更新 50%

A Realistic Discrete Event Simulation model for Ambulance Location and Deployment within a regional Emergency Medical Service

面向区域急救医疗系统的现实离散事件仿真模型

Alberto De Santis, Stefania Iannazzo, Fabio Ingravalle, Stefano Lucidi, Massimo Maurici, Giulia Riccardi, Massimo Roma, Antonio Vinci

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一个离散事件仿真模型,用于分析救护车部署策略,通过整合多源信息,提高区域急救医疗系统的响应效率和决策效果。

Comments 41 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17448 2026-07-08 astro-ph.IM astro-ph.GA 版本更新 50%

AVICA: A fully automated CASA pipeline for large volume VLBI data calibration

VASCO:一种完全自动化的CASA流水线,用于大体积VLBI数据校准

A. Kumar, C. Casadio, M. Janssen, D. Álvarez-Ortega, F. M. Pötzl

专题命中 工作流自动化 :workflow(abstract)

AI总结 VASCO利用CASA框架实现全自动校准,解决VLBA多格式数据校准问题,验证了97.8%的数据校准成功,执行时间约30分钟。

Comments 12 pages, 9 figures; Accepted for publication in Astronomy & Astrophysics. Code available at https://github.com/avikhagol/avica ; comments are welcome on the manuscript and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04703 2026-07-08 cs.HC 版本更新 50%

Bounded Autonomy: Controlling LLM Characters in Live Multiplayer Games

有界自主性:控制游戏中的LLM角色

Yunjia Guo, Jinghan Zhu, Siyu Wang, Haixin Qiao

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出有界自主性架构,通过三种接口控制游戏中的LLM角色,使其在多人互动中保持可执行性和社会一致性,并通过实验验证其有效性。

Comments 9 pages, 5 figures, 5 tables; manuscript unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 软件智能体 18 篇

2607.04697 2026-07-08 cs.SE 新提交 88%

AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates

GitHub上的AI代理拉取请求:频率、结构和合并冲突率

George Xu, Arjun Subramanian, Nithilan Karthik

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.SE

AI总结 利用AIDev-pop数据集对AI代理编写的拉取请求并发情况进行大规模实证分析,发现特定时间重叠下部分仓库有协同活动的请求对,多数为同一代理,还研究了合并冲突率及冲突类型。

Comments 7 pages, 4 figures, 2 tables. Replication package: https://doi.org/10.5281/zenodo.21186464

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06065 2026-07-08 cs.SE 新提交 83%

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

SWE-Review:通过智能代码审查解决问题闭环

Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 研究通过智能代码审查闭合PR生成环的问题,核心方法是SWE-Review框架,由审查代理进行审查并提供反馈。主要贡献是能持续改进PR,在多方面表现优于单轮审查,还能推动AI编码代理从一次性PR生成迈向闭环问题解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25438 2026-07-08 econ.GN q-fin.EC 版本更新 82%

Agentic Delegation and the Language Frontier of Software Developers: A Model and Evidence from Claude Code on GitHub

超越训练范围编码:Claude Code 与软件开发者的技术前沿

Alexander Quispe, Kevin Xu

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 利用双重稳健估计器分析 Claude Code 的逐步推出,发现 AI 编码助手显著增加了开发者的月度提交数、贡献仓库数、使用语言数及语言熵,且累积语言效应随时间增长,表明 AI 降低了技术切换障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05666 2026-07-08 cs.SE cs.AI 新提交 81%

What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests

人工智能代理实际改变了什么?性能改进拉取请求中突变模式的实证分类法

Illia Dovhoshliubnyi, Nima Soroush, Ashkan Sami, Alexander Brownlee

机构 * Edinburgh Napier University(爱丁堡纳皮尔大学) University of Stirling(斯特林大学)

专题命中 软件智能体 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究聚焦人工智能编码代理这一黑箱,通过对33596个代理拉取请求中1254个性能相关差异块进行分类,发现主导的三类突变模式,揭示代理身份和目标策略对缩小基于搜索的软件工程操作空间有参考价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 81%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07892 2026-07-08 cs.SE cs.AI 版本更新 81%

Leveraging Metamemory Agent for Enhanced Data-Free Code Generation in Large Language Models

利用元记忆智能体增强大语言模型的无数据代码生成

Shengsheng Zhou, Shuai Wang, Liang Ding, Yibing Zhan, Yong Luo, Zheng He, Fu Lin, Dapeng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 79%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05471 2026-07-08 cs.SE cs.AI 新提交 79%

KAT-Coder-V2.5 Technical Report

KAT-Coder-V2.5技术报告

Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai

机构 * KwaiKAT Team(快手KwaiKAT团队)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 75%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05677 2026-07-08 cs.SE cs.HC 新提交 74%

From Conversation to Contribution: Characterizing Coding Agent in Open-Source Software

从对话到贡献:开源软件中编码代理的特征分析

Zihan Fang, Yueke Zhang, Ningzhi Tang, Collin McMillan, Toby Jia-Jun Li, Yu Huang

专题命中 软件智能体 :agent(title);分类 cs.SE

AI总结 研究开源软件中开发者与人工智能编码代理聊天交互和后续开发协作的关系,通过收集大量会话及关联仓库历史等进行分析,发现小仓库AI使用多,采用后贡献者有变化,还揭示了开发者对AI代码的看法及相关担忧,为开源开发实践提供见解。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏