arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3224 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3224 篇

2602.15945 2026-02-19 cs.CR cs.AI 57%

From Tool Orchestration to Code Execution: A Study of MCP Design Choices

从工具编排到代码执行:MCP设计选择的研究

Yuval Felendler, Parth A. Gandhi, Idan Habler, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了MCP设计选择对可扩展性和安全性的平衡,提出通过代码执行能力提升智能体流程的效率,并通过安全框架应对扩展带来的攻击风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21205 2026-02-17 cs.CR cs.AI 57%

SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories

SecRepoBench:用于现实世界仓库中安全代码补全的代码代理基准测试

Chihao Shen, Connor Dilgren, Purva Chiniya, Luke Griffith, Yu Ding, Yizheng Chen

机构 * University of Maryland(马里兰大学) Google Deepmind(谷歌DeepMind)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SecRepoBench通过评估代码代理在现实世界仓库中进行安全代码补全的能力,揭示了代码代理在生成正确且安全代码方面的优势及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10758 2026-02-12 cs.SE 57%

Hidden Licensing Risks in the LLMware Ecosystem

LLM生态系统中的隐藏许可风险

Bo Wang, Yueyang Chen, Jieke Shi, Minghui Li, Yunbo Lyu, Yinan Wu, Youfang Lin, Zhou Yang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10487 2026-02-12 cs.CR cs.SE 57%

Following Dragons: Code Review-Guided Fuzzing

跟随龙:基于代码审查的模糊测试

Viet Hoang Luu, Amirmohammad Pasdar, Wachiraphan Charoenwet, Toby Murray, Shaanan Cohney, Van-Thuan Pham

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 EyeQ通过利用代码审查中的开发者智能,指导模糊测试以发现更多安全关键的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05892 2026-02-12 cs.LG 57%

ContextBench: A Benchmark for Context Retrieval in Coding Agents

ContextBench: 一种用于编码代理代码上下文检索的基准测试

Han Li, Letian Zhu, Bohan Zhang, Rili Feng, Jiaming Wang, Yue Pan, Earl T. Barr, Federica Sarro, Zhaoyang Chu, He Ye

机构 * Nanjing University(南京大学) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。

Comments 36 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09612 2026-02-12 cs.SE 57%

Analyzing GitHub Issues and Pull Requests in nf-core Pipelines: Insights into nf-core Pipeline Repositories

分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察

Khairul Alam, Banani Roy

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09944 2026-02-11 cs.SE 57%

Environment-in-the-Loop: Rethinking Code Migration with LLM-based Agents

环境在环:重新思考基于LLM代理的代码迁移

Xiang Li, Zhiwei Fei, Ying Ma, Jerry Zhang, Sarro Federica, He Ye

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出了一种整合自动环境设置与代码迁移流程的框架,强调自动环境交互对代码迁移自动化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08146 2026-02-11 cs.SE 57%

Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation

测试与突变:对抗性LLM代理用于鲁棒性单元测试生成

Pengyu Chang, Yixiong Fang, Silin Chen, Yuling Shi, Beijun Shen, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 AdverTest通过对抗性代理提升单元测试生成的鲁棒性,提高故障检测率和覆盖率

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23261 2026-02-10 cs.SE 57%

The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution

AI编程助手的马太效应:软件演化的隐藏偏见

Fei Gu, Zi Liang, Jiahao MA, Hongzong LI

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文研究了AI编程助手对软件生态系统的影响,发现主流语言和框架因数据丰富而获得更优支持,揭示了软件演化的隐藏偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15476 2026-02-10 cs.CV cs.AI 57%

LGMSNet: Thinning a medical image segmentation model via dual-level multiscale fusion

LGMSNet: 通过双级多尺度融合来简化医学图像分割模型

Chengqi Dong, Fenghe Tang, Rongge Mao, Xinpei Gao, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advance Research, USTC, Suzhou, 215123, China Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, 100190, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, 215123, China State Key Laboratory of Precision \& Intelligent Chemistry, USTC, Hefei, China

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 LGMSNet通过双级多尺度融合技术,实现轻量级医学图像分割模型的高效性能与高泛化能力。

Comments Accepted by ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications, 413, 739-746 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02735 2026-02-09 cs.CR cs.AI 57%

Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks

Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础

Sizhe Chen, Arman Zharmagambetov, David Wagner, Chuan Guo

机构 * FAIR at Meta(Meta 的 FAIR 部门) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05465 2026-02-06 cs.SE 57%

Can We Classify Flaky Tests Using Only Test Code? An LLM-Based Empirical Study

仅通过测试代码可以对不稳定测试进行分类吗?基于LLM的经验研究

Alexander Berndt, Vekil Bekmyradov, Rainer Gemulla, Marcus Kessel, Thomas Bach, Sebastian Baltes

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究探讨了仅通过测试代码是否能有效分类不稳定测试,发现LLM在无额外上下文时表现有限,需进一步结合检索增强生成等方法提升泛化能力。

Comments 10 pages, 3 figures, 7 tables, 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering: Reproducibility Studies and Negative Results (SANER-RENE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05134 2026-02-06 cs.LG cs.DB 57%

SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines

SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线

Olga Ovcharenko, Matthias Boehm, Sebastian Schelter

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 57%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 软件智能体 :tool use(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03712 2026-02-04 cs.SE 57%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03403 2026-02-04 cs.AI 57%

Feasible strategies for conflict resolution within intuitionistic fuzzy preference-based conflict situations

在基于直觉模糊偏好的冲突情境中可行的解决策略

Guangming Lang, Mingchuan Shang, Mengjun Hu, Jie Zhou, Feng Xu

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(长沙理工大学数学与统计学学院) Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering, Changsha University of Science and Technology(湖南省工程数学建模与分析重点实验室,长沙理工大学) Department of Computer Science, University of Manitoba(曼尼托湾大学计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于直觉模糊偏好的冲突情境模型,通过更精细的粒度捕捉冲突本质,并开发了相应的冲突度量和调整机制,以提高冲突解决的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16336 2026-02-03 cs.RO cs.AI cs.MA 57%

DMAVA: Distributed Multi-Autonomous Vehicle Architecture Using Autoware

DMAVA:基于Autoware的分布式多自主车辆架构

Zubair Islam, Mohamed El-Darieby

机构 * Faculty of Engineering(工程学院) Applied Science(应用科学) Ontario Tech University(安大略技术大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 DMAVA是一种基于Autoware的分布式多自主车辆架构,通过集成ROS 2、Autoware Universe等工具,实现多车辆在分布式环境下的协同控制与一致行为。

Comments 7 pages, 3 figures, 5 tables, Submitted to IEEE IV 2026, Demo videos and source code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 57%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22414 2026-02-03 cs.SE 57%

AutoCodeSherpa: Symbolic Explanations in AI Coding Agents

AutoCodeSherpa: AI 编程代理中的符号解释

Sungmin Kang, Haifeng Ruan, Abhik Roychoudhury

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 AutoCodeSherpa通过符号公式提供软件问题解释,提升自动化修复和程序分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00409 2026-02-03 cs.SE 57%

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

编码代理是否生成过度的模拟测试?一项实证研究

Andre Hora, Romain Robbes

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究了编码代理生成测试中模拟的使用情况,发现代理更倾向于修改测试并添加模拟,同时指出模拟测试可能更容易自动生成但验证效果较弱。

Comments Accepted for publication at MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00117 2026-02-03 cs.CV cs.AI 57%

IC-EO: Interpretable Code-based assistant for Earth Observation

IC-EO: 可解释的基于代码的地球观测助手

Lamia Lahouel, Laurynas Lopata, Simon Gruening, Gabriele Meoni, Gaetan Petit, Sylvain Lobry

机构 * Université Paris Cité, LIPADE, F-75006 Paris, France askEarth AG, Zurich, Switzerland ESA -lab, Frascati, Italy ESA, Advanced Concepts Studies Office, Noordwijk, the Netherlands

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 IC-EO提出一个可解释的代码生成助手,通过生成可审计的Python工作流程,提升地球观测分析的透明性和可复现性,优于现有基线模型。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21102 2026-01-30 cs.SE 57%

The Quiet Contributions: Insights into AI-Generated Silent Pull Requests

静默贡献:对AI生成的静默拉取请求的洞察

S M Mahedy Hasan, Md Fazle Rabbi, Minhaz Zibran

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 研究首次分析了AI生成的静默拉取请求对代码质量和安全的影响,揭示其接受或拒绝的潜在原因。

Comments 5 pages, 4 figures, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19367 2026-01-28 cs.CR cs.LG 57%

CHEHAB RL: Learning to Optimize Fully Homomorphic Encryption Computations

CHEHAB RL: 学习优化完全同态加密计算

Bilel Sefsaf, Abderraouf Dandani, Abdessamed Seddiki, Arab Mohammed, Eduardo Chielle, Michail Maniatakos, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 CHEHAB RL通过深度强化学习自动优化FHE代码,提升执行速度和减少噪声,编译过程更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-01-28 cs.SE 57%

Reward Engineering for Reinforcement Learning in Software Tasks

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12360 2026-01-28 cs.SE 57%

Discovering 100+ Compiler Defects in 72 Hours via LLM-Driven Semantic Logic Recomposition

通过LLM驱动的语义逻辑重组发现100余项编译器缺陷

Xingbang He, Yuanwei Chen, Hao Wu, Jikang Zhang, Zicheng Wang, Ligeng Chen, Junjie Peng, Haiyang Wei, Yi Qian, Tiantai Zhang, Linzhang Wang, Bing Mao

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 FeatureFuzz通过语义逻辑重组发现编译器缺陷,有效提升模糊测试的多样性与发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00753 2026-01-28 cs.SE 57%

Early-Stage Prediction of Review Effort in AI-Generated Pull Requests

AI生成拉取请求中早期阶段的审查努力预测

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Nguyen Dinh Ha Duong, Truong Bao Tran

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究提出一种基于创建时间的电路断开模型,用于预测AI生成拉取请求的高维护需求,通过静态复杂性线索识别高成本贡献,提升维护效率。

Comments 5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18285 2026-01-27 cs.CL 57%

U-Fold: Dynamic Intent-Aware Context Folding for User-Centric Agents

U-Fold:面向用户中心任务的动态意图感知上下文折叠

Jin Su, Runnan Fang, Yeqiu Li, Xiaobin Wang, Shihao Cai, Pengjun Xie, Ningyu Zhang, Fajie Yuan

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Westlake University(西湖大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16946 2026-01-27 cs.SI cs.AI 57%

MobileCity: An Efficient Framework for Large-Scale Urban Behavior Simulation

MobileCity: 一种大规模城市行为模拟的高效框架

Xiaotong Ye, Nicolas Bougie, Toshihiko Yamasaki, Narimasa Watanabe

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 MobileCity通过高效框架模拟真实城市行为,结合多种交通方式和本地模型提升效率,实现更真实的行为生成与应用拓展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 57%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12146 2026-01-26 cs.SE 57%

From LLMs to Agents in Programming: The Impact of Providing an LLM with a Compiler

从LLM到代理:提供编译器对编程的影响

Viktor Kjellberg, Miroslaw Staron, Farnaz Fotrousi

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究了提供编译器如何提升LLM在编程任务中的表现,发现编译器能显著提高编译成功率并减少错误,且小型模型在某些情况下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏