arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 62%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05548 2026-06-05 cs.SE cs.AI 62%

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

ADK Arena: 通过LLM即开发者评估智能体开发工具包

Jintao Huang, Xiaomin Li, Gaurav Mittal, Yu Hu

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出LLM-as-a-Developer方法,通过自动化流水线ADK Arena评估51个Python ADK框架,发现框架间生成成本差异达5.6倍,但无单一框架占优,且文档、源码和参数知识可相互替代。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25289 2026-06-04 cs.LG cs.AI 62%

ClustRecNet: A Novel End-to-End Deep Learning Framework for Clustering Algorithm Recommendation

ClustRecNet: 一种用于聚类算法推荐的新型端到端深度学习框架

Mohammadreza Bakhtyari, Bogdan Mazoure, Renato Cordeiro de Amorim, Guillaume Rabusseau, Vladimir Makarenkov

机构 * Département d’Informatique, Université du Québec à Montréal(魁北克大学蒙特利尔分校计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所) School of Computer Science and EE, University of Essex(埃塞克斯大学计算机科学与电子工程学院) Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系)

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出ClustRecNet,一种端到端深度学习框架,通过直接学习原始表格数据的高阶表示来推荐合适的聚类算法,在合成和真实基准上优于传统内部聚类有效性指标和AutoML方法。

Comments Published in IEEE Access

Journal ref IEEE Access, vol. 14, pp. 81352 - 81365, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI 62%

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23866 2026-06-02 cs.SE cs.CL 62%

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

SWE-rebench V2: 大规模语言无关的SWE任务集合

Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Alexander Golubev

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL

AI总结 提出语言无关的自动化流水线SWE-rebench V2,用于大规模收集可执行的软件工程任务并构建RL训练环境,产出涵盖20种语言、3617个仓库的32079个任务数据集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31464 2026-06-01 cs.LG cs.AI 62%

GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization

GPU预测器:语言模型作为内核运行时优化的选择性替代

Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) AI2 Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究利用语言模型作为GPU内核性能的选择性替代,通过强化学习提高预测准确性和校准度,在有限GPU评估预算下加速内核搜索。

Comments Code: https://github.com/codezakh/gpu-forecasters

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 62%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30003 2026-05-29 cs.MA cs.AI cs.LG 62%

Discovering Cooperative Pipelines: Autoresearch for Sequential Social Dilemmas

发现合作管线:面向序列社会困境的自动研究

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种双层自动研究框架,其中外层AI智能体自动重新设计内层LLM策略合成管线,以解决多智能体序列社会困境,实验表明该方法在多个游戏和福利目标下优于手工基线。

Comments Accepted to the AI Agents for Discovery in the Wild (AID-Wild) Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28876 2026-05-29 cs.SE cs.AI 62%

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

LogDx-CI:为LLM根因诊断基准测试日志缩减工具

Bowen Qin

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出LogDx-CI基准,比较11种日志缩减工具在35个真实CI故障案例上的效果,发现混合grep+tail路由器在成本质量上占优,且智能体循环可缩小质量差距但成本差异持续存在,同时跨家族LLM摘要器优于同家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24183 2026-05-26 cs.DB cs.AI cs.LG 62%

AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

AvalancheBench: 通过潜在世界恢复评估企业数据智能体

Darek Kleczek, Fuheng Zhao, Alexander W. Lee, Julien Tissier, Pawel Liskowski, Ugur Cetintemel, Anupam Datta

机构 * Brown University and Snowflake(布朗大学和Snowflake)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出AvalancheBench基准,通过潜在世界恢复评估企业数据智能体的分析理解能力,揭示早期错误如何传播并导致系统性错误推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24096 2026-05-26 cs.DB cs.AI cs.DC cs.SE 62%

The Time is Here for Just-in-Time Systems: Challenges and Opportunities

即时系统的时代已到来:挑战与机遇

Shu Liu, Alexander Krentsel, Shubham Agarwal, Mert Cemri, Ziming Mao, Soujanya Ponnapalli, Alexandros G. Dimakis, Sylvia Ratnasamy, Matei Zaharia, Aditya Parameswaran, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出基于LLM的即时系统合成方法Jitskit,通过从零开始合成专用键值存储系统,在18个规格上性能超越现有系统最高达4.6倍。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL 62%

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.PL

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI 62%

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 软件智能体 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11060 2026-05-21 cs.SE cs.AI 62%

Code Researcher: Deep Research Agent for Large Systems Code and Commit History

Code Researcher: 用于大型系统代码和提交历史的深度研究代理

Ramneet Singh, Sathvik Joel, Abhav Mehrotra, Nalin Wadhwa, Ramakrishna B Bairi, Aditya Kanade, Nagarajan Natarajan

机构 * Microsoft Research(微软研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Code Researcher,一种用于大型系统代码和提交历史的深度研究代理,通过多步骤推理和全局上下文收集,有效解决系统代码崩溃修复问题,显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI 62%

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 62%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09283 2026-05-12 cs.AI cs.CL 62%

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

面向可靠重用的AI生成内容结构化框架

Shusaku Egami, Masahiro Hamasaki

机构 * National Institute of Advanced Industrial Sciencen

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结构化框架,通过在生成时自动附加元数据,提升AI生成内容的可追溯性和可靠性,以支持其安全重用。

Comments 5 pages, 2 figures, Accepted at FAAW@WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07127 2026-05-11 cs.LG cs.CL 62%

The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

位置诅咒:LLM在列表中定位最后几个项目时表现不佳

Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson, Mikio Aoi, Marcelo G. Mattar, Li Ji-An

机构 * UC San Diego(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) New York University(纽约大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 LLM在定位长列表中单个相关项目时表现优异,但在短列表中最后几个项目定位上存在缺陷,即位置诅咒。通过构建PosBench数据集进行微调后,虽然提升了定位能力,但仍未达到理想水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06737 2026-05-11 cs.SE cs.AI 62%

A Self-Healing Framework for Reliable LLM-Based Autonomous Agents

基于大语言模型的自主代理的自修复框架

Cheonsu Jeong, Younggun Shin

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心) Dept. of Artificial Intelligence, Graduate School of Engineering, Yonsei University(延世大学工程研究生院人工智能系)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种可靠性感知的自修复框架,通过故障检测、可靠性评估和自动恢复机制提升基于大语言模型的自主代理的可靠性,实验表明该方法显著提高了任务成功率并增强了系统鲁棒性。

Comments 13 pages, 3 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06717 2026-05-11 cs.SE cs.AI 62%

Agentic Coding Needs Proactivity, Not Just Autonomy

代理编码需要主动性,而非仅仅自主性

Nghi D. Q. Bui, Georgios Evangelopoulos

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05400 2026-05-08 cs.SE cs.AI cs.HC 62%

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

代理编程的准备:作为情境工程方法论的刻意准备

Andrew Zigler

机构 * LinearB

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种三阶段的代理编程准备方法,通过情境 grounding、协作规范和任务分解,提升 AI 编程的效率与质量,通过 hackathon 实验验证了准备阶段的重要性。

Comments 5 pages. Accepted at VibeX 2026, the 1st International Workshop on Vibe Coding and Vibe Researching, co-located with EASE 2026, Glasgow, June 9-12 2026. Camera-ready version. Research artifact: https://doi.org/10.5281/zenodo.19868258

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16323 2026-05-05 cs.SE cs.AI 62%

Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development

超越'差异':应对代理软件开发中的代理熵

Matteo Casserini, Alessandro Facchini, Andrea Ferrario

机构 * Dipartimento Tecnologie Innovative, SUPSI(技术创新部,SUPSI) Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理(MINDS)系,科津斯基大学) Institute of Biomedical Ethics and History of Medicine, University of Zurich(生物医学伦理与医学史研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种过程导向的可解释框架,通过时间、工具调用和架构边界揭示代理决策过程,解决代理行为与架构意图的偏离问题,为代理监控提供意图层面的 telemetry。

Comments Camera-ready version of the position paper accepted to the Human-Centered Explainable AI (HCXAI) Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 62%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL 62%

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00933 2026-04-28 cs.LG cs.AI 62%

OKG-LLM: Aligning Ocean Knowledge Graph with Observation Data via LLMs for Global Sea Surface Temperature Prediction

OKG-LLM:通过LLMs对齐海洋知识图谱与观测数据以实现全球海表温度预测

Hanchen Yang, Jiaqi Wang, Jiannong Cao, Wengen Li, Jialun Zheng, Yangning Li, Chunyu Miao, Jihong Guan, Shuigeng Zhou, Philip S. Yu

机构 * Department of Computer Science and Technology, Tongji University(同济大学计算机科学与技术系) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系) Department of Computing, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算系) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OKG-LLM框架,通过构建海洋知识图谱并融合数值数据,利用预训练LLM提升全球海表温度预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20938 2026-04-24 cs.LG cs.AI 62%

HARBOR: Automated Harness Optimization

HARBOR:自动化Harness优化

Biswa Sengupta, Jinhua Wang

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HARBOR框架,通过约束噪声贝叶斯优化解决Harness配置问题,强调自动化配置优于手动堆叠,并在生产编码代理中实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 62%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL 62%

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.PL

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13120 2026-04-16 cs.SE cs.AI 62%

AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering

AgentForge: 基于执行的多智能体LLM框架用于自主软件工程

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman

机构 * International Research Center for Complexity Sciences(复杂科学国际研究中心) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北京航空航天大学) College of Science, Mathematics and Technology(科学、数学与技术学院) Wenzhou-Kean University(温州-凯恩大学) Fakulti Teknologi Maklumat dan Komunikasi(信息技术与通信学院) Universiti Teknikal Malaysia Melaka(马来西亚Melaka理工大学) Computer Systems Engineering Department(计算机系统工程系) Sukkur IBA University(苏库尔IBA大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 AgentForge通过引入执行验证原则,提升代码正确性验证,实现40.0%的SWE-BENCH Lite解决率,优于单智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏