arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 31 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 31 篇

2607.05120 2026-07-07 cs.CR cs.AI 新提交 88%

Agent Data Injection Attacks are Realistic Threats to AI Agents

智能体数据注入攻击对人工智能智能体构成现实威胁

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学) Largosoft University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。

Comments 19 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03117 2026-07-07 cs.SE cs.AI 版本更新 86%

ARISE: A Repository-level Graph Representation and Toolset for Agentic Program Repair and Fault Localization

ARISE:面向智能体程序修复与故障定位的仓库级图表示及工具集

Shahd Seddik, Fahd Seddik, Amirrezza Esmaeili, Mahdieh Sadatbenis, Fatemeh Fard

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有图智能体缺乏过程内数据流建模的问题,提出多粒度程序图工具集ARISE,支持语句级数据流切片查询,大幅提升智能体故障定位与程序修复性能。

Comments v2: extended analysis, more experiments, additional authors added

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20412 2026-07-07 cs.SE cs.AI cs.OS 版本更新 86%

kAgent: An execution-guided crash resolution agent for the Linux kernel

kAgent:一种用于Linux内核的执行引导式崩溃修复代理

Alex Mathai, Chenxi Huang, Suwei Ma, Jihwan Kim, Hailie Mitchell, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Junfeng Yang, Baishakhi Ray

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Google Inc.(谷歌公司) Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。

Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04613 2026-07-07 cs.AI cs.CR 新提交 85%

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。

Comments Technical companion report. 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04558 2026-07-07 cs.CL cs.AI cs.LG 新提交 85%

EEG-SpikeAgent: Agentic Closed-Loop Program Synthesis for Automated EEG Spike Detection

EEG-SpikeAgent:用于自动脑电图尖峰检测的智能闭环程序合成

Sonali Santhosh, Kelly Shuhong Yu, Eugene Chang, Jonathan Kim, Kie Shidara, Danilo Bernardo

机构 * Dept. of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑科学与认知科学系,麻省理工学院) Dept. of Neuroscience, University of California, Berkeley(神经科学系,加州大学伯克利分校) Dept. of Neurology and Neurologic Sciences, Stanford University(神经病学与神经科学系,斯坦福大学) Weill Institute of Neurology and Neurosciences, University of California, San Francisco(Weill神经医学研究所,加州大学旧金山分校) University of California, San Francisco(加州大学旧金山分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究利用大语言模型智能系统,为头皮脑电图尖峰检测生成信号处理特征。核心方法是迭代提出特征模块并执行代码生成表格特征,评估性能后反馈优化。贡献是实现可审核的脑电图特征工程自动化。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03451 2026-07-07 cs.SE cs.AI cs.LG 新提交 85%

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化

Yifei Shen, Bo Li, Xinjie Zhang

机构 * LMMs-Lab(LMMs实验室) NTU MMLab(国立台湾大学MMLab) Microsoft(微软公司)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03780 2026-07-07 cs.SE cs.AI 新提交 84%

SkillFab: An Agent-Native Skill Production Platform

SkillFab:一个原生代理技能生产平台

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang

机构 * Peking University(北京大学) Huawei(华为) Northwestern Polytechnical University(西北工业大学) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。

Comments 12 pages, 7 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01087 2026-07-07 cs.SE cs.AI 新提交 84%

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering

廉价代码,昂贵判断:可控代理软件工程案例研究

James C. Davis, Paschal C. Amusuo, Tanmay Singla, Berk Çakar, Kirsten A. Davis

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 通过12周案例研究,提出治理转换理论模型,解释专家工程师如何利用AI编码代理实现高速开发并保持可控性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03766 2026-07-07 cs.SE 新提交 83%

Semantic-aware and Self-improving Program Reduction via Agentic Large Language Models

通过智能大语言模型实现语义感知和自我改进的程序简化

Xintong Zhou, Hongxu Xu, Chunhao Liao, Puzhuo Liu, Yongqiang Tian, Chengnian Sun

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 研究将程序简化作为由智能大语言模型驱动的自主推理任务,方法是让模型分析语义、提出假设并迭代改进,还能提炼经验,PROJ框架实现该方法,实验表明其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03105 2026-07-07 quant-ph 新提交 82%

ORBIT-Q: Dual-axis benchmarking of autonomous agents in scientific quantum programming

ORBIT-Q:科学量子编程中自主代理的双轴基准测试

Shi-Xin Zhang, Yu-Qin Chen

专题命中 软件智能体 :autonomous agent(title,abstract);agent(abstract)

AI总结 为解决自主编码代理在科学计算中缺乏严格验证范式问题,引入ORBIT-Q。其核心是精心策划的量子工作流程套件,结合严格验证管道进行双轴比较,评估结果为相关研究提供基准。

Comments 7.5 pages, 4 figures with references and supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15657 2026-07-07 cs.AR 82%

Understanding Inference-Time Token Allocation and Coverage Limits in Agentic Hardware Verification

理解代理硬件验证中推理时间标记分配与覆盖限制

Vihaan Patel, Vidya Chhabria, Aman Arora

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文研究了代理硬件验证中推理时间标记分配与覆盖限制,通过两个层级的代理框架,分析覆盖孔径并改进效率,展示领域专业化如何提升覆盖效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02370 2026-07-07 cs.SE cs.AI 新提交 81%

Understanding Agent-Based Patching of Compiler Missed Optimizations

理解基于智能体的编译器遗漏优化补丁

Batu Guan, Zirui Wang, Shaohua Li

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能体如何为编译器遗漏优化打补丁,发现关键挑战在于泛化而非仅修复报告案例,提出历史知识增强技术以提升泛化能力。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02846 2026-07-07 cs.AI 新提交 79%

Object-Centric Environment Modeling for Agentic Tasks

用于智能任务的以对象为中心的环境建模

Yiyang Li, Tianyi Ma, Zehong Wang, Yijun Ma, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02510 2026-07-07 cs.LG cs.DC cs.NE cs.PF 版本更新 79%

ParEVO: Synthesizing Code for Irregular Data: High-Performance Parallelism through Agentic Evolution

ParEVO:为不规则数据合成代码:通过智能进化实现高性能并行

Liu Yang, Zeyu Nie, Andrew Liu, Felix Zou, Deniz Altinbüken, Amir Yazdanbakhsh, Quanquan C. Liu

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.LG

AI总结 针对不规则数据并行计算难题,ParEVO框架通过构建数据集、微调模型及进化编码代理,合成高性能并行算法,在基准测试中加速显著,优于商业模型及专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02911 2026-07-07 cs.SE cs.AI 新提交 73%

CoACT: Action-Preserving Observation Compression for Coding Agents

CoACT:用于编码智能体的动作保持观测压缩

Haorui Chen, Yuancheng Zhu, Yitong Zhang, Jia Li

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究编码智能体观测压缩问题,提出基于动作保持的CoACT方法,通过检查智能体下一个动作来筛选压缩候选,训练时用两种奖励过滤并选择候选,实验表明该方法能降成本且保持任务解决有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04631 2026-07-07 cs.AI 新提交 70%

Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs

形式化迪斯科:可扩展的形式化验证程序的开放式生成

Gabriel Poesia, Simon Henniger, Tzu-Han Hsu, Yilun Du, Nada Amin

机构 * Kempner Institute, Harvard University(坎普纳研究所,哈佛大学) School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对生成程序质量保证落后及形式验证数据稀缺问题,提出Formal Disco分布式系统,协调三类工人,记录痕迹用于改进,提出最大熵原则,发布数据集并微调模型,为形式推理领域大规模创建合成数据。

Comments Code: https://github.com/metareflection/formal-disco Datasets: https://huggingface.co/collections/metareflection/formal-disco

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02807 2026-07-07 cs.AI 新提交 70%

SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery

群体研究:编排编码智能体以进行开放式发现

Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究长期运行的编码智能体存在的问题,假设两个设计选择导致该问题,介绍SwarmResearch,一种编排器-子智能体架构,在开放式优化任务中表现良好,其编排器引导扩展能发现更好方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 62%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04729 2026-07-07 cs.CR cs.AI cs.SE 新提交 62%

RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架

Tarek Elsayed, Shiping Yang, Eunsong Koh, Sanika Goyal, Vincent Huang, Paul Ngo, Nathan Young, Mohammad Omidvar Tehrani, Alvyn Kang, Arnell Kang, Zeyu Chen, Angélica Moreira, Xuan Feng, Angel X. Chang, Nick Sumner, Steven Y. Ko

机构 * Simon Fraser University(西蒙弗雷泽大学) Trinity University(特里尼蒂大学) Microsoft Research(微软研究院) Amii(阿米国际)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05076 2026-07-07 cs.SE cs.FL 新提交 57%

Can Code Specify a System Precisely Enough to Formally Verify It?

代码能否精确指定系统以进行形式化验证?

Jean-Jacques Dubray

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究评估生产软件支付工作流,通过手工模型验证核心协议正确性,发现故障处理差距并修复;生产支付沙盒探针暴露问题;还复制了关于大语言模型规范可靠性受合同结构而非语言影响的结论。

Comments 25 pages, 3 figures, 5 tables. Artifacts and reference models at https://github.com/jdubray/SysMoBench-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05068 2026-07-07 cs.SE cs.CY 新提交 57%

When AI Is Wrong on Purpose: How Students Respond to Buggy GenAI Code

当人工智能故意出错时:学生如何应对有缺陷的生成式人工智能代码

Victor-Alexandru Pădurean, Kaitlin Riegel, Alkis Gotovos, Jyotika Mahapatra, Ahana Ghosh, Paul Denny, Juho Leinonen, James Prather, Adish Singla

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究如何调整以提示为中心的编程活动,通过向正确解决方案注入真实可运行的错误,分析学生对自然发生的提示相关故障和故意注入错误的行为,发现学生对不同错误源反应不同,二者共同支持有用的生成式人工智能工作流程。

Comments ICER'26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03935 2026-07-07 cs.AI 新提交 57%

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

harness感知自进化:共同进化模型权重、harness和任务解决方案

Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究提出HASE框架,通过单模型在多轮动作空间生成任务解决方案或编辑harness组件。能使单模型匹配高性能模型文本分类性能,在alpha因子挖掘中超越基线,还能修复评估组件,在算法发现中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03332 2026-07-07 cs.SE 新提交 57%

AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?

原子提交基准测试:编码代理能否从压缩补丁中重建提交历史?

Zhihao Lin, Mingyi Zhou, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究编码代理从压缩补丁重建提交历史的问题,将任务形式化为有重放要求的块到提交分区,构建基准测试并评估,发现自然重建比重放检查等难,部分方法表现较好,还找出常见失败模式及改进方法。

Comments 21 pages, 6 figures, benchmark paper on coding agents and software engineering; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 57%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02857 2026-07-07 cs.CR cs.SE 新提交 57%

MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents

MOSAIC:大语言模型编码代理中知识引导的命令行命令组合攻击

Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型编码代理中CLI命令组合风险,提出知识引导框架MOSAIC,从漏洞等提取命令状态行为总结成攻击路径,实例化开发者工作流程,通过多实验得高攻击成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 57%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02606 2026-07-07 cs.SE 新提交 57%

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

ChainSWE:在多漏洞软件维护中对编码代理进行基准测试

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24530 2026-07-07 cs.CL 新提交 57%

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

NatureBench: 编码智能体能达到Nature系列论文已发表SOTA水平吗?

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

机构 * Horizon Research(地平线研究) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出跨学科基准NatureBench,包含90个来自Nature系列论文的任务,评估AI编码智能体在真实科学问题上的发现能力。最强模型仅在17.8%任务上超越SOTA,失败主因是方法选择错误和计算预算不足。

Comments Add results of GLM-5.2 and MinMax-M3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22956 2026-07-07 cs.SE 版本更新 57%

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

SWE-Manager:编码前选择并合成黄金方案

Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏