Dockerless: Environment-Free Program Verifier for Coding Agents
Dockerless: 面向编码智能体的无环境程序验证器
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Dockerless: 面向编码智能体的无环境程序验证器
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。
为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容
机构 * Microsoft(微软)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。
Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables
SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Google(谷歌)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。
Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/
规范增长引擎:AI辅助软件开发的规范锚定、代码耦合、漂移强制架构
机构 * Hochschule Offenburg(奥芬堡应用科学大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出规范增长引擎框架,通过机器可读的规范图、Spine上下文组装器、垂直切片增长协议和漂移门,解决AI编码代理中的上下文爆炸和规范-代码漂移问题。
LLM编码代理的确定性控制平面
机构 * Happiest Minds Technologies (AIP Centre of Excellence)(happiest minds technologies(aip中心卓越机构))
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 针对LLM编码代理配置缺乏管理的问题,提出确定性控制平面Rel(AI)Build,通过内容寻址、分层权限、阶段状态机等机制确保配置安全与一致性。
Comments 45 pages, 9 figures, 13 tables. Dataset and reproduction scripts: Zenodo DOI 10.5281/zenodo.20780913. Ancillary files include report.json, organizations.txt, and figure-reproduction scripts
SplitZip:超快无损KV压缩用于解耦的大语言模型服务
机构 * University of Notre Dame IN, USA(诺丁汉大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。
评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?
机构 * Department of Computer Science(计算机科学系) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。
编码智能体的贝叶斯控制
机构 * PolyShape ; National Technical University of Athens(雅典国家技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 软件智能体 :tool-use(abstract);分类 cs.AI、cs.CL
AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。
检测开源中的AI编码代理:对1.8亿个仓库的多方法普查验证
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出多层面检测框架,整合配置扫描、提交消息分析等四种方法,发现单一信号低估AI代理活动达30倍,揭示不同检测渠道捕获的代理群体几乎不重叠。
Metis: 连接文本与代码记忆以实现自我进化智能体
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huawei(华为) ; Wuhan University(武汉大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出Metis系统,通过分层双表示记忆(文本与代码)平衡构建成本、执行效率和可迁移性,在AppWorld上任务准确率提升20.6%,执行成本降低22.8%。
Comments Work in progress
超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述
机构 * IBM
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE
AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。
Comments 14 Pages, 1 Table, 1 Figure
NASDAQ:归一化观测空间动力学增强Q学习
机构 * Sun Yat-sen University(中山大学) ; EPFL(瑞士联邦理工学院洛桑分校) ; Purdue University(普渡大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对观测预测强化学习中低维观测维度不平衡导致性能下降的问题,提出归一化方法平衡损失和梯度,并构建NASDAQ框架,结合价值学习与两个辅助任务,在多个领域取得领先性能且训练时间更短。
基底崩塌:AI代码生成使基于作者身份的知识度量失效
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文论证AI代码生成从根本上切断了代码作者身份与理解之间的推理链,导致基于作者身份的知识度量(如卡车因子)不再有效,并提出以理解证据为基础的新度量方向。
Comments 10 pages, no figures. Position paper; states a falsifiable prediction and deliberately leaves construction of the comprehension-grounded instrument open
面向乘客导向自动驾驶的LLM可解释DRL框架
机构 * LITAN, ESTIN(LITAN,ESTIN) ; Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。
自信且错误:编码智能体中的无声语义失败
机构 * Snowflake AI Research(Snowflake AI研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。
Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI
边生成边执行:在LLM代码解释器中隐藏执行延迟
机构 * Singapore Management University Singapore(新加坡国立管理学院新加坡) ; Beihang University China(北航大学中国)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出并行执行范式,通过将生成、检测和执行三阶段流水线化,在代码生成过程中提前执行,显著降低端到端延迟。
Comments 10 pages
OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架
机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) ; Esri R&D Center Zurich(埃斯里苏黎世研发中心) ; Complexity Science Hub(复杂性科学中心)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。
Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all
Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888
StaminaBench: 对编码智能体进行100轮交互的压力测试
机构 * AWS Agentic AI(AWS 代理人工智能)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。
从令牌到区域:面向GPU内核生成的CUDA敏感指令微调
机构 * Shanghai Jiao Tong University(上海交通大学) ; Biren Technology(壁仞科技)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出CuSeT方法,通过自适应令牌级掩码和区域感知样本重加权,在简单SFT框架内提升LLM生成CUDA内核的功能正确性。
Snyk VulnBench JS 1.0: LLM 能否两次发现相同的漏洞?
机构 * Snyk
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 通过300次重复漏洞扫描实验,评估LLM在相同JavaScript代码上安全审查的可重复性,发现引用匹配结果稳定但额外报告波动大,建议结合确定性SAST使用。
Comments 12 pages, 9 figures
CODA-BENCH:代码智能体能否处理数据密集型任务?
机构 * Renmin University of China(中国人民大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出CODA-BENCH基准,在数据密集型环境中联合评估代码与数据智能,包含1009个任务,平均每个环境980个文件,揭示当前智能体在数据发现与代码执行整合上的不足。
Comments Accepted at ICML 2026. 37 pages, 11 figures. Project page: https://coda-bench.github.io/ Code: https://github.com/ruc-datalab/CoDA-Bench Data: https://huggingface.co/datasets/RUC-DataLab/CoDA-Bench
代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库
机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) ; Department of Information Systems(信息系统系)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。
Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls
自动化低风险代码审查在Meta:RADAR、风险校准与审查效率
机构 * Meta USA, UK, Canada(Meta美国、英国、加拿大)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出RADAR系统,通过多阶段漏斗对代码差异进行风险分层自动化审查,在Meta部署后显著提升审查效率并降低风险。
HyDRA:异构LLM池的混合动态路由架构
机构 * Microsoft(微软)
专题命中 软件智能体 :tool use(abstract);分类 cs.CL、cs.LG
AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。
Comments preprint v2
DualGauge: 对仅由LLM和编码代理生成的规范代码进行自动化联合安全-功能基准测试
机构 * University at Buffalo, SUNY(布法罗大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出DualGauge框架,首个自动化联合评估规范代码正确性与安全性的系统,通过307个任务基准测试发现功能正确性高估可靠代码生成,联合成功率低于15%,且模型因素和代理系统均无法可靠提升。
高效探索的无监督学习:通过自我设定目标预训练自适应策略
机构 * University College London (UCL)(伦敦大学学院(UCL))
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出ULEE方法,结合上下文学习器与对抗性目标生成策略,在无监督元学习框架中优化多回合探索与适应,提升零样本和少样本性能。
Comments ICLR 2026; v2 adds link to code: https://github.com/Octavio-Pappalardo/ulee-jax
Journal ref The Fourteenth International Conference on Learning Representations, 2026
与你合作得更好:将用户修正编译为编码代理的运行时强制
机构 * University of Notre Dame(圣母大学) ; IBM Research(IBM研究院) ; Tencent AI Lab(腾讯AI实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG
AI总结 提出TRACE方法,通过将用户修正编译为原子规则并在运行时强制执行,显著减少编码代理在后续任务中的偏好违反,优于纯记忆方法。
AI IDE中的规则分类与演化:挖掘与调查研究
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Central China Normal University(中央师范大学计算机学院) ; School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 通过挖掘83个开源项目中的7310条规则和99份从业者调查,建立了包含5个主类和25个子类的规则分类法,发现开发者重视架构约束但实际配置多为低级工作流和代码格式规则,规则演化主要由建设性上下文扩展和丰富驱动,且更新规则可使工件合规率平均提升22.99%。
Comments 52 pages, 21 images, 8 tables, Manuscript submitted to a Journal (2026)
多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理
机构 * Recurse Ltd. ; Department of Computing, Imperial College London(帝国理工学院计算机系)
专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE
AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。
Comments 8 pages, 6 pages appendix
MOLOT系统卡:恶意操作逻辑观察变换器
机构 * False Positive Community
专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE
AI总结 提出MOLOT系统,利用静态调用图的行为序列进行恶意代码检测,结合解释阶段定位可疑行为,在PyPI和npm包上评估,并发布Open Malicious-Code Bench基准。
Comments 13 pages, 3 figures