Deploying Privacy Guardrails for LLMs: A Comparative Analysis of Real-World Applications
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI、cs.LG
Comments This paper has been accepted at Deployable AI workshop at AAAI 2025
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI、cs.LG
Comments This paper has been accepted at Deployable AI workshop at AAAI 2025
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments https://github.com/luolin101/CodeV
专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Data, code, and leaderboard are available at https://www.swebench.com ICLR 2024, https://openreview.net/forum?id=VTF8yNQM66
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments https://github.com/NL2Code/CodeR
专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 软件智能体 :repository(abstract);coding agent(abstract)
Comments 8+10 pages, 10+8 figures
Journal ref Physical Review Research 2, 023230 (2020)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG;repository(comments)
Comments 15 pages, 11 figures, associated code repository available at https://github.com/R-Sweke/DeepQ-Decoding
Journal ref Mach. Learn. Sci. Technol. 2, 025005 (2021)
从代码审查到代码批判:大规模AI生成代码差异的意图、漂移与焦点
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 针对AI生成代码超出传统审查能力且现有工具忽视核心问题的缺陷,提出ARCTIC系统,经实验验证其在意图预测、漂移检测等方面表现优异,可降低代码不一致性并获高认可。
QuoteBench:匹配分数如何掩盖命令路径故障
机构 * Stony Brook University(石溪大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 QuoteBench针对LLM编码智能体的命令路径故障,通过56个任务实验发现匹配分数掩盖执行缺陷,披露边界可恢复部分性能,提出评估需报告多维度配置而非仅匹配分数。
Comments 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/
训练AI科学家以实现研究的可复现性
机构 * Inherent(因赫伦特)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。
Comments 47 pages, 12 figures
更好、更快、更强:程序化技能学习最能降低智能体成本
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。
Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试
机构 * University of California, Riverside(加利福尼亚大学河滨分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI
AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。
Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench
评估AI代理在神经科学数据到发现流程中的案例研究
机构 * Cornell University(康奈尔大学) ; HHMI Janelia Research Campus(霍华德·休斯医学研究所贾雷尔研究园区)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究评估通用编码代理在果蝇光遗传学数据到发现流程中的表现,发现代理能解决单个阶段任务,但端到端流程仍超出其能力,主要挑战包括缺乏预定义迭代标准和科学判断能力。
Comments Peer-reviewed conference paper
Journal ref Third Conference on Language Modeling (COLM 2026)
SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL
AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。
Comments Published as a conference paper at COLM 2026
图形代理:用于科学代理的结构化执行图
机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。
在软件问题解决的大语言模型智能体中耦合规划与情景记忆
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。
Comments 12 pages, 5 figures
SkillMOO:软件工程中代理技能的多目标优化
机构 * King's College London(伦敦国王学院) ; Queen's University Belfast(贝尔法斯特女王大学) ; Nanjing University(南京大学) ; Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) ; University College London(伦敦大学学院) ; University of Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。
CheMLFlow:用于化学信息学与材料信息学应用的开源平台
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 CheMLFlow是用于构建端到端高通量智能体工作流的开源平台,可降低科学机器学习开发的编排开销,其在多类性质预测任务上达到文献性能,还支持非分子化学数据集的应用。
快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。
BulkPR-Bench:针对交互拉取请求的队列级治理基准
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。
Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780
当策略改变概率时:用于LLM代码审查的模块化决策
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。
Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities
野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析
机构 * Microsoft Azure Research(微软Azure研究院) ; Microsoft Azure(微软Azure)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。
智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。
Comments 31 pages, 9 figures
Orchard:一个开源的智能体建模框架
机构 * Microsoft Research(微软研究院) ; Columbia University(哥伦比亚大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。
多语言指令微调不存在最优语言集:基于语言信息研究的见解
专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.LG
AI总结 研究多语言指令微调中语言集选择问题,通过评估基于多种特征的语言信息选择策略与随机基线对比,发现固定预算下无通用语言选择策略,性能因任务和模型而异,超阈值加语言会致性能下降,还讨论了相关影响和评估陷阱。
Comments 7 pages, 4 figures Updated the title and revised the manuscript for submission to the Workshop on Insights from Negative Results in NLP (Insights 2026)
跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?
机构 * University of California, Davis(加州大学戴维斯分校) ; Johns Hopkins University(约翰霍普金斯大学) ; California State University, Long Beach(长滩加州州立大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。
Comments This paper had been accepted by Agentic SE @ KDD'26
DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究所) ; Zhongguancun Academy(中关村学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。
Comments 13 pages, 2 figures, and 5 tables. Technical report
了解你的智能体:基于侦察的人工智能智能体渗透测试
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。
SWE-Pruner Pro:编码语言模型已知道该修剪什么
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL
AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。
Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro
通过机器可读的验证与确认规范将高级需求集成到低级测试中
机构 * Systems Engineering, King Fahd University of Petroleum ; Faculty of Computer ; Information Systems Islamic University of Madinah Madinah, Saudi Arabia ; Division of Information Science, Nara Institute of Science
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究针对人工智能和网络物理系统中高级需求与低级测试脱节问题,提出VNVSpec开源框架,使V&V规范机器可读可执行,能检查需求质量、链接需求与测试结果等,通过自我应用评估并可扩展用于相关测试。