SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback
SeqFeed:通过顺序行为反馈改进智能体RTL代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.CL
AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SeqFeed:通过顺序行为反馈改进智能体RTL代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.CL
AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。
概率程序合成中的似然黑客行为
机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) ; University of Edinburgh, School of Informatics(爱丁堡大学信息学院) ; CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)
专题命中 代码生成 :program synthesis(title);分类 cs.LG、cs.PL
AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。
探测预填充:通过潜在激活检测代码漏洞
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 该研究从四个LLM提取预填充标记激活训练MLP探测器,在四个代码漏洞基准上实现平均F1值41.7%,证明LLM自身代码表示含漏洞信息,为轻量原生筛查提供方向。
GxP-Agent:基于流程有向无环图拓扑结构的可靠临床试验编程大模型智能体
机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 该研究提出基于流程DAG拓扑的多智能体系统GxP-Agent,在临床试验编程任务上显著优于现有方法,实现了高结构匹配率,验证了编码领域流程知识为图拓扑的有效性。
Comments Preprint. 9 pages main text, 3 figures, plus references and appendix
开源统一瞬态多相先进反应堆模拟工具包(Outram Park)中库的智能体迁移、构建及初步验证与确认 第一部分:热工水力
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究将OpenFOAM库智能体迁移至Rust语言的Outram-Foam库,开发了两相HEM壅塞流求解器,验证显示其吻合度良好,智能体编码可提升开源库开发效率,人类专业知识仍为关键。
Comments 78 pages, 21 figures, 17 tables
从张量加速器ISA描述自动生成ML编译器后端
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本文提出ACT工具,可基于ISA描述自动生成张量加速器的XLA编译器后端,其生成的后端性能优于商用编译器,且提升了AWS Trainium的代码生成覆盖率。
Comments Accepted at OOPSLA 2026
编码智能体的工作集:仓库规模任务中的一致性债务
专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.AI、cs.LG
AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。
LEGO-RL:利用原生强化学习实现编码智能体
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI
AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。
Comments Webpage: this https URL (https://lego-rl.pages.dev)
TRUSS:面向任务可靠且用户安全的自动化智能体技能生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI
AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。
Agent Lightning v1.0:走向可控的智能体强化学习
机构 * Microsoft(微软) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; University of Edinburgh(爱丁堡大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。
Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码
专题命中 软件智能体 :coding agent(abstract)
AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。
Comments 25 pages, 16 figures
ORCA:基于可观测性的微服务故障程序修复
专题命中 程序修复 :program repair(title,abstract);分类 cs.SE
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
TokEval:一个分词器评估套件
机构 * EPFL(洛桑联邦理工学院)
专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。
Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)
自动化安全补丁回移植基准测试:我们还差多远?
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。
Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: this https URL (https://doi.org/10.5281/zenodo.21785770)
通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tufts University(塔夫茨大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码评测 :coding agent(abstract);分类 cs.LG
AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。
CoMedBench:合成医疗数据保真度与下游效用的多源基准
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 CoMedBench是涵盖多源合成医疗数据的可复现基准,评估多生成器在静态表格和时序ICU任务上的保真度与下游效用,实验显示合成数据可保留多数下游信号,不同生成器表现存在差异。
StagedWorkspace:面向知识工作智能体的版本化工作空间
机构 * Harvard University(哈佛大学) ; Raycaster AI(雷caster人工智能公司) ; University of Technology Sydney(悉尼科技大学) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究针对知识工作智能体的版本化工作空间问题,提出StagedWorkspace方案,通过绑定解析记录与原生文件内容哈希提升性能,在OfficeQA Pro等数据集上取得显著优于基准的效果,为相关基准构建提供了新方向。
Comments Under Review
软件引用元数据的多表面一致性审计
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本文对117个开源研究型软件项目的多达7个机器可读元数据表面进行审计,发现83.9%的项目存在核心字段冲突,多数冲突源于表面描述的是软件论文而非软件本身,同时发布了审计相关资源。
Comments 10 pages, 2 figures, 3 tables
用于CSI反馈的学习件:特定场景的小型模型可发挥大作用
专题命中 仓库级理解 :repository(abstract);分类 cs.AI
AI总结 针对6G CSI反馈的模型泛化与场景性能权衡问题,提出基于学习件的模型仓库框架,可高效检索匹配的预训练模型,在LOS/NLOS场景下性能优于通用模型,减少训练开销并增强隐私。
Comments This work has been accepted by IEEE Transactions on Wireless Communications. Copyright may be transferred without notice, after which this version may no longer be accessible
扩展基于吉兹语的非洲语言词汇:阿姆哈拉语和提格雷尼亚语的比较研究
专题命中 仓库级理解 :repository(abstract);分类 cs.CL
AI总结 针对低资源非拉丁脚本语言表现不佳问题,提出VEXMLM。通过训练特定语言分词器扩展XLM - R词汇并初始化嵌入,分两阶段训练,在多种任务上评估。贡献为定制程序、两阶段策略及多语言评估,提升了相关语言任务性能。
Comments 13 pages, 7 tables, 2 figurs
去极化信道量子容量阈值的认证下界
专题命中 仓库级理解 :repository(abstract)
AI总结 该研究针对去极化信道量子容量阈值,给出首个已证明的正性结果,明确45副本两输入态在特定p值下满足I_c>0,还实现了两个竞争码态正性边界的认证排序。
Comments 13 pages, 2 tables. v2: expanded attribution and related work; clarified claim scope and evidence taxonomy; certified bound unchanged. Verification artifact: DOI https://doi.org/10.5281/zenodo.21962925
懒散量子行走搜索的门级实现与资源分析
专题命中 其他AI编程 :code model(abstract)
AI总结 本文提出懒散量子行走搜索的门级实现框架,验证其搜索性能并分析资源开销,为量子硬件上的懒散量子行走搜索提供实用实现方案及容错资源评估。
Comments 27 pages, 15 figures