arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-11 至 2026-06-11 共收录 15 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2511.08195 2026-06-11 cs.CV 版本更新 78%

UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization

UI2Code^N: 将UI到代码生成视为交互式视觉优化

Zhen Yang, Wenyi Hong, Mingde Xu, Xinyue Fan, Weihan Wang, Jiale Cheng, Xiaotao Gu, Jie Tang

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(title,abstract)

AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09591 2026-06-11 cs.CL cs.AI cs.LG 版本更新 67%

On the Optimal Reasoning Length for RL-Trained Language Models

关于RL训练的语言模型的最优推理长度

Daisuke Nohara, Taishi Nakamura, Rio Yokota

机构 * University of Tokyo(东京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 67%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09174 2026-06-11 cs.HC 版本更新 50%

Demonstrating chart-plot: Closing the Last Mile of Academic Chart Generation

展示chart-plot:弥合学术图表生成的最后一英里

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Jiale Lao, Tingfeng Lan, Wei Chen

专题命中 代码生成 :code generation(abstract)

AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。

Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23130 2026-06-11 cs.HC cs.CR 版本更新 50%

From Preventive to Reactive: How AI Coding Assistants Transform Developers' Security Awareness

从预防到反应:AI编程助手如何改变开发者的安全意识

Faisal Haque Bappy, Tahrim Hossain, Sidratul Muntaher Meheraj, Annoor Sharara Akhand, Tasfia Tabassum, Tarannum Shaila Zaman, Raiful Hasan, Tariqul Islam

专题命中 代码生成 :code generation(abstract)

AI总结 通过访谈和观察15名专业开发者,发现AI编程助手将安全思考从编码阶段转移到审查阶段,导致从预防性安全转向反应性安全,并揭示了安全意识与行为脱节的现象。

Comments This paper has been accepted at the 2026 Symposium on Usable Privacy and Security (SOUPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20819 2026-06-11 physics.chem-ph 版本更新 50%

DynaMate2: runtime registration of expert-defined tools for agentic scientific workflow automation

DynaMate2:使代理AI民主化,用于专家设计的定制工作流

Orlando A. Mendible-Barreto, Ajay Vallabh, Ubaldo M. Córdova-Figueroa, Yamil J. Colón

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出DynaMate2,一种分层代理框架和开源模板,旨在降低研究人员将现有专家定义的Python函数转换为AI可调用工具的门槛,通过让LLM负责任务路由和工具选择,而非生成科学代码,从而实现自动化科学工作流的民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06057 2026-06-11 cs.DC cs.MS 版本更新 50%

FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication

FalconGEMM:通过低复杂度矩阵乘法超越硬件极限

Honglin Zhu, Jiaping Cao, Jiang Shao, Siyuan Feng, Qian Qiu, Peng Chen, Xu Zhang, Yixian Zhou, Man Lung Yiu, Guang Ji, Minwen Deng, Jintao Meng, Wenxi Zhu

专题命中 代码生成 :code generation(abstract)

AI总结 FalconGEMM通过自动化部署优化低复杂度矩阵乘法算法,实现DL性能提升,在GPU和CPU上均超越传统GEMM库和AlphaTensor等竞品。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2605.14084 2026-06-11 cs.SE cs.AI cs.CL 版本更新 67%

CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing

CRANE:通过空域编辑实现代码代理的约束推理注入

Mingzhi Zhu, Michele Merler, Raju Pavuluri, Stacy Patterson

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06547 2026-06-11 cs.CR cs.AI cs.CL cs.ET 版本更新 62%

"Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills in the Wild

“不要向用户提及此事”:检测与理解恶意代理技能

Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Zhejiang Key Laboratory of Digital Fashion and Data Governance, Zhejiang Sci-Tech University(浙江数字时尚与数据治理重点实验室,浙江科技大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对两个主要注册中心的98,380个技能进行系统安全分析,结合静态模式匹配和动态行为验证,识别出157个恶意技能,揭示了13种攻击技术中的632个不同漏洞,并发现攻击复杂性与隐藏投入相关。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01459 2026-06-11 eess.SY cs.SE cs.SY 版本更新 57%

Semantic Technologies in Practical Demand Response: An Informational Requirement-based Roadmap

实际需求响应中的语义技术:基于信息需求的路标图

Ozan Baris Mulayim, Anand Krishnan Prakash, Yuvraj Agarwal, Mario Bergés, Marco Pritoni, Derek Supple, Steve Schaefer, Mitali Shah

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文针对商业建筑激励型需求响应,通过形式化本体评估方法定义信息需求,评估现有本体(Brick、DELTA、EFOnt、CIM)的不足,并提出扩展与整合路标图以增强语义互操作性。

Comments Accepted at ACM eEnergy 2026. Not yet published/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 3 篇

2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 67%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09059 2026-06-11 cs.SE 版本更新 57%

Evaluating LLM-Generated Code: A Benchmark and Developer Study

评估大语言模型生成的代码:一个基准和开发者研究

Joanna Szych, Anne Schwerk

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。

Comments Accepted for publication at EASE '26/EQUISA workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04661 2026-06-11 astro-ph.CO astro-ph.IM 版本更新 50%

unimpeded: A Public Grid of Nested Sampling Chains for Cosmological Model Comparison and Tension Analysis

unimpeded: 用于宇宙学模型比较和张力分析的公共嵌套采样链网格

Dily Duan Yi Ong, Will Handley

专题命中 代码评测 :repository(abstract)

AI总结 发布公共Python库unimpeded,提供预计算嵌套采样和MCMC链,对8个宇宙学模型和39个数据集进行系统分析,发现ΛCDM模型最受青睐,并量化了DES与Planck、SH0ES与Planck之间的显著张力。

Comments 49 pages, 13 figures. Version 3: Revised in response to the JCAP editor's report. Added Section 3.2.12 on the treatment of nuisance parameters in the evidence and tension calculations. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 2 篇

2606.05394 2026-06-11 cs.SD eess.AS 版本更新 50%

nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies

nnAudio 2: 克服动态编译障碍与变换不一致性

Abhinaba Roy, Junyi Liang, Dorien Herremans

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 针对 nnAudio 在 TorchScript 编译、逆变换边缘情况和依赖漂移方面的问题,通过移除动态状态变异、限制逆变换适用范围并更新依赖,实现了与现代 PyTorch 和 SciPy 的兼容,提升了可微音频分析的鲁棒性。

Journal ref Proc. of Conference on AI Music Creativity (AIMC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11719 2026-06-11 cs.IR 版本更新 50%

Uncertainty-aware Generative Recommendation

不确定性感知的生成式推荐

Chenxiao Fan, Chongming Gao, Yaxin Gong, Haoyan Liu, Fuli Feng, Xiangnan He

专题命中 仓库级理解 :repository(abstract)

AI总结 提出不确定性感知生成式推荐框架UGR,通过不确定性加权奖励、难度感知优化和显式置信度对齐,解决生成式推荐中忽视模型置信度导致的训练不稳定和决策风险问题。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏