arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-11 至 2026-06-11 共收录 32 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2511.08195 2026-06-11 cs.CV 版本更新 78%

UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization

UI2Code^N: 将UI到代码生成视为交互式视觉优化

Zhen Yang, Wenyi Hong, Mingde Xu, Xinyue Fan, Weihan Wang, Jiale Cheng, Xiaotao Gu, Jie Tang

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(title,abstract)

AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11817 2026-06-11 cs.CR cs.AI cs.CL cs.SE 新提交 67%

Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

语法约束解码可诱使大语言模型生成恶意代码

Yitong Zhang, Shiteng Lu, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文发现语法约束解码(GCD)可被利用发起名为CodeSpear的越狱攻击,使LLM生成恶意代码;并提出安全对齐方法CodeShield,通过生成蜜罐代码防御该攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09591 2026-06-11 cs.CL cs.AI cs.LG 版本更新 67%

On the Optimal Reasoning Length for RL-Trained Language Models

关于RL训练的语言模型的最优推理长度

Daisuke Nohara, Taishi Nakamura, Rio Yokota

机构 * University of Tokyo(东京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 67%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 62%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11210 2026-06-11 cs.CL cs.AI cs.MM 新提交 62%

T2MM: An LLM Supported Architecture For Inquiry-Based Modeling

T2MM:一种支持基于探究建模的LLM架构

John Kos, Rudra Singh, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11521 2026-06-11 cs.LG 新提交 57%

Counterexample Guided Learning in the Large using Reasoning Agents

使用推理代理的大规模反例引导学习

Hongyi Liu, Frederic Sala, Thomas Reps, Adithya Murali

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 代码生成 :program synthesis(abstract);分类 cs.LG

AI总结 提出反例引导的LLM正则表达式归纳框架,通过验证器反馈和代理策略(如反思与修复循环)显著提升样本效率和复杂任务成功率。

Comments Code, data, and resources are publicly available for research purposes: https://github.com/Lhtie/CEGML

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09174 2026-06-11 cs.HC 版本更新 50%

Demonstrating chart-plot: Closing the Last Mile of Academic Chart Generation

展示chart-plot:弥合学术图表生成的最后一英里

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Jiale Lao, Tingfeng Lan, Wei Chen

专题命中 代码生成 :code generation(abstract)

AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。

Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23130 2026-06-11 cs.HC cs.CR 版本更新 50%

From Preventive to Reactive: How AI Coding Assistants Transform Developers' Security Awareness

从预防到反应:AI编程助手如何改变开发者的安全意识

Faisal Haque Bappy, Tahrim Hossain, Sidratul Muntaher Meheraj, Annoor Sharara Akhand, Tasfia Tabassum, Tarannum Shaila Zaman, Raiful Hasan, Tariqul Islam

专题命中 代码生成 :code generation(abstract)

AI总结 通过访谈和观察15名专业开发者,发现AI编程助手将安全思考从编码阶段转移到审查阶段,导致从预防性安全转向反应性安全,并揭示了安全意识与行为脱节的现象。

Comments This paper has been accepted at the 2026 Symposium on Usable Privacy and Security (SOUPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20819 2026-06-11 physics.chem-ph 版本更新 50%

DynaMate2: runtime registration of expert-defined tools for agentic scientific workflow automation

DynaMate2:使代理AI民主化,用于专家设计的定制工作流

Orlando A. Mendible-Barreto, Ajay Vallabh, Ubaldo M. Córdova-Figueroa, Yamil J. Colón

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出DynaMate2,一种分层代理框架和开源模板,旨在降低研究人员将现有专家定义的Python函数转换为AI可调用工具的门槛,通过让LLM负责任务路由和工具选择,而非生成科学代码,从而实现自动化科学工作流的民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06057 2026-06-11 cs.DC cs.MS 版本更新 50%

FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication

FalconGEMM:通过低复杂度矩阵乘法超越硬件极限

Honglin Zhu, Jiaping Cao, Jiang Shao, Siyuan Feng, Qian Qiu, Peng Chen, Xu Zhang, Yixian Zhou, Man Lung Yiu, Guang Ji, Minwen Deng, Jintao Meng, Wenxi Zhu

专题命中 代码生成 :code generation(abstract)

AI总结 FalconGEMM通过自动化部署优化低复杂度矩阵乘法算法,实现DL性能提升,在GPU和CPU上均超越传统GEMM库和AlphaTensor等竞品。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2606.12329 2026-06-11 cs.AI 新提交 79%

PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层

Ripon Chandra Malo, Tong Qiu

机构 * University of Utah(犹他大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出PROJECTMEM,一种本地优先、事件溯源的记忆与判断层,通过记录事件日志并生成紧凑摘要,帮助AI编码代理避免重复错误,实现记忆即治理。

Comments 12 pages, 5 figures, 1 table. Code: https://github.com/riponcm/projectmem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11447 2026-06-11 cs.CL 新提交 79%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11456 2026-06-11 cs.CL cs.AI cs.CY 新提交 76%

AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

社会科学中的AI编码智能体:方法多样,经验一致,解释脆弱

Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh, Enkelejda Kasneci

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Technical University of Munich(慕尼黑工业大学)

专题命中 软件智能体 :coding agent(title);分类 cs.CL、cs.AI

AI总结 研究LLM智能体在科学分析中的方法多样性与解释脆弱性,通过20次独立实验发现智能体在设计层匹配或超越人类多样性,但在裁决层易受提示影响,偏差源于解释而非估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14084 2026-06-11 cs.SE cs.AI cs.CL 版本更新 67%

CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing

CRANE:通过空域编辑实现代码代理的约束推理注入

Mingzhi Zhu, Michele Merler, Raju Pavuluri, Stacy Patterson

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11976 2026-06-11 cs.SE cs.AI 新提交 62%

Exploration Structure in LLM Agents for Multi-File Change Localization

LLM代理中的探索结构用于多文件变更定位

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06547 2026-06-11 cs.CR cs.AI cs.CL cs.ET 版本更新 62%

"Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills in the Wild

“不要向用户提及此事”:检测与理解恶意代理技能

Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Zhejiang Key Laboratory of Digital Fashion and Data Governance, Zhejiang Sci-Tech University(浙江数字时尚与数据治理重点实验室,浙江科技大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对两个主要注册中心的98,380个技能进行系统安全分析,结合静态模式匹配和动态行为验证,识别出157个恶意技能,揭示了13种攻击技术中的632个不同漏洞,并发现攻击复杂性与隐藏投入相关。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11476 2026-06-11 cs.SE 新提交 57%

SentTrack: Sentiment-Driven Bottleneck Detection in GitHub Issue Repositories

SentTrack: GitHub问题仓库中情感驱动的瓶颈检测

Xinyu Hu, Ali Behbahani, Daniel Moon, Yaren Dogan, Nasir U. Eisty

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01459 2026-06-11 eess.SY cs.SE cs.SY 版本更新 57%

Semantic Technologies in Practical Demand Response: An Informational Requirement-based Roadmap

实际需求响应中的语义技术:基于信息需求的路标图

Ozan Baris Mulayim, Anand Krishnan Prakash, Yuvraj Agarwal, Mario Bergés, Marco Pritoni, Derek Supple, Steve Schaefer, Mitali Shah

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文针对商业建筑激励型需求响应,通过形式化本体评估方法定义信息需求,评估现有本体(Brick、DELTA、EFOnt、CIM)的不足,并提出扩展与整合路标图以增强语义互操作性。

Comments Accepted at ACM eEnergy 2026. Not yet published/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2606.11416 2026-06-11 cs.CR cs.AI 新提交 57%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 程序修复 :repository(abstract);分类 cs.AI

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 67%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09059 2026-06-11 cs.SE 版本更新 57%

Evaluating LLM-Generated Code: A Benchmark and Developer Study

评估大语言模型生成的代码:一个基准和开发者研究

Joanna Szych, Anne Schwerk

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。

Comments Accepted for publication at EASE '26/EQUISA workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 50%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 代码评测 :repository(abstract)

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04661 2026-06-11 astro-ph.CO astro-ph.IM 版本更新 50%

unimpeded: A Public Grid of Nested Sampling Chains for Cosmological Model Comparison and Tension Analysis

unimpeded: 用于宇宙学模型比较和张力分析的公共嵌套采样链网格

Dily Duan Yi Ong, Will Handley

专题命中 代码评测 :repository(abstract)

AI总结 发布公共Python库unimpeded,提供预计算嵌套采样和MCMC链,对8个宇宙学模型和39个数据集进行系统分析,发现ΛCDM模型最受青睐,并量化了DES与Planck、SH0ES与Planck之间的显著张力。

Comments 49 pages, 13 figures. Version 3: Revised in response to the JCAP editor's report. Added Section 3.2.12 on the treatment of nuisance parameters in the evidence and tension calculations. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2606.11241 2026-06-11 cs.DL cond-mat.mtrl-sci 新提交 78%

APTLAS: An Indexed APT Literature Repository

APTLAS:一个索引化的APT文献库

Bavley Guerguis, Nabil Bassim

专题命中 仓库级理解 :repository(title,abstract)

AI总结 针对原子探针层析技术(APT)文献分散且缺乏领域特定元数据的问题,构建了包含约2300条记录并附带元数据的索引库APTLAS,支持按材料体系、仪器等过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12231 2026-06-11 cs.SE cs.AI 新提交 62%

Rule Taxonomy and Evolution in AI IDEs: A Mining and Survey Study

AI IDE中的规则分类与演化:挖掘与调查研究

Guangzong Cai, Ruiyin Li, Peng Liang, Zengyang Li, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 通过挖掘83个开源项目中的7310条规则和99份从业者调查,建立了包含5个主类和25个子类的规则分类法,发现开发者重视架构约束但实际配置多为低级工作流和代码格式规则,规则演化主要由建设性上下文扩展和丰富驱动,且更新规则可使工件合规率平均提升22.99%。

Comments 52 pages, 21 images, 8 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11462 2026-06-11 cs.SE 新提交 57%

Defeater Cards: Characterizing and Managing Safety Assurance Case Defeaters

Defeater Cards: 表征和管理安全保证案例的击败者

Usman Gohar, Michael C. Hunter, Salil Purandare, Jordan J. Rios, Myra B. Cohen, Robyn R. Lutz

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出Defeater Cards结构化文档,基于5W1H框架系统表征、推理和管理安全案例中的击败者,通过跨领域案例研究验证其暴露隐藏假设、发现推理缺口和支持持续演化的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11877 2026-06-11 cs.NI 新提交 50%

LLM-Enabled NWDAF: A Step Toward AI-Native 6G Network Intelligence

LLM赋能的NWDAF:迈向AI原生的6G网络智能

Henok Daniel, Omar Alhussein, Cheng Li, Jie Liang, Ernesto Damiani

专题命中 仓库级理解 :repository(abstract)

AI总结 开发了一个与Free5GC兼容的开源NWDAF,集成大语言模型接口,通过意图识别实现自然语言交互,简化网络分析管理,为AI原生6G网络奠定基础。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05394 2026-06-11 cs.SD eess.AS 版本更新 50%

nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies

nnAudio 2: 克服动态编译障碍与变换不一致性

Abhinaba Roy, Junyi Liang, Dorien Herremans

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 针对 nnAudio 在 TorchScript 编译、逆变换边缘情况和依赖漂移方面的问题,通过移除动态状态变异、限制逆变换适用范围并更新依赖,实现了与现代 PyTorch 和 SciPy 的兼容,提升了可微音频分析的鲁棒性。

Journal ref Proc. of Conference on AI Music Creativity (AIMC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏