arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 853 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 264 篇

2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 62%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05936 2026-07-08 cs.SE cs.LG 新提交 62%

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

通过检索增强生成和约束解码减轻大语言模型生成的Web API调用中的错误

Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) Pariton AI National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 研究如何减轻大语言模型生成的Web API调用错误,提出检索增强生成(RAG)和约束解码(CD)两种互补方法,设计相应技术细节,在合成和真实数据集上评估,结果显示RAG、CD各有优劣,能提升Web API调用代码正确性。

Comments 54 pages, 11 figures; supersedes arXiv:2509.20172v6, which is a discarded journal extension of our work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05471 2026-07-08 cs.SE cs.AI 新提交 62%

KAT-Coder-V2.5 Technical Report

KAT-Coder-V2.5技术报告

Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai

机构 * KwaiKAT Team(快手KwaiKAT团队)

专题命中 代码生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 62%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03215 2026-07-07 cs.CR cs.AI cs.SE 新提交 62%

Builder, Defender, Breaker: The Case Against Removing the Human from the AI-Driven Security Lifecycle

构建者、防御者、破坏者:反对从人工智能驱动的安全生命周期中移除人类的理由

Mohamed Chahine Ghanem

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 探讨人工智能在安全生命周期中集多角色于一身的现象,指出移除人类会带来问题,基于多领域证据论证人类应是安全生命周期的永久结构要求,并阐述人机合理分工。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03174 2026-07-07 cs.SE cs.AI 新提交 62%

Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study

基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究

Gabriel Almeida, Ilir Gashi, Vladimir Stankovic, João R. Campos

机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) Centre for Software Reliability(软件可靠性中心) Department of Informatics Engineering(信息工程系) Department of Computer Science(计算机科学系) City St George’s, University of London(伦敦城市圣乔治大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04072 2026-07-07 cs.SE cs.AI quant-ph 新提交 62%

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试

Mohammad Arif Rasyidi, Syahirul Faiz

机构 * Department of Computer Science(计算机科学系) Khalifa University(卡利法大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 62%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30689 2026-07-01 cs.SE cs.AI 新提交 62%

Citation Discipline in Spec-Driven Development: A Cross-Model Empirical Study of Output Determinism and Automated Hallucination Detection in LLM-Generated Code

规范驱动开发中的引用规范:LLM生成代码的输出确定性与自动幻觉检测的跨模型实证研究

Subham Panda

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 通过对比三种规范驱动开发框架,发现强制引用要求会降低输出确定性但能实现自动幻觉检测,该权衡在不同模型间一致。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25519 2026-07-01 cs.AI cs.LG 新提交 62%

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀

Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) Anyscale Snowflake

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26344 2026-06-26 cs.PL cs.CL cs.PF 新提交 62%

Axon: A Synthesizing Superoptimizer for Tensor Programs

Axon:张量程序的综合超优化器

Akash Kothari, Shaowei Zhu, Daniel Kroening, Chungha Sung

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Web Services(亚马逊网络服务)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.PL

AI总结 提出Axon,一种通过程序综合自动生成目标指令并探索语义等价变体以选择最佳性能内核的张量程序超优化器,利用SMT保证变换语义正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23690 2026-06-24 cs.SE cs.AI 新提交 62%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 62%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21339 2026-06-23 cs.SE cs.PL 新提交 62%

KBSpec: LLM-driven Formal Specification Generation with Evolving Domain Knowledge Base

KBSpec:基于演化领域知识库的LLM驱动形式化规约生成

Wenhan Wang, Zeyu Sun

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20585 2026-06-23 cs.HC cs.AI cs.CL 新提交 62%

Turning Intent into Specifications: A Benchmark and an Interactive User-Assistant Agent

将意图转化为规范:一个基准测试和一个交互式用户助手代理

Hao Wang, Ligong Han, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Core AI(IBM核心AI)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出SpecBench基准和Buddy代理,通过形态分析分解用户意图、模拟用户评估设计选择,将焦点从代码生成转向人机协作规范制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16118 2026-06-23 cs.AI cs.CL cs.LO 新提交 62%

Know Your Limits : On the Faithfulness of LLMs as Solvers and Autoformalizers in Legal Reasoning

了解你的局限:LLM在法律推理中作为求解器和自动形式化工具的忠实性

Olivia Peiyu Wang, Sanna Wong-Toropainen, Daneshvar Amrollahi, Ryan Bai, Tashvi Bansal, Arush Garg, Leilani H. Gilpin

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Univ. Helsinki(赫尔辛基大学) CodeX, Stanford(斯坦福大学CodeX中心) Stanford University(斯坦福大学) Canyon Crest Academy(峡谷峰学院) Monta Vista High School(蒙塔维斯塔高中) Los Altos High School(洛斯阿尔托斯高中)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在法律推理中是否忠实执行逻辑推理,发现LLM基于形式推理的高性能掩盖了范围清洗等不忠实模式,揭示基准准确性与逻辑忠实性之间的根本差距。

Comments 10 pages, submitted to COLM 2026 (under review, average score of 6.25 across 4 reviewers) and accepted by the AI4Law and AI4Math workshops at ICML. This is the version where we already addressed most of the reviews from the COLM & AI4Law &; AI4Math reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20517 2026-06-19 cs.AI cs.PL 新提交 62%

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

机构 * GigaCode Yandex School of Data Analysis, Applied AI Institute(Yandex数据分析学院,应用人工智能研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 提出 Multi-LCB 基准,将 LiveCodeBench 的 Python 任务扩展到 12 种编程语言,评估 LLM 跨语言代码生成能力,发现 Python 过拟合和语言特定污染等问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18425 2026-06-18 cs.SE cs.AI cs.DC 新提交 62%

From Specification to Execution: AI Assisted Scientific Workflow Management

从规范到执行:AI辅助的科学工作流管理

Komal Thareja, Hamza Safri, Rajiv Mayani, Anirban Mandal, Ewa Deelman

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) Information Sciences Institute, University of Southern California, Marina del Rey, CA, USA(信息科学研究所,南加州大学马里纳德尔雷耶斯分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出一种AI辅助方法,通过规范驱动的工作流生成、自动化调试和分布式执行,结合Pegasus与MCP层,实现从自然语言到大规模科学工作流的端到端管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18023 2026-06-17 cs.LG cs.AI 新提交 62%

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展

Jian Yang, Shawn Guo, Wei Zhang, Tianyu Zheng, Yaxin Du, Haau-Sing Li, Jiajun Wu, Yue Song, Yan Xing, Qingsong Cai, Zelong Huang, Chuan Hao, Ran Tao, Xianglong Liu, Wayne Xin Zhao, Mingjie Tang, Weifeng Lv, Ming Zhou, Bryan Dai

机构 * Beihang University(北京航空航天大学) IQuest Research Langboat(浪波) Renmin University of China(中国人民大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17514 2026-06-17 cs.SE cs.AI 新提交 62%

Unlocking LLM Code Correction with Iterative Feedback Loops

解锁大语言模型代码修正的迭代反馈循环

Le Zhang, Suresh Kothari

机构 * Iowa State University(爱荷华州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。

Comments 22 pages, 14th Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16496 2026-06-16 cs.CL cs.LG 新提交 62%

REFLEX: Reflective Evolution from LLM Experience

REFLEX: 基于大语言模型经验的反思进化

Pan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出REFLEX框架,通过解耦视觉诊断与代码生成实现可审计的高效策略进化,在控制任务和天线阵列合成中展现优异样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15693 2026-06-16 cs.SE cs.AI 新提交 62%

Imperfect Visual Verification for Code Edition : A Case Study on TikZ

代码编辑的不完美视觉验证:以TikZ为例的案例研究

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Clément Quinton, Olivier Barais

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、Inria、IRISA、INSA) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、Inria、CNRS、IUF、IRISA) Univ Rennes, Inria, CNRS, IRISA(里昂大学、Inria、CNRS、IRISA) Univ. Lille, CNRS, Inria(里尔大学、CNRS、Inria) Univ. Rennes, IRISA, Inria(里昂大学、IRISA、Inria)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对TikZ等视觉代码定制任务,研究不完美验证器在迭代精炼中的有效性,发现即使不完美验证器也能适度准确判断指令是否应用,反馈对弱模型提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14672 2026-06-15 cs.AI cs.CL 新提交 62%

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

面向LLM-Agent工作流中并行分支的直接潜在空间合成

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12647 2026-06-12 cs.CC cs.AI cs.LG 新提交 62%

Token Complexity Theory for AI-Augmented Computing

AI增强计算的Token复杂度理论

Jie Wang

机构 * Richard Miner School of Computing and Information Sciences, University of Massachusetts, Lowell, MA(理查德·米纳尔计算与信息科学学院,马萨诸塞大学洛厄尔分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出Token复杂度作为AI增强计算中查询与响应成本的形式化度量,建立AI-Oracle图灵机框架,证明单调性、凸性、价格敏感性和任务排序的价格相对性等基本定理。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 62%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11210 2026-06-11 cs.CL cs.AI cs.MM 新提交 62%

T2MM: An LLM Supported Architecture For Inquiry-Based Modeling

T2MM:一种支持基于探究建模的LLM架构

John Kos, Rudra Singh, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 62%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 62%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏