arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 40 篇

2608.17092 2026-08-19 cs.CR cs.AI 新提交 93%

Structured Driving-State Narratives for Small Language Model-Based GNSS Spoofing Detection

面向基于小型语言模型(SLM)的GNSS欺骗检测的结构化驾驶状态叙事

Abyad Enan, Sagar Dasgupta, Mizanur Rahman, Mashrur Chowdhury

专题命中 效率与部署 :SLM(title_cn,summary_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本研究提出基于小型语言模型(SLM)的GNSS欺骗检测框架,通过对比多源驾驶状态的结构化叙事检测攻击,性能接近大模型且资源消耗更低,适用于车载平台。

Comments This work has been submitted to the Transportation Research Record: Journal of the Transportation Research Board for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14635 2026-08-19 cs.DC cs.LG 版本更新 92%

Belayer: Efficient Fault Tolerance for LLM Agentic RL Training

Belayer:面向LLM智能体强化学习训练的高效容错机制

Jiecheng Zhou, Qinghao Hu, Peng Sun, Xingcheng Zhang, Weiming Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Belayer系统,针对LLM智能体强化学习训练的生成引擎和环境故障设计容错机制,可降低无故障训练开销,大幅缩短工作节点与环境故障的恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17055 2026-08-19 cs.CY cs.HC cs.LG 新提交 91%

Wasted large language models: A life cycle thinking approach

被浪费的大语言模型:一种生命周期思维方法

Erik Johannes Husom, Maria Emine Nylund, Ophelia Prillard

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 该研究将生命周期思维与欧盟废弃物层级应用于LLMs,提出通过预防、再利用等措施减少LLMs废弃物及环境影响,强调预防不必要使用的重要性。

Comments 5 pages, 1 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv: LOCO2026/P14

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17556 2026-08-19 cs.CR cs.CL cs.LG 新提交 90%

Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

Reflex-Guard:一种使用稠密语义嵌入的低延迟大语言模型提示安全护栏

Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon, Abu-fuad Ahmad, Thi Hong Tran

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Reflex-Guard是一种本地运行的轻量型LLM提示安全护栏,采用稠密语义嵌入与快速分类器,延迟低至37.6毫秒,召回率达95.9%,性能优于现有基线,可高效检测各类越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18899 2026-08-19 cs.CL cs.AI cs.SD 版本更新 90%

Language Family Matters: Evaluating LLM-Based ASR Across Linguistic Boundaries

语言家族至关重要:评估基于LLM的ASR跨语言边界

Yuchen Zhang, Ravi Shekhar, Haralambos Mouratidis

机构 * Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于语言家族的连接器共享策略,通过减少参数数量并提升跨领域泛化能力,实现更高效的多语言ASR部署。

Comments Accepted by EACL'26 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17328 2026-08-19 cs.CV 新提交 89%

MS-MFAD: Multimodal large language models for Face Anti-spoofing Detection

MS-MFAD:用于人脸活体检测的多模态大语言模型

Xiaoyong Yu, Rongzhen Li, Shuming Shi, Xinge You

机构 * Mashang Consumer Finance Co., Ltd.(马上消费金融股份有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 针对人脸活体检测的复合威胁与现有方法瓶颈,提出基于多模态大语言模型MFAD的可解释系统,通过细粒度像素-语义锚定机制与少量语义标注实现优异检测性能,鲁棒性与效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17336 2026-08-19 cs.AI 新提交 89%

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix:面向大语言模型推理加速的以块为中心的混合精度注意力机制

Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

机构 * University of North Texas(北得克萨斯大学) Saint Louis University(圣路易斯大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TileMix是一种以块为中心的混合精度注意力内核,通过硬件对齐的分数块路由实现LLM推理加速,可恢复长上下文质量并提升预填充吞吐量,支持多种模型与任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-19 cs.CL cs.AI 版本更新 88%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 88%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22170 2026-08-19 math.NA cs.LG stat.ML 版本更新 88%

Large Language Models: A Mathematical Formulation

大语言模型:数学表述

Ricardo Baptista, Andrew Stuart, Son Tran

机构 * Statistical Sciences, University of Toronto(多伦多大学统计科学系) Vector Institute(向量研究所) Amazon Search(亚马逊搜索) Computing and Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种大语言模型的数学框架,涵盖文本编码、模型架构、学习过程及部署方法,旨在提升算法的准确性、效率和鲁棒性。

Comments 56 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15794 2026-08-19 cs.LG cs.AI cs.CL 版本更新 88%

Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting

自蒸馏作为大语言模型的性能恢复机制:对抗压缩与灾难性遗忘

Chi Liu, Xin Chen, Xu Zhou, Fangbo Tu, Srinivasan Manoharan

机构 * PayPal AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于自蒸馏微调的性能恢复框架,通过理论分析和实验验证,证明自蒸馏能有效恢复模型能力,揭示了高维流形对齐与性能恢复之间的强相关性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17856 2026-08-19 cs.AI 新提交 84%

ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction

ARASH:面向表格预测的自适应检索与样本选择

Samirasadat Jamalidinan, Yue Xu, Kazem Cheshmi

机构 * McMaster University(麦克马斯特大学)

专题命中 效率与部署 :foundation model(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARASH方法,通过训练集局部邻域分析选择最优样本,在保持TabPFN相当准确率的同时,大幅降低其提示长度与内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17872 2026-08-19 cs.CV 新提交 83%

DistillPath: An Efficient 22M Distilled Pathology Encoder Approaching Large Foundation Model Performance

DistillPath:一种高效的22M级蒸馏病理编码器,性能接近大型基础模型

Ramon Kaspar, Andrey Ignatov, Valentina Boeva

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出22M级蒸馏病理编码器DistillPath-KS16,通过蒸馏86M至1.1B的病理编码器得到,性能接近大型模型Virchow2,参数少29倍、速度快25倍以上,在EVA等基准上表现优异。

Comments 26 pages, 5 figures. Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MedFM-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17304 2026-08-19 cs.AR cs.AI cs.SE 新提交 81%

NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration

NeuroAbs:用于属性检查加速的神经符号RTL抽象框架

Zhiyuan Yan, Xiaofeng Zhou, Ziyue Zheng, Ziyi Yang, Wenbin Che, Wei Zhang, Yangdi Lyu, Hongce Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NeuroAbs框架,结合LLM与AST实现RTL抽象,通过SMT验证抽象正确性、CEGAR迭代精化,可加速硬件属性检查,解决现有方法人工成本高或灵活性不足的问题。

Comments Accepted at ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13840 2026-08-19 cs.CL 版本更新 81%

PrivAct: Internalizing Contextual Privacy Preservation via Multi-Agent Preference Training

PrivAct: 通过多智能体偏好训练内化上下文隐私保护

Yuhan Cheng, Hancheng Ye, Hai Helen Li, Jingwei Sun, Yiran Chen

机构 * Department of Electrical Computer Engineering, Duke University Department of Computer \& Information Science \& Engineering, University of Florida

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PrivAct通过多智能体偏好训练,内化上下文隐私保护,提升模型生成行为的隐私合规性,减少信息泄露并保持实用性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交 80%

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-19 cs.CR 版本更新 80%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17325 2026-08-19 cs.CL 新提交 79%

What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?

当分词与语言建模联合优化时,会学习到哪些词元?

Saketh Reddy Vemula, Parameswari Krishnamurthy

机构 * IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本研究对比无分词器方法(SSLMs、H-Nets)与固定分词器在18种语言上的效果,发现联合优化分词与语言建模可生成高效且有效的差异化词汇,为下游NLP提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-08-19 cs.AI cs.CR 版本更新 79%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 22 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12499 2026-08-19 cs.RO 版本更新 78%

Action-Effect Memory Pretraining for Robot Manipulation

动作-效应记忆预训练用于机器人操作

Yijing Zhou, Qiwei Liang, Sitong Zhuang, Jiaxi Li, Xianpeng Wang, Boyang Cai, Yunyang Mo, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学)

专题命中 效率与部署 :pretraining(title,abstract)

AI总结 提出AEM框架,通过视觉-动作历史掩码建模学习紧凑时间表征,提升机器人操作在部分可观测环境下的性能,优于单帧预训练和帧堆叠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17515 2026-08-19 cs.SE cs.AI 新提交 77%

Beyond FLOPs: Energy-Aware Knowledge Distillation for Sustainable LLMs on Code-Related Task

超越FLOPs:面向代码相关任务的可持续大语言模型的能量感知知识蒸馏

Enrique Barba Roque, Luís Cruz, Annibale Panichella

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对代码相关任务,发现FLOPs并非可靠的能耗指标,提出结合能量代理模型的Morph知识蒸馏方法,可将学生模型推理能耗降90%、内存降86%,实现LLMs的可持续部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23119 2026-08-19 cs.CL 版本更新 77%

Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM

Dripper:一种轻量级的HTML主内容提取框架

Mengjie Liu, Jiahui Peng, Wenchang Ning, Pei Chu, Jiantao Qiu, Ren Ma, He Zhu, Rui Min, Lindong Lu, Linfeng Hou, Kaiwen Liu, Yuan Qu, Zhenxiang Li, Chao Xu, Zhongying Tu, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 Dripper通过轻量级框架实现高效HTML主内容提取,兼顾效率与准确性,开源模型促进高质量数据集构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17941 2026-08-19 cs.LG cs.AI cs.CL 新提交 75%

Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation

基于图结构在线难度估计的高效RLVR调度

Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17402 2026-08-19 cs.CV 新提交 75%

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar

机构 * Meta

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13756 2026-08-19 cs.LG 版本更新 74%

The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference

整数不在场证明:定位INT8量化大语言模型推理中的跨内核差异

Teng-Ruei Chen

机构 * Krixvon(克里克斯冯公司)

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 该研究验证了vLLM中INT8线性内核(CUTLASS与Triton)的可互换性,定位到差异源于累加器后的缩放应用与输出舍入,提出的干预措施可恢复端到端逐位一致,还揭示了FP8 GEMM差异的不同特征并发布相关一致性检查流程。

Comments 10 pages (IEEEtran two-column), 3 figures, 4 tables. Pre-registered protocol with append-only amendments. Companion to arXiv:2608.11693 (https://arxiv.org/abs/2608.11693). v2: corrects the product-bound attribution (weight side, not activation side; 16256 is exact) and distinguishes the layer-level uniform pow2 regime from the per-channel probe; no result changes. Figure count corrected from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-19 cs.LG cs.AI cs.HC 新提交 73%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-08-19 cs.SE cs.AI cs.CR cs.IR cs.LG 版本更新 73%

From Adoption to Deployment: A Qualitative Study on AI Integration in Software Development Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18058 2026-08-19 cs.AI 新提交 70%

Delegation Asymmetry in Agentic Recommender Systems: Measuring Two-Sided Receptivity in Online Dating

智能体推荐系统中的委托不对称性:在线约会中的双边接受度测量

Daria Leshchikova, Valentina V. Kuskova, Dmitry Zaytsev, Valerii Klimov

机构 * Fleamily, Inc.(弗利米利公司) Lucy Family Institute for Data & Society(露西数据与社会研究所) University of Notre Dame(圣母大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对约会平台智能体推荐系统,开发测量双边智能体接受度的模型,发现存在委托不对称性,量化了相关倾向及设计杠杆,为智能体推荐设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17866 2026-08-19 cs.CL 新提交 70%

BayesPrompt: human readable prompts that make sense

BayesPrompt:符合人类可读性且有意义的提示词

Franky Kevin Nando Tezoh, Ali Hussaini Umar, Alessandro Laio, Guido Sanguinetti, Riccardo Rende

机构 * Scuola Internazionale Superiore di Studi Avanzati (SISSA)(国际高等研究学院(SISSA)) Flatiron Institute(弗拉蒂伦研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对提示词优化任务的不适定性,本文提出BayesPrompt算法,将提示词优化重定义为贝叶斯后验推断以生成可读提示词,在真实数据集上较当前最优方法有显著指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 70%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: this https URL (https://lego-rl.pages.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏