arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 51 篇

2606.29709 2026-06-30 cs.SE 94%

Bash-Commenter: Leveraging Syntax-Aware Preference Optimization to Reinforce Large Language Model for Bash Code Comment Generation

Bash-Commenter:利用语法感知偏好优化增强大语言模型生成Bash代码注释

Lei Yu, Jingyuan Zhang, Xin Wang, Li Yang, Fengjun Zhang, Peng Wang, Jia Xu, Jiajia Ma

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对Bash脚本注释缺乏问题,提出基于LLaMA-3.1-8B的Bash-Commenter方法,通过构建高质量数据集、持续预训练和监督微调,并引入语法感知偏好优化(SAPO)利用抽象语法树构造偏好对,显著提升注释生成质量。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29155 2026-06-30 cs.SE 91%

OASIF: An Efficient Obfuscation-Aware Self-Improving Framework for LLM-Based Assembly Code Instruction Following and Comprehension

OASIF:一种高效的混淆感知自改进框架,用于基于LLM的汇编代码指令遵循与理解

Xinyi Wang, Rongze Chen, Ke Wang, Qiyuan Chen, Yanming Liu, Xiang Li, Chunfu Jia

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OASIF框架,通过令牌高效汇编编码器、轻量投影器和三阶段训练(特征空间对齐、监督指令微调、在线自进化强化学习),提升LLM在商业级混淆汇编代码上的指令遵循与理解能力,在VMISA-Bench上取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 91%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 91%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29254 2026-06-30 cs.CL cs.NE 90%

Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

面向旅游的推理大语言模型:基于领域特定知识图谱

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson, Golnaz Moallem

机构 * Expedia Group(Expedia集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出一种模块化流水线,利用专家构建的知识图谱生成多跳问答对,微调大语言模型以提升旅游领域推理的准确性和校准能力,在基准上达到82.4%精确匹配。

Comments Accepted to the Uncertainty Reasoning and Quantification in Decision Making (UDM) Workshop, KDD 2026 (To be presented in August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 90%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05386 2026-06-30 cs.LG cs.AI cs.CL 89%

Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

强化微调自然缓解持续训练中的遗忘

Song Lai, Haohan Zhao, Rong Feng, Changyi Ma, Wenzhuo Liu, Hongbo Zhao, Xi Lin, Dong Yi, Qingfu Zhang, Hongbin Liu, Gaofeng Meng, Fei Zhu

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文比较了监督微调与强化微调在持续训练中的影响,发现强化微调能有效保留先验知识,优于监督微调和多任务训练,且在标准基准上提升模型通用知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30077 2026-06-30 cs.LG cs.AI 89%

Online Data Selection for Instruction Tuning via Gaussian Processes

基于高斯过程的指令调优在线数据选择

Jun Wang, Quoc Phong Nguyen, Julien Monteil, Vu Nguyen

机构 * Amazon(亚马逊)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GAIA框架,利用高斯过程回归建模语义空间中的连续效用流形,通过自适应策略融合动态选择高质量样本,在三个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV 89%

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30140 2026-06-30 q-bio.GN cs.CL 89%

DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks

DNA语言模型:面向微调任务的预训练评估

Romain Karpinsky, Julien Mozziconacci, Mickaël Delcey

机构 * CNRS(法国国家科学研究中心) LORIA(洛林大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);foundation model(abstract)

AI总结 本研究系统比较了基于Transformer和卷积的DNA语言模型在微调任务上的表现,评估了预训练的实际贡献以及BPE分词对基因组学任务的影响。

Comments 12 pages, 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29614 2026-06-30 cs.CL cs.AI 88%

Do We Still Need Fine Tuning? Turkish Sentiment Analysis in the Era of Large Language Model

我们还需要微调吗?大语言模型时代的土耳其语情感分析

Sercan Karakaş, Yusuf Şimşek

机构 * University of Chicago(芝加哥大学) Fırat University(费拉特大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型时代土耳其语情感分析是否需要监督微调,通过对比经典机器学习、微调预训练语言模型和提示大语言模型,发现微调BERTurk在三分类任务中表现最佳,而大语言模型在中性类别上表现不佳。

Comments Accepted to the 34th IEEE Signal Processing and Communications Applications Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04556 2026-06-30 cs.CL cs.LG 88%

BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models

BA-LoRA: 降低偏差的低秩适应以减轻大语言模型中的灾难性继承

Yupeng Chang, Yi Chang, Yuan Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出BA-LoRA,通过引入一致性、多样性及SVD项正则化,缓解低秩适应中的灾难性继承问题,提升模型鲁棒性和公平性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29371 2026-06-30 stat.AP 88%

Semantic insurance pricing with large language models

基于大语言模型的语义保险定价

Christopher Blier-Wong, Derek Kusmenko

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 利用预训练大语言模型从保单的自然语言描述中提取嵌入特征,替代手工特征输入标准精算定价模型,在法国车险数据上验证了其在小样本下的优势,并讨论了微调与提示敏感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29097 2026-06-30 cs.CV 88%

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

TrafficAlign: 对齐大语言模型用于交通场景生成

Zhi Tu, Liangkun Niu, Tianyi Zhang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 提出TrafficAlign框架,利用真实驾驶视频合成交通场景并对齐大语言模型,生成场景使自动驾驶模型碰撞率提升10.8%,微调后碰撞率降低36.1%。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 2026, pp. 39744-39754

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 87%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30266 2026-06-30 cs.LG cs.AI 86%

Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation

迈向连续运动-语言智能体:用于增量运动理解与生成的LoRA变体

Bertram Taetz, Hugo Albuquerque Cosme da Silva, Gabriele Bleser-Taetz

机构 * IT & Engineering International University of Applied Sciences(IT与工程国际应用科学大学)

专题命中 指令微调 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对运动-语言智能体在连续任务中学习新运动概念时灾难性遗忘的问题,提出基于LoRA的混合专家架构,通过自编码器路由器选择任务特定专家,无需任务标签,在HumanML3D基准上实现双向任务近零遗忘并保持高质量。

Comments 16 pages, 1 figure, Accepted at the Conference on Lifelong Learning Agents (CoLLAs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30258 2026-06-30 cs.LG cs.AI 84%

KnowsTFM: Knowledge-Informed Fine-Tuning of Small Tabular Foundation Models

KnowsTFM:知识引导的小型表格基础模型微调

Boshko Koloski, Xiangjian Jiang, Senja Pollak, Blaž Škrlj, Mateja Jamnik, Nikola Simidjievski

机构 * Jožef Stefan Institute and Postgraduate School(乔塞夫·斯蒂芬研究所和研究生学院) Department of Computer Science and Technology, University of Cambridge, UK(剑桥大学计算机科学与技术系) Télécom Paris, Institut Polytechnique de Paris, FR(巴黎电信学院,巴黎理工学院)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对专业领域数据稀缺且分布偏移的问题,提出通过知识图谱结构先验和参数高效低秩更新微调小型表格基础模型,在专业任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI 82%

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 82%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30263 2026-06-30 cs.CR cs.AI 81%

Defending Against Harmful Supervision Hidden in Benign Samples

防御隐藏在良性样本中的有害监督

Bang An, Yibo Yang, Dandan Guo, Ebtisam Alshehri, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对有害监督嵌入良性训练样本的攻击,提出基于双重参考的SFT方法(DR-SFT),通过令牌级正则化缓解有害微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29792 2026-06-30 cs.CL 81%

Are Humans Evolved Instruction Followers? An Underlying Inductive Bias Enables Rapid Instructed Task Learning

人类是进化而来的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能

Anjishnu Kumar

机构 * Amazon Alexa AI Seattle, USA(亚马逊Alexa AI西雅图美国)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出人类具有进化形成的指令遵循偏置,即一种归纳偏置,使得从语言快速泛化行为成为可能,并类比大语言模型的指令微调,呼吁跨学科研究。

Comments 4 pages, Position Paper, Published at Neurips 2025 Workshop on Interpreting Cognition in Deep Learning Models - https://neurips.cc/virtual/2025/loc/san-diego/129741

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 81%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29130 2026-06-30 cs.CL 81%

DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles

DistilledGemma:面向多语言历史文章的人物-地点关系提取的平衡效率与准确性

Youssef Aboelwafa, Ahmed Samir, Nagwa Elmakky, Marwan Torki

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DistilledGemma系统,采用三阶段知识蒸馏管道,从26B教师模型蒸馏到2.3B学生模型,在HIPE-2026共享任务中实现高效准确的人物-地点关系提取,标准测试集排名第三,二进制测试集排名第二。

Comments The Conference and Labs of the Evaluation Forum (CLEF) 2026 - HIPE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28479 2026-06-30 cs.CR cs.AI 81%

Decomposing Memorization Reduction in Privacy-Preserving Fine-Tuning of SLMs for CSIRTs

面向CSIRTs的隐私保护微调中记忆化减少的分解

Cristhian Kapelinski, Diego Kreutz

机构 * Federal University of Pampa(帕纳马联邦大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract_cn);prompting(abstract)

AI总结 本文首次实证研究DP SGD与HMAC伪匿名化在微调1B-3B小语言模型时的交互作用,发现匹配更新控制可解释66%-132%的记忆化减少,HMAC减少40%-61%的暴露,但模型性能不足以实际应用。

Comments 7 tables, 51 references. Accepted for publication at the 36th Brazilian Conference on Intelligent Systems (BRACIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM 81%

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16903 2026-06-30 cs.LG 79%

Freeze, Prompt, and Adapt: A Framework for Source-free Unsupervised GNN Prompting

冻结、提示与适应:一种无源无监督GNN提示框架

Peyman Baghershahi, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 指令微调 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出UGPP新场景,无需标签和源数据,通过一致性正则化和伪标签训练提示函数,解决GNN无监督提示问题,实验证明优于有监督方法。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24844 2026-06-30 cs.AI cs.CL 79%

Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning

Geo-Expert: 通过参数高效微调实现专家级地质推理

Chenyou Guo, Zongqi Liu, Yizhou Zhang, Zhaorui Jiang, Ze Liu

机构 * Ocean University of China(中国海洋大学) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Geo-Expert,通过参数高效微调(LoRA)在定制高质量指令数据集上微调小规模语言模型,在专门的地质推理基准Geo-Eval上,8B模型超越70B通用模型和GPT-4o,32B模型接近前沿推理模型。

Comments 11 pages, 1 figure, 3 tables. Accepted at ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11351 2026-06-30 cs.AI cs.LG 79%

Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization

推动主动代理的帕累托前沿:行为代理优化

Yihang Yao, Zhepeng Cen, Haohong Lin, Shiqi Liu, Zuxin Liu, Jiacheng Zhu, Zhang-Wei Hong, Laixi Shi, Ding Zhao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出行为代理优化框架,通过增强和规范回合间行为,提升信息获取能力并抑制低效交互,从而在任务性能与用户参与间取得平衡,优于现有主动代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29256 2026-06-30 stat.ML cs.LG 77%

Generalization Analysis of Transformers in Distribution Regression

Transformer在分布回归中的泛化分析

Peilin Liu, Ding-Xuan Zhou

机构 * School of Mathematics and Statistics, University of Sydney(悉尼大学数学与统计学学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于分布回归的Transformer学习框架,通过注意力算子实现分布到函数表示的无损压缩,并证明其在学习复杂结构泛函上优于CNN和全连接网络,最后给出泛化界并解释大模型技术原理。

Journal ref Neural Computation 37(2):260-293, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28436 2026-06-30 cs.SE cs.AI 77%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏