arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 63 篇

2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 87%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07961 2026-07-07 cs.LG cs.CR cs.NI 版本更新 86%

Graph Representation Learning Augmented Model Manipulation on Federated Fine-Tuning of LLMs

图表示学习增强的模型操纵在联邦微调大型语言模型中的应用

Hanlin Cai, Kai Li, Houtianfu Wang, Haofan Dong, Yichen Li, Falko Dressler, Ozgur B. Akan

机构 * Centre for neXt Communications (CXC), Department of Engineering, University of Cambridge(下一代通讯中心(CXC),工程系,剑桥大学) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠与信任跨学科中心(SnT),卢森堡大学) Telecommunication Networks group (TKN) at the School of Electrical Engineering and Computer Science, TU Berlin(电信网络组(TKN)位于电气工程与计算机科学学院,柏林技术大学) Center for neXt-Generation Communications (CXC), Department of Electrical and Electronics Engineering, Koç University(下一代通讯中心(CXC),电子与电气工程系,科克大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AugMP策略,通过图表示学习框架和迭代操纵算法,增强对抗性更新的有效性和隐蔽性,实验表明其能显著降低全局LLM准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 86%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 指令微调 :language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04640 2026-07-07 cs.CL 新提交 85%

Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models

先错后对:对齐语言模型中的后期挽救与接口故障

Jiaqi Deng

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(title,abstract);post-training(abstract);SFT(abstract);分类 cs.CL

AI总结 研究对齐语言模型中正确性的构建,用分层差分轨迹识别错误倾向,发现中间层会短暂倾向错误答案,后期层校正挽救。通过实验验证该现象,并得出对齐放大、预测压缩失败、可训练及在自然语言I/O中存在等结论。

Comments 16 pages, 10 figures. Code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04853 2026-07-07 cs.CL 版本更新 85%

Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"

分解式提示无法弥补知识差距,但有助于模型说“我不知道”

Dhruv Madhwal, Lyuxin David Zhang, Dan Roth, Tomer Wolfson, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) University of Pennsylvania(宾夕法尼亚大学) Oracle AI

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在闭卷问答中识别知识局限的问题,评估三种提示方式在不同模型规模和多跳问答基准下的影响,利用提示方式间的分歧信号实现无训练弃权策略,提升模型可靠性。

Comments Camera-ready version. Published in Findings of ACL 2026. Code and data: https://github.com/dhruvmadhwal/disagreement-based-abstention

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03886 2026-07-07 cs.IR cs.AI 新提交 83%

Enhancement of E-commerce Sponsored Search Relevancy with LLM

利用大语言模型提升电子商务赞助搜索的相关性

Md Omar Faruk Rokon, Andrei Simion, Weizhi Du, Musen Wen, Hong Yao, Kuang-chih Lee

机构 * Walmart AdTech(沃尔玛广告技术)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用预训练大语言模型在电子商务赞助搜索框架中开发先进广告相关性模型,通过LoRA改编LLAMA2 7B模型,引入新型分类器,经训练显著提升搜索精度和效率。

Comments eCom 24: ACM SIGIR Workshop on eCommerce, July 18, 2024, Washington, DC, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 82%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03801 2026-07-07 cs.LG cs.AI cs.CL 新提交 82%

Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks

超越自身能力:用于可验证多项选择题任务的微小语言模型的分类头微调

Bhavesh Sood, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何使参数约3B以下的微小语言模型适应可验证多项选择题任务,比较三种基于LoRA的微调范式,分类头微调在特定规模下表现更优,微调后的模型与大模型有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新 82%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn)

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03600 2026-07-07 cs.CV cs.AI 新提交 81%

A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning

通过微调与强化学习迈向鲁棒无监督域适应的一步

Sushant Dagaji Desale, Rahul Mishra, Ashutosh Kumar Sinha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对无监督域适应中对抗鲁棒性挑战,提出SFT+RL框架,结合监督微调与强化学习。在源域微调线性分类器,于目标域用置信引导伪标签策略,提升了清洁精度与对抗鲁棒性。

Comments Accepted and presented at the 28th European Conference on Artificial Intelligence (ECAI 2025), Bologna, Italy

Journal ref Frontiers in Artificial Intelligence and Applications, Volume 413, ECAI 2025, IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29014 2026-07-07 cs.AI cs.DL 版本更新 81%

Customized Generative AI Agent for Transportation Engineering Practice: A Development and Continued Pre-training Guideline

面向交通工程实践的定制化生成式AI智能体:开发与持续预训练指南

Dianwei Chen, Yuan-Zheng Lei, Zifan Zhang, Yuchen Liu, Xianfeng Yang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出基于LoRA框架对六种大语言模型进行持续预训练的方法,以提升其在交通工程领域的专业内容理解与推理能力,Qwen2.5-7B和LLaMA-3.1-8B表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 81%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 81%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02755 2026-07-07 cs.LG cs.AI 新提交 81%

Out-of-Distribution Generalization of Risk Aversion in Language Models

语言模型中风险规避的分布外泛化

Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie, Andrew Lin, Abhitej Bokka, Elliott Thornley

专题命中 指令微调 :language model(title);SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究训练人工智能在资源方面规避风险能否泛化至高风险场景。通过引入RiskAverseOOD基准测试,用多种方法使模型在低风险时规避风险,发现其能部分泛化至高风险,不同规模和模型家族也有类似效果,但一致性不足。

Comments ICML 2026 Agents in the Wild workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01050 2026-07-07 cs.CV 新提交 80%

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督

Dianyu Wang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。

Comments 14 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04919 2026-07-07 cs.LG 新提交 79%

When Do Foundation Models Pay Off? A Break-Even Analysis of Pretrained Time Series Forecasters

基础模型何时能取得成效?预训练时间序列预测器的盈亏平衡分析

Nicholas Tan Jerome, Frank Simon

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究何时投资时间序列基础模型能有回报,通过对比基础模型和传统基线在不同训练集规模下的表现,给出部署规则和决策框架,助从业者决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03094 2026-07-07 cs.LG 新提交 79%

Stacked LoRA for Subject-Adaptive EEG Foundation Models in Motor Imagery Decoding

用于运动想象解码中主题自适应脑电基础模型的堆叠式LoRA

Aymen Sarhane, Fouad Lbakali, Mouad Souissi, Jonathan Lys, Giulia Lioi

机构 * IMT Atlantique, Lab-STICC(法国布雷斯特的IMT大西洋学院,Lab-STICC实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 脑机接口的脑电图解码面临受试者间差异大的挑战。基于现有脑电基础模型,研究不同低秩适应策略对运动想象分类的影响,提出堆叠式LoRA框架,有效减轻受试者间差异,在多数组合中获最佳准确率。

Comments 10 pages, 1 figure, 2 tables. Accepted at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026), Maastricht, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02995 2026-07-07 cs.CV cs.AI 新提交 79%

VISTA: Auditing Semantic Divergence in Vision-Language Models

VISTA:视觉语言模型中的语义差异审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中视觉概念条件性差异,提出VISTA黑箱跨模型审计方法,结合语义熵与基于分布的差异标记异常,通过实验验证其有效性并发现新差异模式。

Comments Preprint. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16771 2026-07-07 cs.SE cs.AI cs.HC 版本更新 79%

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention

EyeMulator:通过模仿人类视觉注意力改进代码语言模型

Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比大学) National University of Singapore(新加坡国立大学) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出EyeMulator,通过提取眼动数据中的扫描路径,调整代码语言模型的注意力机制,使其更符合人类视觉注意力模式,从而在翻译和摘要任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10031 2026-07-07 cs.CR cs.AI cs.CL 版本更新 79%

Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

上下文误导大语言模型:上下文过滤在维持大语言模型安全对齐中的作用

Jinhwa Kim, Ian G. Harris

机构 * Department of Computer Science University of California, Irvine(计算机科学系,加州大学伊维特分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型受恶意上下文欺骗问题,提出上下文过滤防御机制,通过过滤不可信上下文识别真实意图,提升安全性同时保持性能,经对比分析验证其有效性。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 78%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02711 2026-07-07 cs.CV 新提交 78%

RayTun3R: Online Camera Adaptation in 3D Foundation Models

RayTun3R:3D基础模型中的在线相机适配

Daniil Sinitsyn, Nikita Araslanov, Daniel Cremers

机构 * TU Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究3D基础模型在鱼眼相机下表现不佳的问题,提出RayTun3R方法,通过学习参数高效的残差校正等,在保持预训练网络不变的情况下适配相机,减少旋转误差且参数少、无需多视图推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24182 2026-07-07 cs.RO 版本更新 78%

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力

Siyao Xiao, Yuhong Zhang, Zhifang Liu, Zihan Gao, Jingye Zhang, Sinwai Choo, Dake Zhong, Mengzhe Wang, Xiao Lin, Xianfeng Zhou, Jia Jia, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) Synapath

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12116 2026-07-07 cs.LG cs.AI cs.CL 版本更新 78%

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

DynamixSFT:指令微调集合的动态混合优化

Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong

机构 * University of Michigan(密歇根大学) Microsoft Research(微软研究院) KAIST AI(韩国科学技术院人工智能研究所) Drexel University(德雷塞尔大学)

专题命中 指令微调 :instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对不断涌现的指令微调数据集,提出DynamixSFT动态自动优化方法。将问题转化为多臂老虎机设置,采用Prior-scaled Boltzmann Exploration和1-Step Look-ahead Reward更新采样概率,有效优化数据集并减少计算开销。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 39590-39603

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04619 2026-07-07 cs.SD cs.CL 新提交 77%

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

CARD:用于无编码器音频字幕的跨组件音频表示蒸馏

Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis, Ravi Shekhar

机构 * School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院) Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出无编码器音频字幕模型CARD,去除推理时的编码器,用含合并LoRA适配器的投影仪给冻结的语言模型供能。通过跨组件蒸馏预训练音频教师模型,提升了CIDEr-D指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10784 2026-07-07 cs.LG 77%

Preconditioned Inexact Stochastic ADMM for Deep Model

预条件近似随机ADMM用于深度模型

Shenglong Zhou, Ouya Wang, Ziyan Luo, Yongxu Zhu, Geoffrey Ye Li

机构 * School of Mathematics and Statistics, Beijing Jiaotong University, China(北京交通大学数学与统计学院,中国) ITP Lab, Department of EEE, Imperial College London, UK(帝国理工学院伦敦分校电子工程系ITP实验室,英国) National Mobile Communications Research Laboratory, Southeast University, China(东南大学国家移动通信研究实验室,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出PISA算法,通过预条件技术解决分布式数据异质性问题,提升深度模型训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 77%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05114 2026-07-07 cs.LG cs.AI cs.CL 新提交 75%

Localized LoRA-MoE: Block-wise Low-Rank Experts With Adaptive Routing

局部化LoRA-MoE:具有自适应路由的逐块低秩专家模型

Babak Barazandeh, Subhabrata Majumdar, Vinay Prithyani, George Michailidis

机构 * Fortinet(Fortinet公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型等依赖参数高效微调方法的局限,提出融合局部空间分块与动态上下文条件路由的Localized LoRA-MoE框架,介绍两种架构范式并证明其能解决静态基线优化死锁问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04582 2026-07-07 cs.SE 新提交 75%

Finetuning Lightweight LLMs for Control Flow Graph Generation

用于控制流图生成的轻量级语言模型微调

Hanyu Zhang, Tomoji Kishi

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究用微调轻量级大语言模型生成控制流图,设计统一输出格式和特定任务微调提示,构建数据集,在六个模型上评估,结果表明微调后的轻量级模型在生成控制流图上效果良好,有跨语言泛化能力。

Comments Accept by The 38th International Conference on Software Engineering & Knowledge Engineering Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11388 2026-07-07 cs.CL 74%

Improving Translation Quality by Selecting Better Data for LLM Fine-Tuning: A Comparative Analysis

通过选择更好的数据提升翻译质量:一项比较分析

Felipe Ribeiro Fujita de Mello, Hideyuki Takada

机构 * Ritsumeikan University(立命馆大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 研究通过比较五种数据选择器评估数据选择对LLM微调的影响,发现语义选择器优于词法和几何启发式方法,数据差异小于3%对模型性能影响显著。

Comments To appear at IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏