arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2606.17024 2026-06-16 cs.LG 新提交 92%

ExpRL: Exploratory RL for LLM Mid-Training

ExpRL: 用于LLM中期训练的探索性强化学习

Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI Rogo

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.LG

AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06902 2026-06-08 cs.LG 新提交 92%

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

TALAN:面向大型语言模型目标后训练的任务对齐潜在自适应网络

Chengkai Zhang, Ziteng Liu, Junpu Wang, Zeyi Tao, Yang Wang, Sagar Chordia, Qin Huang

机构 * Meta AI

专题命中 指令微调 :post-training(title,abstract);large language model(title);language model(title);SFT(abstract,abstract_cn)

AI总结 提出TALAN,一种序列条件潜在旁路,插入Transformer残差流并与低秩适配器协同训练,在STEM/代码基准上平均提升LoRA 1.41点、DoRA 1.85点,仅增加<1%可训练参数和1.01-1.02倍推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27506 2026-07-31 cs.CL cs.AI 新提交 91%

Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models

极简RAG的模型:B1ade 335M嵌入模型与1B参数小型语言模型

Shreyas Subramanian, Mecit Gungor, Vikram Elango

机构 * Amazon(亚马逊公司)

专题命中 指令微调 :language model(title);small language model(title);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 该研究提出含B1ade-embed嵌入模型与B1ade-1B小型语言模型的高效极简RAG架构,其在多QA基准及RAG评估中表现优异,还涌现出无明确监督的来源引用能力,验证了资源高效RAG的可行路径。

Comments 28 pages, 3 figures. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20205 2026-06-19 cs.AI cs.CL cs.HC 新提交 91%

Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact

大语言模型的心理特征很大程度上是测量假象

Jelena Meyer, David Garcia, Dirk U. Wulff

机构 * Max Planck Institute for Human Development(马克斯·普朗克人类发展研究所) University of Konstanz(康斯坦茨大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心) University of Basel(巴塞尔大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过心理测量框架分析56个指令微调LLM,发现模型间差异主要源于方向性响应偏差而非特质,该偏差解释了81-90%的变异,且可通过题目选择操控,表明LLM心理特征是测量假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 91%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01772 2026-07-03 cs.CV eess.SP 新提交 91%

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

LLM赋能的自动驾驶多模态融合框架:语义增强与信道自适应设计

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

机构 * National Natural Science Foundation of China(国家自然科学基金) Shenzhen Natural Science Foundation(深圳市自然科学基金) Shenzhen Key Laboratory Evaluation(深圳市重点实验室评估)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LM-SCIP框架,以LLM为核心推理中枢,通过信道自适应语义模块动态融合视觉与雷达特征,实现低信噪比下的视觉主导回退和高信噪比下的协同融合,在nuScenes和VIRAT数据集上显著提升定位精度。

Comments 6 pages, 4 figures. Accepted by 2026 IEEE 37th International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27845 2026-06-29 econ.GN econ.TH q-fin.EC 新提交 91%

LLM Agents as Static Level-k Players in Behavioural Games

LLM智能体作为行为博弈中的静态k级玩家

Po Han Teo

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过p-beauty竞赛和公共物品博弈实验,发现LLM在不同部署设置下可部分复现人类选择的分散性,但无法模拟人类的策略过程,表现为静态的、按模型规模检索类别的k级玩家,缺乏信念更新和逆向归纳能力。

Comments 30 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12821 2026-08-14 cs.LG 新提交 91%

HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

HiRoute:用于大语言模型安全对齐的分层路由提示调优

Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 HiRoute是一种输入自适应分层提示调优框架,通过分层路由器与多粒度提示专家,提升大语言模型安全对齐效果,在多个安全基准上兼顾安全性与响应有用性,减少过度拒绝。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09650 2026-08-11 cs.IR cs.CL 新提交 91%

Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking

用于LLM重排序器的列表式交叉编码器微调与智能体指令微调:医疗流程重排序的系统性研究

Matan Fainzilber, Shlomit Plavner

专题命中 指令微调 :LLM(title,title_cn);instruction tuning(title);分类 cs.CL

AI总结 本文系统性对比列表式交叉编码器微调与智能体指令微调两种LLM重排序范式,在自建医疗流程重排序数据集上,发现1.09亿参数的ListNet微调交叉编码器性能优于40亿参数的Qwen3-Reranker-4B,参数量仅为后者1/37,相关成果已开源。

Comments 10 pages, 6 figures, 4 tables. Code available at https://github.com/matanf-healthee/listwise-crossencoder-reranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06792 2026-08-10 cs.IR cs.AI 新提交 91%

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

通过多阶段后训练实现推荐系统基础模型的渐进式对齐

Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

专题命中 指令微调 :foundation model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LP-FFT-RFT三阶段渐进式后训练框架,将推荐系统基础模型的下游适配与业务指标对齐分离,实验证实其能提升推荐质量。

Comments 9 pages, 3 figures. Accepted to the 20th ACM Conference on Recommender Systems (RecSys '26), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09401 2026-06-09 cs.LG cs.CR 新提交 91%

Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models

大语言模型适配的实证隐私保护基准测试

Bartłomiej Marek, Lorenzo Rossi, Vincent Hanke, Xun Wang, Michael Backes, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 通过系统变化适配数据分布,使用鲁棒成员推断和金丝雀数据提取攻击,评估差分隐私下大语言模型的实际隐私风险,发现分布偏移显著影响隐私脆弱性,LoRA等参数高效微调方法对分布外数据提供最佳实证保护。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07877 2026-06-09 cs.CL 新提交 91%

Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models

谁的规范?解开大语言模型中的文化与个人对齐

Angana Borah, Isabelle Augenstein, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) University of Copenhagen(哥本哈根大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);instruction tuning(abstract)

AI总结 提出PACT框架评估大语言模型在文化规范与个人偏好间的权衡,发现模型受国家背景影响大于年龄和性别,且人类对齐未能捕捉文化多元性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22676 2026-07-28 cs.AI cs.CL 新提交 91%

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究

James Elcock, William F. Shen, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。

Comments 21 pages, 7 figures (includes references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22622 2026-07-28 cs.CL cs.AI 新提交 91%

Learning When to Reason for Text-to-SQL via SFT and DPO

通过监督微调(SFT)和直接偏好优化(DPO)学习何时对文本到SQL进行推理

Soohyuk Jang, Jiheum Yeom, Nohil Park, Sang Hun Kim, Yoonyoung Choi, Kiwook Bae, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) AI Center, Samsung Electronics(三星电子人工智能中心) AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(首尔国立大学人工智能研究所、高级科学研究所以及综合纳米技术中心、信息存储研究中心和人工智能平台研究所)

专题命中 指令微调 :SFT(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究文本到SQL推理问题,提出AutoThinkSQL框架,集成自动思考机制到SFT和DPO中,使模型能根据查询难度动态调整推理,在基准测试中提升效果,减少输出令牌和延迟,让推理决策与查询难度匹配。

Comments 8 pages, 5 figures. Model checkpoints are available at https://huggingface.co/autothinksql

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10276 2026-08-12 cs.HC cs.CY 新提交 91%

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

针对学生数学隐喻回答的密码本引导编码任务微调大型语言模型

Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究通过LoRA微调开放权重LLM,使其在学生数学隐喻的密码本引导编码任务中性能提升,表现媲美甚至超越仅提示的专有模型,可用于数学教育的规模化AI辅助测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 91%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 指令微调 :SLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05156 2026-08-07 cs.CL 新提交 91%

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

支架介导的后训练:协同演化模型参数与程序性支架图

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对大型语言模型后训练中参数与推理支架脱节的问题,提出支架介导的后训练范式,通过协同演化实现技能提升,在FeatureBench上较标准SFT取得显著性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04697 2026-08-06 cs.AI 新提交 91%

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

基于ASRS报告的可追踪LLM生成航空系统运行安全分析危险场景

Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对航空系统运行安全分析,提出AI辅助方法结合ASRS报告,用LLM生成可追踪危险场景,通过进化溯因优化混合变体,经评估验证了模型与提示对生成场景有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27443 2026-07-31 cs.AI 新提交 91%

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

利用轨迹图实现智能体大语言模型系统的预执行错误诊断

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Arizona State University(亚利桑那州立大学) NEC Laboratories America(美国 NEC 实验室) Singapore Management University(新加坡管理大学)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出Trajectory Graph Copilot框架,以Graph Debugger为核心,通过预执行错误诊断提升LLM智能体完成长周期任务的能力,在多基准测试中平均提升14.69%通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22651 2026-07-28 cs.AI 新提交 91%

ARdena: Scenario-driven control of real-time LLM agents

ARdena:实时大语言模型智能体的场景驱动控制

Luka Borozan, Domagoj Matijević

机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19523 2026-07-23 cs.CL 新提交 91%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 91%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(abstract);foundation model(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22942 2026-06-23 cs.CL 新提交 91%

Understanding Knowledge Distillation in Post-Training: When It Helps and When It Fails

理解后训练中的知识蒸馏:何时有效与何时失败

Xin Liu, Simin Ma, Shujian Liu, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Lu Wang, Kaiqiang Song

机构 * University of Michigan(密歇根大学) Zoom Video Communications(Zoom视频通信公司)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统研究后训练阶段的知识蒸馏,发现低数据场景下KD优于SFT,但数据充足时优势减弱;从更强教师蒸馏可恢复增益,并提出两阶段KD策略提升数据稀缺环境下的学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11786 2026-06-11 cs.CL 新提交 91%

Lius: Translation Model Based Instructional Lingustic Using Continual Instruction Tuning In Kupang Malay

Lius:基于持续指令调优的库邦马来语教学语言学翻译模型

Joanito Agili Lopo, Yunita Sari, Guntur Budi Herwanto

机构 * Universitas Gadjah Mada(加札马达大学)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对低资源语言库邦马来语,提出利用双语词典的词汇和语义特征设计指令,并采用持续指令调优(CIT)范式微调大语言模型,在多个指标上超越基线4-6分,优于NMT和多语言LLM 10-13分。

Comments This paper is the result of the Master Thesis in Master of Artificial Intelligence at Universitas Gadjah Mada

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 91%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26027 2026-06-25 cs.CL cs.LG 新提交 91%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 91%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11206 2026-06-11 cs.CL cs.LG 新提交 91%

Compatibility-Aware Dynamic Fine-Tuning for Large Language Models

兼容性感知的动态微调用于大型语言模型

Yucheng Zhou, Junwei Sheng, Qianning Wang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学科技学院电脑与信息科学系及智慧城市物联网国家重点实验室) Auckland University of Technology(奥克兰理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出兼容性感知动态微调(CADFT),通过模型似然度动态调整监督更新,抑制不兼容样本的高方差梯度,提升训练稳定性和泛化能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08676 2026-06-09 cs.SE cs.AI cs.CL 新提交 91%

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

迷失在代码对话者的流程中:揭示代码任务中大语言模型的指令微调税

Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

机构 * Singapore Management University(新加坡国立管理学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 本研究首次实证发现指令微调在代码任务中导致权衡:增强指令遵循能力却削弱代码填充性能,称之为“指令微调税”,并通过定性和定量分析总结出七项发现和四项启示。

Comments 25 pages, 6 figures. Evaluation toolkit and dataset: https://github.com/arkosioscambions/CodeTalkers

详情

展开后加载摘要…

URL PDF HTML 收藏